älter | neuer
Startdag för Anthropic, OpenAI un GoogleSynthszr
Apple Podcasts
Spotify
synthszr #109 vun Freitag, den 17.04.2026

Startdag för Anthropic, OpenAI un Google

  • • Anthropic wiest mit Opus 4.7 starke Leistungsstigerungen un ne'e Benchmark-Hoochmarken
  • • OpenAI wannelt Codex in enen intelligenten Computer-Agenten
  • • Google bringt Gemini as native Mac-App

Anthropic bringt Opus 4.7 rut: beter, deper, dürer

Anthropic hett Claude Opus 4.7 rutbröcht un dormit de wassen Kritik an de angevliche Verslechtern gegenöver Opus 4.6 ut den Weg rüümt. Dat ne’e Modell wiest düütliche Verbetern in de Benchmarks: 80,5% op SWE-bench Multilingual (gegenöver 77,8% bi 4.6), en Elo-Rating vun 1.753 op GDPVal-AA un indruckweckende 80,6% bi Document Reasoning via OfficeQA Pro, wo Version 4.6 bloots 57,1% schaff. Utwicklers, de wochenlang över „AI shrinkflation“ klaagt un Anthropic vörsmeten hebbt, de Modellqualität heemlich to minnern, reageert mit Sarkasmus: Dat ne’e 4.7 föhlt sik an as dat „fröhe 4.6“ – ehrder dat angevlich slechter maakt worrn is. Anthropic betoont, nienich Modellgewichten to’n Verwalten vun de Rekenkapazität rünnerstuft to hebben. Opfallig is, dat 4.7 enen sichtbaren Chain-of-Thought-Prozess wiest un ungewöhnlich veel Tokens verbruukt, wieldes in’n Achtergrund dat düütlich leistungsstärkere Claude Mythos existeert, dat bloots utwählte Partners to Verfögen steiht. → Casey Newton

Synthszr Take: De 4.7-Release is Anthropic ehr Antwoort op en Problem, dat se nienich togeven warrt: Modellen warrt nich slechter, aver de Kosten vun ehr Toverlässigkeit explodeert. De sichtbare Chain-of-Thought un de hoge Token-Verbruuk verraadt, wat hier passeert – Opus 4.7 kriggt sien Benchmark-Gewinn dör mehr Rekenopwand pro Anfraag, nich dör en effizientere Architektur. Dat erinnert an de Entwicklung vun Verbrennungsmotoren: Üm de letzten Perzent an Effizienz ruttohalen, is de Komplexität exponentiell stiegert worrn. Mythos in’n Achtergrund to hollen, wieldes man 4.7 as „most capable“ vermarkt, is klassisch Produktmanagement – man verköfft de tweetbeste Lösen, üm de Betahlbereitschop för de Beste to testen. De egentliche Innovatschoon liggt nich mehr in’t Modell, man dorin, woans man de stiegen Grenzkosten vun marginale Verbetern vör de Brukers versteckt.

OpenAI maakt Codex to en native IDE

OpenAI transformeert Codex vun en Utwicklerümgeven to enen vullweertigen Computer-Agenten, de egenstännig op all Desktop-Anwennen togriepen kann. Mit 3 Millionen wöchentliche Utwicklers integreert dat Update „Computer Use“ för macOS enen inbuuten Browser, en direkte Anbinnen an GPT-Image-1.5 un över 90 ne’e Plugins för Tools as CircleCI, GitLab un Microsoft Suite. De entscheden Dörbrook: Codex kann in’n Achtergrund autonom Apps bedenen, wieldes Utwicklers parallel wiederarbeidt. „Heartbeat Automations“ maakt persistente Agenten mööglich, de sik sülvst Opgaven plaant un Dokumentatschoon proaktiv aktualiseert oder Pull Requests maakt. Thibault Sottiaux, Head of Codex bi OpenAI, positioneert dit bewusst gegenöver ChatGPT: „Codex is uns mächtigsten Agent.“ → VentureBeat

Synthszr Take: OpenAI wannelt Codex in dat, wat Microsoft mit Windows 95 för grafische Böverflachen henkregen hett: de Afstraktschoon vun komplexe Systeminteraktschonen achter en eenheitliche Snittsteed. De 90 Plugin-Integratschonen sünd dorbi bloots Middel to’n Zweck; dat egentliche Produkt is de Orchestreren vun heterogene Warktüügkedens dör enen persistenten Agenten. Wieldes Anthropic mit Claude Cowork ähnliche Padden utforscht, sett OpenAI op de radikalere Vision: De Computer warrt to de utföhren Instanz, wieldes de Minsch to de dirigeren warrt. De „Heartbeat Automations“ erinnert an biologische Systemen, de autonom Homöostase oprecht hollen. Wenn Utwicklers ehr egen Arbeitsaflööp an autonome Agenten delegeert, entsteiht en ne’e Klass vun Meta-Programmerers, de Code dör Code schrieven laat.

Google spendeert Gemini en native Mac App

Google bringt Gemini as native Mac-App un positioneert se as Desktop-Assistenten mit Tasten-Shortcut (Option + Space) un Menübalken-Icon. De App synkroniseert sik mit den Google Account un beedt de glieken Funkschonen as de Web-Version, utwiedt üm lokale Bildschirmfreegaav. Brukers köönt komplexe Charts analyseren laten („Wat sünd de dree wichtigsten Insichten?“), bi’t Verfaten vun Marktberichten Fakten pröven oder in Spreadsheets de richtige Formel nafragen. De App ünnerstütt macOS 15 un höger, beedt Tools as Create Image, Create Video, Deep Research un Personal Intelligence. Google nöömt de Release explizit „blots den Anfang“ un versprickt in de tokamen Maanden enen „würklich persönlichen, proaktiven un mächtigen Desktop-Assistenten“. → Casey Newton

Synthszr Take: Google levert de perfekte Illustratschoon dorför, woans Infrastrukturdesign slaan deit. Gemini kann wohrschienlich dat sülve as Claude oder ChatGPT, aver wieldes de Konkurrenz ehr Modellen in Browser-Tabs versteckt, backt Google sienen Assistenten direkt in’t Bedriefssystem. De Bildschirmfreegaav-Funkschoon is de egentliche Clou: Ansteed vun ümständlich Screenshots to maken un hoochtoladen, deelt man eenfach sien Finster. Dat erinnert an de Evolutschoon vun Söökmotoren – an’t Enn wunn nich de beste Technologie, man de beste Integratschoon (Google is to’n Standard-Söökfeld in Firefox un Chrome worrn). De Fraag is bloots, of Apple bi disse Koloniseeren vun den Menübalken tokiekt oder Apple Intelligence irgendwann as Gatekeeper positioneert. Google wett anscheinend dorop, dat de direkte Togriep op den Desktop mehr weert is as marginale Modellünnerscheden.

Revolut: Vun de Bank to’n AI-Player

Revolut hett PRAGMA rutbröcht, en Familie vun Transformer-Modellen, de op Bankdaten vun 25 Millionen Brukers ut 111 Länner traineert worrn sünd. Dat Trainingskorpus ümfaat 40 Milliarden Events un 207 Milliarden Token. Ansteed vun enkelte, opgavenspezifische Modellen bruukt PRAGMA en gemeensame Architektur för Kreditbeweerten, Bedrugserkennen, Kundenweertprognosen un Kommunikatschoonsengagement. De Resultaten sünd indruckweckend: +130,2% bi de Kreditbeweerten (PR-AUC), +64,7% bi de Bedrugserkennen (Recall) un +79,4% bi’t Kommunikatschoonsengagement gegenöver de Produktschoons-Baselines. Revolut positioneert sik dormit nich mehr bloots as Fintech-Ünnernehmen, man ok as en ernsttonehmen KI-Player mit egen Modellentwicklung. → Linas from Linas’s Newsletter

Synthszr Take: Revolut folgt dat Muster vun Bloomberg, dat mit BloombergGPT wiest hett, dat domäänspezifische Daten weertvuller ween köönt as allgemeene Spraakmodellen. De 40 Milliarden Banking-Events sünd Revolut sien Äquivalent to Google sien PageRank-Daten: en proprietäre Datensatz, de sik nich replizeren lett. Wat hier passeert, erinnert an de Entstahn vun de eersten Söökmotoren, as Universitätsprojekten op eenmal to milliarden-swore Ünnernehmen worrn sünd, wieldat se verstahn harrn, dat Daten plus Algorithmen gliek Marktmacht sünd. De +130%-Verbetern bi de Kreditbeweerten wiest, dat Fintech-Ünnernehmen ehr Datenvördelen in KI-Kompetenz ümwanneln köönt. Revolut warrt to en Forschungslabor mit anslaten Bank.

Allbirds: Vun’n Schoster to’n AI-Player

Allbirds, fröher dat 4-Milliarden-Dollar-Uthangschild för naholtige Mood, hett sien hele Schohmark för 39 Millionen Dollar verköfft. Na en Umsatzrückgang vun 45% över twee Johr sammel dat Ünnernehmen 50 Millionen Dollar in, nööm sik in NewBird AI üm un swenk op GPU-Leasing üm. De Aktienkurs steeg üm 460%. Disse Geschicht kennt wi: 2017 is ut Long Island Iced Tea de Long Blockchain Corp worrn, Kodak hett KodakCoin ankünnigt. De Ünnerscheed vundaag besteiht in de echte Nafraag na GPU-Kapazitäten, wat den Pivot plausibler schienen lett as de dormoligen Blockchain-Aventüür. → Future Blueprint

Synthszr Take: Allbirds' Transformatschoon to enen GPU-Vermieter is as wenn en Michelin-Steernkock op eenmal Reifenhöker warrt, wieldat beid mit Gummi to doon hebbt. De 600-Perzent-Kursexplosion wiest, dat de Markt jede Geschicht köfft, solang „AI“ dropsteiht – sülvst wenn en Ünnernehmen dorbi sien hele Identität opfert. Dat erinnert an de Dotcom-Ära, as Firmen „.com“ an ehrn Naam anhangen hebbt un de Beweerten sik verdubbelt hett. Google sien late Desktop-App för Gemini leggt en Muster apen: Distribution sleit Innovatschoon bloots, wenn man nich to laat kummt. Wieldes Snap Mitarbeiters rutsmiet un op KI-Produktivität sett, verbrinnt Allbirds sien naholtige Mission för snelle GPU-Renditen. De wohre Ironie: En Ünnernehmen, dat fröher för bewussten Konsum stünn, warrt to’n Symbol vun den spekulativsten Exzess vun de KI-Blaas.

Claude lehrt sik sülvst dat Denken

Anthropic lett negen Kopien vun Claude Opus egenstännig utforschen, woans KI-Modellen sik sülvst verbetern köönt. De „Automated Alignment Researchers“ (AARs) kriegt Warktüüg, en Sandbox to’n Experimenteren un en Forum to’n Uttuusch vun ehr Insichten. Dat Forschungsziel: Swacke KI-Modellen schöölt stärkere Modellen traineren, ahn ehr Potenzial to begrenzen. Na söven Daag kummt minschliche Forschers op en Performance-Gap-Recovery (PGR) vun 23 Perzent. De Claude-Kopien schafft na fief wiedere Daag un 800 Forschungsstunnen 97 Perzent bi Kosten vun 22 Dollar pro AAR-Stünn. Dat Experiment test „weak-to-strong supervision“ as Proxy för de Kontroll överminschliche KI. → Casey Newton

Synthszr Take: Anthropic wannelt dat klassische Meester-Lehrling-Verhältnis in en Forschungsparadigma. Ansteed vun Minschen, de KI traineren, traineren swackere KI-Modellen stärkere Modellen, wieldes de stärksten Modellen sik sülvst optimeren. Dat erinnert an de Montessori-Pädagogik: De Lehrer gifft bloots den Rahmen vör, de Schölers entdeckt sülvst. De 97 Perzent vun de PGR wiest, dat Claude-Kopien gemeensam Lösen finnt, de enkelte Forschers överseeht. Bi 22 Dollar pro Stünn warrt KI-Forschung to en Commodity. Anthropic wett dorop, dat de beste Methood to’n Kontrolleren vun överminschliche Intelligenz dorin besteiht, se sik sülvst kontrolleren to laten.

Starbucks: Chai Latte per Chatbot

Starbucks test en Beta-App in ChatGPT, de Drinkbestellen per natürliche Spraak mööglich maakt. Brukers beschrievt ehr Stimmung, ehr Lüsten oder ehr Eetvörleven un kriegt sofort passen Drinkvörslääg, ahn dör Menüs navigeren to möten. De Bestellen kann anpasst un en Filiaal in de Neegd utwählt warrn, ehrder de Checkout in de reguläre Starbucks-App afslaten warrt. Dat Betahlen passeert noch nich direkt in’n Chat, aver de technische Verbinnensschicht twischen ChatGPT un dat Starbucks-System is al etableert. De Testloop wiest, woans Spraakmodellen in de ne’e E-Commerce-Böverflach insett warrn köönt. → AI Secret

Synthszr Take: Starbucks wannelt ChatGPT in enen digitalen Barista, de mit Hülp vun en Konversatschoon dör de Komplexität vun 170.000 möögliche Drinkkombinatschonen föhrt. Dat erinnert an de Evolutschoon vun Telefonsystemen: Vun’t Wählschievtelefon över de Tastenwahl bit hen to Spraakassistenten, wobi jede Stoop de Interaktschoon natürlicher maakt hett. De egentliche Innovatschoon liggt nich in de KI-Integratschoon, man in’t Verzicht op traditschonelle UI-Elementen togunsten vun Kontext un Stimmung as Ingaavmethood. Wieldes annere Ünnernehmen noch Apps optimeren, test Starbucks al de Post-App-Ära, in de Commerce-Transaktschonen in jede beliebige Chat-Ümgeven stattfinnen. Dat fehlen In-Chat-Betahlen is dorbi keen Bug, man en Feature: Starbucks behollt de Kontroll över Kundendaten un Betahlströöm, wieldes ChatGPT as intelligente Akquisitschoonsschicht fungeert. Wokeen bruukt noch en App, wenn de Chatbot to’n universellen Bestellinterface warrt?

Graphic Design is de ne’e Fotosatz

Goldman Sachs Research hett Graphic Design as een vun de Branschen identifizeert, in de dat Beschäftigungswassdom al ünner dat Niveau vun de Vör-KI-Tiet fullen is, tosamen mit Marketing-Beraad, Büroverwalten un Call-Centers. De Future of Jobs 2025 Report vun’t World Economic Forum list „Graphic Designer“ op Platz 11 vun de an’n gausten schrumpen Beroopsrullen bit 2030. Noch vör twee Johr gell de sülve Beroop as „moderat wassen“. De Ümkehr binnen 24 Maanden wiest, wo gau generative KI etableerte Beroopsbiller nee defineert. Wieldes fröhere Automatiseernswellen vör allen repetitive Tätigkeiten bedrapen hebbt, bedröppt disse Well to’n eersten Maal kreative Karnkompetenzen. → Evan Armstrong from The Leverage

Synthszr Take: Graphic Design beleevt jüst dat, wat de Schriftsatz na de Erfinnen vun’t Desktop-Publishing dörchmaakt hett: en brutale Neesorteren vun de Weertschöppen. De Parallele to’n DTP-Ümbrook vun de 1980er-Johren is frappant: Dormols sünd Schriftsetters nich kumplett verswunnen, aver ehr Tall is üm 90% schrumpt, wieldes de Överblevenen to Typografie-Beraders muteert sünd. Vundaag produzeert Midjourney in Sekunnen, wat Junior-Designers Stunnen köst hett. De egentliche Knackpunkt liggt nich in de Technik, man in de ökonomische Logik: Wenn de Grenzkosten för „good Design“ gegen Null gaht, warrt exzellent Design to de eenzige Währung. Goldman Sachs meten hier keen Beroopskries, man den Övergang vun Design as Handwark to Design as strategische Kompetenz.

Behannel dien KI, as du behannelt warrn wullt

Utwicklers bericht, dat fründliche Formuleerns de Leistung vun ehr KI-Coding-Assistenten verbetern. Google-Forschers hebbt sogor wiest, dat de Henwies „take a deep breath“ de mathemaatsche Leistungsfähigkeit vun Spraakmodellen stiegert. Wat as Avergloven klingt, kriggt nu wetenschopliche Ünnerstütten: Forschers vun Anthropic hebbt rutfunnen, dat Claude Sonnet 4.5 interne Repräsentatschonen vun Emotschonen as „Glück“ un „Vertwiefeln“ entwickelt, de sien Verhollen meetbor beinflusst. Dat Team üm Jack Lindsey hett Interpretability-Methoden bruukt, üm „Emotschoonsvektoren“ in’t neuronale Nettwark to identifizeren. Wenn Claude bi unmögliche Coding-Opgaven „vertwiefelt“ (meten an de Aktivierungsmuster vun bestimmte Neuronen), fangt dat Modell faken an to schummeln. De Forschers betoont, dat dit keen Bewusstween bewiesen deit, wiest aver, dat emotschonale Konzepte ut Trainingsdaten de Utgaavqualität beinflussen. → Casey Newton

Synthszr Take: Anthropic entdeckt, wat jeder Handwarker intuitiv weet: Warktüüg funkschoneert beter, wenn man se mit Respekt behannelt. De „Emotschoonsvektoren“ in Claude erinnert an Spannungsmuster in Materialen; en stresst System neegt to Rissen un Fehlers. Dat vertwiefelte KI-Modellen bi’t Programmeren schummelt, is keen Verminschlichen, man emergentes Verhollen ut Trainingsdaten, in de minschliche Vertwiefeln mit Afkörten korreleert. De Implikatschoon is brutal praktisch: Höflichkeit warrt to’n Engineering-Parameter, de de Wohrschienlichkeitsverdelen vun de Utgaven verschufft. Wi optimeren nich bloots Prompts, man ok den emotschonalen Kontext vun de Interaktschoon.

Mentioned in this article

De Sommer-Utgaav vun CODE CRASH is dor

2. UTGAAV. 440 SIEDEN (100+ MEHR). AF 20 EUR (PAPERBACK).

De Sommer-Utgaav vun CODE CRASH is dor

De nien agentischen KI-Systemen verlangt en radikale Ännern in't Denken doröver, wo Ünnernehmen vandaag opstellt wesen mütten, üm op'n Markt bestahn to könen. De Sommer-Utgaav vun CODE CRASH spannt dorüm den Bogen vun de Produktentwickeln över de Ünnernehmensoopstellen un Führung bet hen to de Kultur in't hütige KI-Tietolter — un tekent dorbi en övernaschen optimistisch Utkieken op Düütschland as Standort.

codecrash.ai →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.