älter | neuer
Claude Mythos Benchmarks schockeert de Konkurrenz, man Meta blifft in't SpeelSynthszr
Apple Podcasts
Spotify
synthszr #101 vun Donnerstag, den 09.04.2026

Claude Mythos Benchmarks schockeert de Konkurrenz, man Meta blifft in't Speel

  • • Claude Mythos sleiht de Konkurrenz mit 77,8% op SWE-Bench Pro.
  • • Claude Managed Agents revolutschoneert de Ünnernehmens-KI mit integreerte Infrastruktur.
  • • Meta stellt Muse Spark vör, en stark KI-Modell för verschedene Anwennensrebeden.

77,8 op SWE-Bench: Claude Mythos pulveriseert de Konkurrenz

Anthropic wiest mit Claude Mythos Preview, wat passeert, wenn en KI-Modell to good för den apenen Markt warrt. Dat nich-publizeerte Frontier-Modell, dat Hartstück vun Anthropics Project Glasswing Cybersecurity-Initiative, reckt 77,8% op SWE-bench Pro – en Sprung vun 24 Punkten gegenöver dat apen verfügbore Opus 4.6 (53,4%). Op SWE-bench Verified kratzt Mythos an de 94%-Mark, bi multimodale Coding-Opgaven verdubbelt dat de Leistung vun sien Vörgänger vun 27,1% op 59,0%. De Reasoning-Benchmarks vertellt desülvige Geschicht: 56,8% op Humanity’s Last Exam ahn Tools, woneem Opus 4.6 bi 40% steken blifft. Mythos Preview blifft op en slaten Grupp vun Sekerheitspartners un Grootünnernehmen beschränkt – Anthropic nennt de Dual-Use-Risiken vun de Cybersecurity-Fähigkeiten as Grund. → AI Secret

Synthszr Take: Anthropic höllt Mythos Preview trügg, wiel dat Glasswing-Konsortium de Sekerheitslücken dichten mutt, de Mythos bi sien egene Entwicklung opdeckt hett. De Beschränkung op Sekerheitspartners un Grootünnernehmen is en Schoonfrist. Wat de Benchmark-Tallen wiest, is en anner Kaliber. SWE-bench Pro: 77,8% för Mythos, 53,4% för Opus 4.6. Multimodales Coding: vun 27,1% op 59,0%. Humanity’s Last Exam: 56,8% ahn Tools, Opus 4.6 bi 40%. Dat sünd Sprüng, de sik kuum dör stappenwies Verbetern verkloren laat. Anthropic schient den Kipppunkt överschreeden to hebben, vun den an Modellen jemehr egene Wiederentwicklung aktiv versnellt. Dat Modell verbetert sik vun sülvst. Wenn dat, wat de Tallen andüüdt, stimmt, treckt dat Entwicklungstempo vun binnen her an, andreven vun de Modellen sülvst; dat is dat, wat würklich verwunnert.

Claude Managed Agents: Anthropic warrt to en Infrastruktur-Firma

Anthropic start de apen Beta vun Claude Managed Agents, en Deenst, de Ünnernehmen dat mööglich maakt, KI-Agenten direkt op Anthopics Plattform to entwickeln un to bedrieven. Bitlang hett dat Ünnernehmen vör allen Modellen anbaden, mit de Brukers egene Agenten boen kunnen. Mit Managed Agents abstraheert Anthropic de hele Infrastrukturkomplexität: Sandboxing, Authentifizeren, Credential-Management un mehrstünnige Utföhrstieden sünd al integreert. De Priesgestalten is transparent: Standard-API-Tokenpriesen plus 0,08 Dollar pro aktive Session-Stünn. Fortschrëdene Features as Multi-Agent-Orchestreren un Sülvstevaluatschoon blievt eerstmal in en inschränkte Research Preview. → thenewstack.io

Synthszr Take: Anthropic maakt densülvigen Tog as Amazon mit AWS vör 20 Johr: statt blots Technologie to verköpen, warrt de operative Komplexität to’n Produkt. De maandelange Infrastrukturarbeit för produktionsriepe Agenten (Sandboxing, Checkpointing, Tracing) weer bitlang de Flaschenhals för de Enterprise-Adoption. Anthropic verwannelt disse Hürd in en Abo-Modell mit 0,08 Dollar pro Stünn. Dat erinnert an de fröhen Cloud-Daag, as Ünnernehmen markt hebbt, dat se keen egen Rekenzentren mehr bruken deen. De strategische Schachstreek is klook: Wieldat OpenAI un Google üm Modell-Leistung kämpft, boot Anthropic de Mautstraat, op de all Agenten föhren warrt. De wohre Macht liggt nich in’t beste Modell, man in de Kontroll över de Utföhrümgeven.

Meta blifft in’t Speel: Muse Spark un de Kamp üm den Superintelligence-Stack

Meta hett mit Muse Spark en neet KI-Modell vörstellt, na’t maandelang Gerüchten över Performance-Problemen un Verspätungen geev. CEO Mark Zuckerberg hett op Threads de Stärken in Rebeden as Gesundheit, Social Content, Shopping un Gaming betoont – en kloor Signal för de Consumer-Utrichten. De Börs reageer mit en Plus vun 6,5 Perzent op de Meta-Aktie. Dat Team ünner Ex-Scale-AI-CEO Alexandr Wang hett na Milliarden-Investitschonen levert. De egene Kampansage richt sik aver gegen OpenAI: Wieldat Anthropic den Enterprise-Markt domineert, blifft OpenAI blots noch Warf as Wassdomsdriever. Meta hett hier en entscheden Vördeel: 3,5 Milliarden Brukers op de egen Plattformen un johrteihntelange Expertise in’t digitale Anzeigen-Geschäft. → Martin Peers

Synthszr Take: Meta speelt en anner Speel, as all glöövt. Wieldat OpenAI un Anthropic üm de Frontier-Modellen kämpft, boot Zuckerberg an de egene Superintelligence-Infrastruktur: en Stack ut Modell, Verdelen un Monetariseren, de sik sülvst finanzeert. De 3,5 Milliarden Brukers sünd nich blots Reckwied, man ok en gigantisch RLHF-Labor, in dat jedeen Klick dat nächste Modell traineert. OpenAIs Droom vun’t Warfgeschäft wirkt dorgegen as de Versöök vun en Michelin-Restaurant, mit McDonald’s in’t Burger-Laden-Business to konkurreren. De wohre Innovatschoon bi Muse Spark liggt nich in de Benchmarks, man in de Integratschoon: En Modell, dat Shopping, Gaming un Social Content „besünners good“ kann, is keen Chatbot – dat is en Transaktschoonsmaschien. Meta mutt nich dat beste Modell hebben, man blots dat profitabelste.

Chineesche Anbeders drückt wieder de Token-Priesen

Dat chineesche Ünnernehmen Z.ai hett mit GLM-5.1 en Spraakmodell publizeert, dat 94,6% vun de Coding-Leistung vun Claude Opus reckt – bi blots en Drüddel vun de Kosten. Dat 744-Milliarden-Parameter-Mixture-of-Experts-Modell is vullstännig op 100.000 Huawei Ascend-Chips traineert worrn, ahn en enkelten Nvidia-Prozesser. Dat Modell arbeidt bet to acht Stünnen autonom an enkelte Programmeeropgaven, vun de Planung bet to’n Testen. Mit en Score vun 58,4 op SWE-Bench Pro sleiht dat GPT-4 un Gemini 1.5 Pro. De Gewichten sünd ünner MIT-Lizenz free verfügbar. → Unwind AI

Synthszr Take: Z.ai wiest, wat in de Halfleiderindustrie as „Second Source Strategy“ bekannt is: Alternative Leveranten drückt Priesen un breekt Monopolen op. De 94,6%-Formel klingt na klassischen B2B-Verkoop („meist jüst so good, man düütlich günstiger“), man hier geiht dat üm mehr. Huaweis Ascend-Chips möögt technisch ünnerlegen ween, man för Training un Inference reckt se anscheinend. Dat erinnert an de PC-Revolutschoon vun de 80er: IBM-kompatible Rekners weern nienich beter as dat Original, blots good noog un verfügbar. Wenn KI-Leistung to en uttuuschbore Ware warrt, entscheedt Kosten un Leverketten över de Marktandelen, nich Benchmarks.

Token-Priesen fallt, man Trainingskosten nich

Anthropic hett letzte Week den Togang vun Drüddanbeder-Tools op Claude Pro un Max-Abonnements kappt. De Reakschoon weer vörhersehbar: Entwicklers protesteern, Kommentaters snacken vun Umsatzschuul. Luo Fuli, de dat MiMo-Spraakmodell-Team bi Xiaomi leidt, sehg dorin wat anners: den unvermeidlichen Kollaps vun en Priesstruktur, de för Chat-Interaktschonen mit en poor hunnert Token entwickelt weer, man Agent-Workloads mit den 10- bet 100-fachen Token-Verbruuk subventschoneert. En Claude Max-Abonnent hett in en enkelten Afrekenszyklus över 5.600 Dollar an API-Kosten genereert bi en Maandsgebühr vun 100 Dollar – en Subventschoonsverhältnis vun 25 to 1. De strukturelle Oorsaak: Drüddanbeder-Frameworks as OpenClaw schütt bi jedeen Brukeranfraag mehrfache Tool-Calls mit je över 100.000 Token af, komprimeert all dree Stappen vun’n Kontext un maakt dormit Claudes Cachesystem kaputt. In China wiest sik datsülvige Muster: Alibabas Pro-Tarif is jeden Dag üm 9:30 Uhr utverkööft, Tencents Slots sünd duerhaft vergrepen, wieldat drosselte Snelligkeiten un Quota-Walls op en Markt ünner extremen Kostendruck henwiest. → Hello China Tech

Synthszr Take: De KI-Branche beleevt jüst ehr egene Version vun de Tragödie vun de Allmende, blots dat de Weid hier ut GPU-Zyklen besteiht un de Schaap Code-Agents sünd. Dat Geschäftsmodell is as en All-you-can-eat-Buffet, bi dat op eenmal Wetteters opduukt: De statistische Verdelen twüschen Af-un-to-Brukers un Veelbrukers, op de jedeen Abo-Modell baseert, brickt tohoop, wenn jedeen Bruker dör ineffiziente Frameworks to’n Power-User warrt. China sien överhitt’te Coding-Plan-Märkt, woneem Entwicklers Weckers stellt un Auto-Purchase-Scripts schrieft, wiest de Konsequenz: künstliche Verknappen as Nootbrems gegen ökonomischen Sülvstmoord. Luo Fulis Analys dröppt den Karn: Pien schafft Ingenieurskunst – eerst wenn de wohren Kosten sichtbor warrt, entsteiht de Druck för effizient Context-Management un Cache-Optimisatschoon. De Branche mutt vun de Token-Pries-Obsession to de Token-Effizienz-Disziplin övergahn, sünst freet de egen Effizienzverspreken dat Geschäftsmodell op.

Neuro-symbolische KI: De nächste Dörbrook bi de Token-Kosten?

Forschers vun de Tufts University hebbt en KI-System entwickelt, dat den Energieverbruuk üm bet to 100x minnert un dorbi de Genaudigkeit verbetert. De neuro-symbolische KI kombineert neuronale Netten mit minschenähnlichen logischen Denken. In’n Tower-of-Hanoi-Test hett dat System en 95% Spoodrate reckt (Standard-KI: 34%) un bruuk blots 34 Minuten Training statt 36 Stünnen. De Clou: Statt dör endlos Trial-and-Error to lehren, bruukt dat System abstrakte Konzepte as Form un Balance. Professor Matthias Scheutz verklort, dat VLA-Modelle (Visual-Language-Action) so nich mehr raden mööt, welk Schadden to welk Block höört. KI-Systemen verbruukt al över 10% vun de US-Stroomprodukschoon, bet 2030 schall sik de Bedarf verdubbeln. → TAAFT - There’s An AI For That

Synthszr Take: De Tufts-Forschers reaktiveert en Debatt ut de 1980er Johren: Symbolische KI gegen Konnekschonismus, ditmal mit en Twist. Wieldat OpenAI un Anthropic op jümmer gröttere Modellen sett (GPT-5 schall en lütte Stadt versorgen künnen), wiest dat Team üm Scheutz, dat hybride Architekturen de egene Innovatschoon sünd. Dat erinnert an de Entwicklung vun Flegers: De Bröder Wright hebbt op aerodynaamsche Prinzipien sett statt op jümmer stärkere Motoren. Neuro-symbolische Systemen kunnen de „Functions-on-Demand“ vun de KI warrn, bi de Reasoning-Modulen je na Opgaav toschalt warrt. De 100x-Energieinsparnis maakt ut en Kostenproblem op eenmal en Wettbewarvsvördeel.

XPeng smitt Nvidia rut: Chinas Autobauers schrievt jemehr egene Chip-Geschicht

XPeng hett de Transformatschoon afslaten: De överarbeidte Version vun den Mona M03, jemehr meistverkööft Elektroauto, löppt nu mit den huusegenen Turing-Prozesser statt mit Nvidia-Chips. De Wessel bedröppt de middleren un böveren Modellvarianten mit intelligente Fohrfunkschonen un markeert dat Enn vun de Nvidia-Afhängigkeit in de hele Karnflott vun XPeng. De Mona M03 is in’n August 2024 to Priesen twüschen 110.000 un 150.000 Yuan start un hett bet Oktober 2025 över 200.000 Utlevern in blots 14 Maanden reckt. De Turing-Chips kaamt ok in en gemeensam mit Volkswagen entwickelt Fohrtüüg to’n Insatz, dat bi Volkswagen Anhui produzeert warrt. Parallel dorto hett de Konkurrent Nio dör egene Chips de Kosten pro Fohrtüüg üm ca. 10.000 Yuan senkt, as dat Ünnernehmen in’n Juni 2025 bekannt geev. → Caixin Global

Synthszr Take: XPeng maakt vör, wat in de Automobilbranche to’n neen Playbook warrt: Chip-Souveränität as Wettbewarvsvördeel. De Analogie to Apples M-Prozessers drängt sik op, man hier geiht dat üm mehr as blots Margen. Chineesche Autobauers behannelt jemehr ADAS-Chips as Coca-Cola sien Rezeptur: to wichtig för Frömdvergaav. De Turing-Deal mit Volkswagen wiest, dat XPeng nich blots Nvidia loswarrn, man ok sülvst to’n Tolieferer warrn will. Wat as Risikominimeren anfüng (weniger Afhängigkeit vun US-Technologie), muteert to’n Geschäftsmodell. De Ironie: Nvidia hett den Markt so good vörbereidt, dat de Kunnen nu sülvst boot.

Websiet-Grött warrt för Google irrelevant — dat Timing is verdächtig

Google publizeert en Podcast, in den Gary Illyes un Martin Splitt verklort, worüm de wassen Grött vun Websieden keen Problem dorstellt. De zentrale Thees: Page Weight weer en unzuverlässige Metrik, wiel de Meetmethoden varieert un „Excess Weight“ faken nüttliche Inhalten weern. Splitt ünnerscheedt twüschen rein HTML (Googlebot crawlt maximal 2 MB), komprimeerte Daten in’t Nettwark (5–6 MB) un dekomprimeerte Daten bi’n Bruker (10 MB). En 15-MB-groot HTML-Dokument weer akzepteerbor, wenn „pretty much most of these 15 megabytes are actually useful content“. De entscheidene Fraag weer nich de absolute Grött, man dat Verhältnis vun Markup to Content – wobi ok Metadaten för Drüddanbeder-Tools oder regulatorische Anfordern as „useful content“ gellen kunnen. → STACKED MARKETER

Synthszr Take: Google relativeert Page Weight jüst in den Moment, in den de egen Produkten jümmer opblähteter warrt. Dat erinnert an Tabakherstellers, de Studien över de gesundheitlichen Vördelen vun Nikotin finanzeert. De Argumentatschoon folgt en bekannt Muster ut de Plattform-Ökonomie: Eerst Standards setten (2-MB-Crawl-Limit), denn de Düüdenshoheit över dat Meten beansproken („dat gifft keen eenheitliche Definitschoon“), toletzt de egen Verstöten legitimeren („useful content“). Wat Google hier as technische Opklärung verkööpt, is klassisch Gaslighting: De Realität vun en Median-Siedengrött vun 2,3 MB warrt dör semantische Verwirren („komprimeert“ vs. „dekomprimeert“) vernevelt. De wohre Grund för sware Sieden sünd nich nüttliche Inhalten, man Tracking-Scripts, Ad-Tech un de endlose Kaskade vun JavaScript-Frameworks. Google weet dat – un profiteert dorvun.

Mentioned in this article

De Sommer-Utgaav vun CODE CRASH is dor

2. UTGAAV. 440 SIEDEN (100+ MEHR). AF 20 EUR (PAPERBACK).

De Sommer-Utgaav vun CODE CRASH is dor

De nien agentischen KI-Systemen verlangt en radikale Ännern in't Denken doröver, wo Ünnernehmen vandaag opstellt wesen mütten, üm op'n Markt bestahn to könen. De Sommer-Utgaav vun CODE CRASH spannt dorüm den Bogen vun de Produktentwickeln över de Ünnernehmensoopstellen un Führung bet hen to de Kultur in't hütige KI-Tietolter — un tekent dorbi en övernaschen optimistisch Utkieken op Düütschland as Standort.

codecrash.ai →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.