älter | neuer
Benchmarky Claude Mythos šokují konkurenci, ale Meta zůstává ve hřeSynthszr
Apple Podcasts
Spotify
synthszr #101 z čtvrtek 9. dubna 2026

Benchmarky Claude Mythos šokují konkurenci, ale Meta zůstává ve hře

  • • Claude Mythos překonává konkurenci se 77,8 % na SWE-Bench Pro.
  • • Claude Managed Agents přináší revoluci v podnikové AI díky integrované infrastruktuře.
  • • Meta představuje Muse Spark, výkonný model AI pro rozmanité oblasti použití.

77,8 na SWE-Bench: Claude Mythos drtí konkurenci

Anthropic s Claude Mythos Preview ukazuje, co se stane, když je model AI příliš dobrý pro veřejný trh. Nevydaný frontier model, jádro kyberbezpečnostní iniciativy Project Glasswing od Anthropic, dosahuje 77,8 % na SWE-bench Pro – což je skok o 24 bodů oproti veřejně dostupnému Opus 4.6 (53,4 %). Na SWE-bench Verified se Mythos blíží hranici 94 %, v multimodálních úlohách kódování zdvojnásobuje výkon svého předchůdce z 27,1 % na 59,0 %. Benchmarky pro usuzování vyprávějí stejný příběh: 56,8 % na Humanity’s Last Exam bez nástrojů, kde Opus 4.6 uvízl na 40 %. Mythos Preview zůstává omezen na uzavřenou skupinu bezpečnostních partnerů a velkých podniků – Anthropic jako důvod uvádí rizika dvojího užití kyberbezpečnostních schopností. → AI Secret

Synthszr Take: Anthropic drží Mythos Preview zpátky, protože konsorcium Glasswing musí zacelit bezpečnostní díry, které Mythos odhalil během svého vlastního vývoje. Omezení na bezpečnostní partnery a velké podniky je jen odklad. To, co ukazují čísla z benchmarků, je úplně jiná liga. SWE-bench Pro: 77,8 % pro Mythos, 53,4 % pro Opus 4.6. Multimodální kódování: z 27,1 % na 59,0 %. Humanity’s Last Exam: 56,8 % bez nástrojů, Opus 4.6 na 40 %. To jsou skoky, které lze jen stěží vysvětlit postupnými vylepšeními. Zdá se, že Anthropic překročil bod zlomu, od kterého modely aktivně zrychlují svůj vlastní další vývoj. Model se zlepšuje sám. Pokud je pravda to, co čísla naznačují, tempo vývoje se zrychluje zevnitř, poháněné samotnými modely; to je to, co je skutečně ohromující.

Claude Managed Agents: Anthropic se stává infrastrukturní firmou

Anthropic spouští veřejnou beta verzi služby Claude Managed Agents, která firmám umožňuje vyvíjet a provozovat AI agenty přímo na platformě Anthropic. Dosud společnost nabízela především modely, s nimiž si uživatelé mohli stavět vlastní agenty. S Managed Agents Anthropic abstrahuje veškerou složitost infrastruktury: sandboxing, autentizace, správa přihlašovacích údajů a několikahodinové doby provádění jsou již integrovány. Ceny jsou transparentní: standardní ceny za tokeny API plus 0,08 dolaru za hodinu aktivní session. Pokročilé funkce, jako je orchestrace více agentů a sebehodnocení, zůstávají prozatím v omezené Research Preview. → thenewstack.io

Synthszr Take: Anthropic dělá stejný krok jako Amazon s AWS před 20 lety: místo aby jen prodával technologii, mění provozní složitost v produkt. Měsíce práce na infrastruktuře pro produkční agenty (sandboxing, checkpointing, tracing) byly dosud úzkým hrdlem pro adopci v podnikovém sektoru. Anthropic tuto překážku mění v model předplatného za 0,08 dolaru na hodinu. To připomíná rané dny cloudu, kdy si firmy uvědomily, že už nepotřebují vlastní datová centra. Strategický tah je chytrý: zatímco OpenAI a Google bojují o výkon modelů, Anthropic buduje zpoplatněnou dálnici, po které budou jezdit všichni agenti. Skutečná síla nespočívá v nejlepším modelu, ale v kontrole nad prováděcím prostředím.

Meta zůstává ve hře: Muse Spark a boj o superinteligenční stack

Meta představila nový model AI Muse Spark poté, co se měsíce šířily zvěsti o problémech s výkonem a zpožděních. CEO Mark Zuckerberg na Threads zdůraznil silné stránky v oblastech jako zdraví, sociální obsah, nakupování a hraní her – což je jasný signál zaměření na spotřebitele. Burza zareagovala růstem akcií Mety o 6,5 procenta. Tým pod vedením bývalého CEO Scale AI Alexandra Wanga po miliardových investicích dodal výsledky. Skutečné vyhlášení války je ale namířeno proti OpenAI: zatímco Anthropic dominuje podnikovému trhu, OpenAI zbývá jako motor růstu už jen reklama. Meta zde má rozhodující výhodu: 3,5 miliardy uživatelů na vlastních platformách a desetiletí zkušeností v digitálním reklamním byznysu. → Martin Peers

Synthszr Take: Meta hraje jinou hru, než si všichni myslí. Zatímco OpenAI a Anthropic bojují o frontier modely, Zuckerberg buduje skutečnou infrastrukturu pro superinteligenci: stack modelu, distribuce a monetizace, který se financuje sám. Těch 3,5 miliardy uživatelů není jen dosah, ale také gigantická RLHF laboratoř, kde každý klik trénuje další model. Sen OpenAI o reklamním byznysu proti tomu vypadá jako pokus michelinské restaurace konkurovat McDonald’s v prodeji burgerů. Skutečná inovace u Muse Spark nespočívá v benchmarcích, ale v integraci: model, který umí „obzvláště dobře“ nakupování, hraní her a sociální obsah, není chatbot – je to transakční stroj. Meta nemusí mít nejlepší model, stačí jí mít ten nejziskovější.

Čínští poskytovatelé nadále tlačí ceny tokenů dolů

Čínská společnost Z.ai vydala jazykový model GLM-5.1, který dosahuje 94,6 % kódovacího výkonu Claude Opus – za pouhou třetinu nákladů. Tento model typu Mixture-of-Experts s 744 miliardami parametrů byl kompletně natrénován na 100 000 čipech Huawei Ascend, bez jediného procesoru Nvidia. Model pracuje až osm hodin autonomně na jednotlivých programátorských úkolech, od plánování po testování. S hodnocením 58,4 na SWE-Bench Pro překonává GPT-4 a Gemini 1.5 Pro. Váhy jsou volně dostupné pod licencí MIT. → Unwind AI

Synthszr Take: Z.ai demonstruje to, co je v polovodičovém průmyslu známé jako „Second Source Strategy“: alternativní dodavatelé stlačují ceny a rozbíjejí monopoly. Formule 94,6 % zní jako klasický B2B prodej („skoro stejně dobré, ale výrazně levnější“), ale tady jde o víc. Čipy Ascend od Huawei mohou být technicky horší, ale pro trénování a inferenci zjevně stačí. To připomíná PC revoluci 80. let: počítače kompatibilní s IBM nikdy nebyly lepší než originál, jen dostatečně dobré a dostupné. Když se výkon AI stane zaměnitelným zbožím, o tržních podílech rozhodují náklady a dodavatelské řetězce, nikoliv benchmarky.

Ceny tokenů klesají, ale náklady na trénování ne

Anthropic minulý týden zablokoval přístup nástrojů třetích stran k předplatným Claude Pro a Max. Reakce byla předvídatelná: vývojáři protestovali, komentátoři mluvili o ochraně příjmů. Luo Fuli, která vede tým jazykového modelu MiMo v Xiaomi, v tom viděla něco jiného: nevyhnutelný kolaps cenové struktury, která byla navržena pro chatové interakce s několika stovkami tokenů, ale dotuje pracovní zátěže agentů s 10 až 100násobnou spotřebou tokenů. Jeden předplatitel Claude Max vygeneroval v jediném fakturačním cyklu náklady na API přes 5 600 dolarů při měsíčním poplatku 100 dolarů – poměr dotace 25 ku 1. Strukturální příčina: frameworky třetích stran jako OpenClaw při každém uživatelském dotazu spouští několik volání nástrojů, každé s více než 100 000 tokeny, komprimují všechny tři kroky kontextu a tím ničí cache systém Claude. V Číně se projevuje stejný vzorec: tarif Pro od Alibaby je každý den v 9:30 vyprodaný, sloty od Tencent jsou trvale obsazené, zatímco omezené rychlosti a kvóty ukazují na trh pod extrémním nákladovým tlakem. → Hello China Tech

Synthszr Take: Odvětví AI právě zažívá svou vlastní verzi tragédie obecní pastviny, jenomže pastvinu zde tvoří cykly GPU a ovcemi jsou kódovací agenti. Obchodní model se podobá all-you-can-eat bufetu, kde se náhle objeví soutěžní jedlíci: statistické rozložení mezi příležitostnými a náročnými uživateli, na kterém je založen každý model předplatného, se hroutí, když se každý uživatel kvůli neefektivním frameworkům stane power-userem. Přehřáté trhy s kódovacími plány v Číně, kde si vývojáři nastavují budíky a píší skripty pro automatické nákupy, ukazují důsledek: umělé omezování jako nouzová brzda proti ekonomické sebevraždě. Analýza Luo Fuli trefuje jádro: bolest plodí inženýrské umění – teprve když se zviditelní skutečné náklady, vznikne tlak na efektivní správu kontextu a optimalizaci cache. Odvětví musí přejít od posedlosti cenou tokenů k disciplíně efektivity tokenů, jinak vlastní sliby efektivity sežerou celý obchodní model.

Neuro-symbolická AI: Další průlom v nákladech na tokeny?

Vědci z Tufts University vyvinuli systém AI, který snižuje spotřebu energie až 100krát a zároveň zlepšuje přesnost. Neuro-symbolická AI kombinuje neuronové sítě s logickým myšlením podobným lidskému. V testu Tower of Hanoi dosáhl systém 95% úspěšnosti (standardní AI: 34 %) a potřeboval pouze 34 minut tréninku místo 36 hodin. Pointa: místo aby se učil nekonečným stylem pokus-omyl, systém využívá abstraktní koncepty jako tvar a rovnováha. Profesor Matthias Scheutz vysvětluje, že VLA modely (Visual-Language-Action) tak už nemusí hádat, který stín patří ke kterému bloku. Systémy AI již spotřebovávají více než 10 % americké produkce elektřiny a do roku 2030 se má tato potřeba zdvojnásobit. → TAAFT - There’s An AI For That

Synthszr Take: Vědci z Tufts University oživují debatu z 80. let: symbolická AI proti konekcionismu, tentokrát s novým zvratem. Zatímco OpenAI a Anthropic sázejí na stále větší modely (GPT-5 by prý mohl napájet malé město), tým kolem Scheutze ukazuje, že skutečnou inovací jsou hybridní architektury. To připomíná vývoj letadel: bratři Wrightové vsadili na aerodynamické principy místo na stále silnější motory. Neuro-symbolické systémy by se mohly stát „Functions-on-Demand“ v oblasti AI, kde se moduly pro usuzování zapínají podle potřeby daného úkolu. Úspora energie 100x náhle mění problém nákladů v konkurenční výhodu.

XPeng se zbavuje Nvidie: Čínské automobilky píší vlastní historii čipů

XPeng dokončil transformaci: přepracovaná verze Mona M03, jejich nejprodávanějšího elektromobilu, nyní běží na vlastním procesoru Turing místo čipů Nvidia. Změna se týká středních a vyšších variant modelů s inteligentními jízdními funkcemi a značí konec závislosti na Nvidii v celé hlavní flotile XPeng. Mona M03 byl uveden na trh v srpnu 2024 za ceny mezi 110 000 a 150 000 juany a do října 2025 dosáhl více než 200 000 dodaných vozů za pouhých 14 měsíců. Čipy Turing se používají také ve vozidle vyvinutém společně s Volkswagenem, které se vyrábí v závodě Volkswagen Anhui. Současně konkurent Nio díky vlastním čipům snížil náklady na vozidlo o přibližně 10 000 juanů, jak společnost oznámila v červnu 2025. → Caixin Global

Synthszr Take: XPeng ukazuje, co se v automobilovém průmyslu stává novým manuálem: suverenita v oblasti čipů jako konkurenční výhoda. Nabízí se analogie s procesory M od Applu, ale tady jde o víc než jen o marže. Čínské automobilky zacházejí se svými čipy ADAS jako Coca-Cola se svou recepturou: je to příliš důležité na to, aby se to svěřilo někomu jinému. Dohoda o Turingu s Volkswagenem ukazuje, že XPeng se nechce jen zbavit Nvidie, ale chce se sám stát dodavatelem. To, co začalo jako minimalizace rizika (menší závislost na amerických technologiích), se mění v obchodní model. Ironií je, že Nvidia připravila trh tak dobře, že si zákazníci nyní staví sami.

Velikost webových stránek se pro Google stává irelevantní – načasování je podezřelé

Google vydal podcast, ve kterém Gary Illyes a Martin Splitt vysvětlují, proč rostoucí velikost webových stránek nepředstavuje problém. Centrální teze: Page Weight je nespolehlivá metrika, protože metody měření se liší a „nadměrná váha“ často obsahuje užitečný obsah. Splitt rozlišuje mezi čistým HTML (Googlebot prochází maximálně 2 MB), komprimovanými daty v síti (5–6 MB) a dekomprimovanými daty u uživatele (10 MB). HTML dokument o velikosti 15 MB je prý přijatelný, pokud „pretty much most of these 15 megabytes are actually useful content“. Rozhodující otázkou není absolutní velikost, ale poměr mezi značkováním a obsahem – přičemž i metadata pro nástroje třetích stran nebo regulační požadavky by mohla být považována za „užitečný obsah“. → STACKED MARKETER

Synthszr Take: Google relativizuje Page Weight přesně v okamžiku, kdy se jeho vlastní produkty stávají stále nabobtnalějšími. To připomíná tabákové společnosti financující studie o zdravotních přínosech nikotinu. Argumentace sleduje známý vzorec z platformové ekonomiky: nejprve stanovit standardy (limit 2 MB pro procházení), poté si nárokovat výkladovou suverenitu nad měřením („neexistuje jednotná definice“) a nakonec legitimizovat vlastní prohřešky („užitečný obsah“). To, co Google zde prodává jako technické vysvětlení, je klasický gaslighting: realita mediánové velikosti stránky 2,3 MB je zamlžena sémantickým zmatením („komprimované“ vs. „dekomprimované“). Skutečným důvodem velkých stránek není užitečný obsah, ale sledovací skripty, Ad-Tech a nekonečná kaskáda JavaScriptových frameworků. Google to ví – a profituje z toho.

Mentioned in this article

Letní edice CODE CRASH je tady

2. VYDÁNÍ. 440 STRAN (100+ NAVÍC). OD 20 EUR (PAPERBACK).

Letní edice CODE CRASH je tady

Nové agentické systémy umělé inteligence vyžadují radikální změnu myšlení o tom, jak musí být dnešní firmy organizovány, aby mohly na trhu úspěšně obstát. Letní edice CODE CRASH proto překlenuje oblouk od vývoje produktů přes firemní strukturu a vedení až po kulturu v dnešní době umělé inteligence — a přináší přitom překvapivě optimistický výhled na Německo jako podnikatelské místo.

codecrash.ai →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.