Šok Kimi 3: Alibaba vstupuje do ringu, poptávka exploduje a Hugging Face viní americké modely
- • Alibaba slibuje 2. místo, důkazy však chybí
- • Hackeři napadli Hugging Face – americké modely selhávají
- • Kimi K3 pozastavuje předplatné, protože poptávka exploduje
Alibaba vydává Qwen3.8 tři dny po Kimi 3 a hraje vabank
V testu StackPerf od Trilogy AI se proti sobě postavily modely Qwen3.8-Max-Preview od Alibaba a Kimi K3 od Moonshot a po anonymizovaném hodnocení skončily s rozdílem tří bodů: Kimi získal 83 ze 100 bodů po odečtení bodů za faktické chyby, Qwen 80. Oba modely dostaly zmrazené kopie dvou neznámých projektů (TTV Pipeline a Media Tooling), prozkoumaly identické snapshoty se stejnými hashi SHA-256 a musely analyzovat 269 souborů. Úkol vyžadoval mnohem víc než jen krátkou odpověď na kódování: přesné citace z repozitáře ve formátu path:line, typizovanou datovou smlouvu, fáze migrace, testy, rizika a Evidence Ledger. Oba modely nezávisle dospěly ke stejnému návrhu integrace. Qwen stanovil čistší systémové hranice a zachytil lepší metadata pro přehrávání, zatímco Kimi zpracoval revize a historii scén kompletněji. Podle zprávy bylo společné doporučení silnější než kterýkoli z jednotlivých návrhů.
Současně v neděli na síti X tým Qwen společnosti Alibaba prohlásil, že Qwen3.8 je „jeden z nejvýkonnějších modelů, které jsou dnes k dispozici“, překonán pouze modelem Claude Fable 5 od Anthropic. Jak uvádí implicator.ai, společnost k tomuto hodnocení nezveřejnila žádné benchmarky, žádné prompty ani žádnou metodiku. Uvádí se, že model má 2,4 bilionu parametrů, a open-weight váhy mají následovat „brzy“. U předchůdce tomu bylo jinak: Qwen3.7-Max byl 20. května uveden se zveřejněnou tabulkou (80,4 % na SWE-bench Verified, 69,7 na Terminal-Bench 2.0) a Artificial Analysis nezávisle potvrdil skóre 56,6 v Intelligence Index. Zákazníci tak mohli porovnat údaje výrobce s měřením třetí strany. Tentokrát tato kontrola chybí.
Kontrast oproti konkurenci je zřejmý: Moonshot představil Kimi K3 o tři dny dříve s 2,8 bilionu parametrů a vlastními benchmarky, které model staví před Fable 5 a GPT-5.6 Sol od OpenAI v testech Program Bench a SWE Marathon. Arena.AI umístila K3 na první místo v pěti doménách v rámci Frontend Code Arena.
Jak uvádí runtimewire.com, Alibaba umisťuje preview verzi do placených produktů (Token Plan, Qoder, QoderWork) ještě před zveřejněním vah. Tím si společnost zajišťuje prodejní okno pro platící zákazníky a sbírá data o využití z kódovacích a agentních workflow, zatímco se model dále vyvíjí. Provozní ekonomika zůstává nejasná: počet aktivovaných parametrů, konfigurace Mixture-of-Experts, délka kontextu a hardwarové požadavky nebyly uvedeny. I pojem „open-weight“ zůstává vágní, bez licence, repozitáře nebo data vydání. K 19. červenci neexistoval žádný technický report, žádná Model Card, žádný záznam v Artificial Analysis ani žádný checkpoint na Hugging Face. → trilogyai.substack.com Také: www.implicator.ai, runtimewire.com
Synthszr Take: Zajímavou částí tohoto srovnání není bodový rozdíl, ale uspořádání testu. Tři body mezi dvěma modely s 2,x bilionu parametrů při 269 identicky hashovaných souborech jsou v rámci statistického šumu hodnotitelů, což o pořadí neříká téměř nic. Co však test ukazuje, je, že oba reporty měly odlišné silné stránky – Qwen v systémových hranicích a metadatech pro přehrávání, Kimi v historii revizí – a jejich kombinované doporučení překonalo každý jednotlivý návrh. To je skutečný poznatek pro každého, kdo takové modely integruje do reálného toolchainu: otázka nezní „který model je dvojkou za Fable 5“, ale které dva se smysluplně doplňují. A právě proto je mlčení společnosti Alibaba tak závažné. Moonshot zveřejňuje svá čísla, nezávislý slepý test s pevným endpointem, harnessem a konfigurací uvažování poskytuje ověřitelnou strukturu, zatímco Alibaba zveřejní na X hodnocení a souběžně nasadí preview do placených produktů. Srovnání, které nikdo nemůže zopakovat, protože chybí datum, endpoint a metodika, je jen marketing s desetinnou čárkou.
Moonshot pozastavuje nová předplatná Kimi K3: Poptávka explodovala
Moonshot AI dočasně pozastavil nová předplatná pro svůj nejnovější model Kimi K3, protože poptávka podle sdělení společnosti dostala stávající kapacity na jejich hranici. V příspěvku na sociálních sítích čínský startup píše, že poptávka v posledních 48 hodinách téměř vyčerpala dostupný výpočetní výkon; aby zajistili stabilní zážitek stávajícím předplatitelům, upřednostňují jejich výpočetní zdroje a pozastavují nové registrace. Nová místa se budou otevírat postupně, jakmile bude k dispozici další kapacita. Kromě toho Moonshot v budoucnu rozdělí členství na dva plány: Kimi Membership pro web, aplikaci a práci a Kimi Code Membership pro kódovací workflow, aby mohl přesněji alokovat výpočetní výkon. Kimi K3 je model s 2,8 bilionu parametrů a kontextovým oknem o velikosti jednoho milionu tokenů, podle společnosti první open-weight model na světě ve třídě 3 bilionů parametrů. → economictimes.indiatimes.com
Synthszr Take: 48 hodin stačilo na to, aby se model s 2,8 bilionu parametrů dostal na hranu. Není to kvůli špatné kvalitě, ale proto, že každý požadavek na 3T model spotřebuje inferenční výkon, který ani dobře financovaná čínská laboratoř nedokáže z ničeho nic doplnit. Zajímavé je, co Moonshot dělá: zatahuje za záchrannou brzdu ve prospěch stávajících zákazníků a rozděluje na dva plány, aby kódovací workflow neubíraly stejný vzácný výpočetní výkon jako webová aplikace. To je disciplína ve správě výpočetních zdrojů pod tlakem: přídělový systém na zdroj, který je v danou chvíli skutečným úzkým hrdlem. Otázku špičkových modelů nerozhoduje benchmark, ale banální fyzika, která za tím stojí: Model, který nikdo nemůže poskytnout, neboduje.
Kimi K3 zaostává v matematice a genetice za špičkou, ale v kybernetické obraně je přesto nejsilnějším nástrojem na trhu. Důvod je banální: Fable tuto doménu kompletně blokuje, 5.6 Sol dostatečně často neodpovídá, takže je nepoužitelný. Když šlo v Hugging Face do tuhého, museli přejít na GLM, protože drahé špičkové modely z principu odmítly spolupracovat. Model, který odpoví, v praxi porazí jakýkoli model, který září v evaluacích, ale pak odmítne pomoci. Náskok pěti až čtrnácti týdnů u úkolů, které skutečně hýbou penězi, je vzkazem pro každého, kdo stále považuje open-weight modely za hračku.
Hack na Hugging Face: Ochranná opatření amerických modelů sabotují obranu
Hugging Face hlásí, že agentní AI systém kompromitoval jejich datový pipeline a získal přístup k několika interním clusterům a přihlašovacím údajům. Jejich vlastní, na LLM založený třídicí systém (triage) útok rozpoznal a zahájil kroky k jeho omezení. Pro forenzní analýzu společnost podle Edwarda Targetta (The Stack) sáhla po open-weight modelu GLM-5.2, který běžel na vlastní infrastruktuře, poté, co bezpečnostní mantinely (safety guardrails) amerických špičkových modelů zablokovaly příslušné dotazy. V debatě na síti X bezpečnostní výzkumník @0x4d31 argumentuje, že zde „kybernetická bezpečnost“ funguje pozpátku: útočníci používají modely bez omezení, zatímco obránci jsou při analýze útoku zablokováni. Současně AI Security Institute hlásí, že open-weight modely v kybernetických schopnostech zaostávají za uzavřenými špičkovými modely už jen o čtyři až sedm měsíců, v porovnání se šesti až deseti měsíci po většinu roku 2025. Tento incident se časově shoduje s týdnem, kdy Alibaba s Qwen3.8 Max a Moonshot s Kimi K3 představily nové open-weight modely. → us.list-manage.com
Synthszr Take: Pointa tohoto incidentu spočívá v detailu, který lze snadno přehlédnout: obránce musel sáhnout po čínském open-weight modelu, protože americké špičkové systémy odmítly forenzní dotazy jako příliš citlivé. Přesně to je ta zvrácená logika strážců „důvěryhodného přístupu“. Útočník se žádného modelu neptá na povolení, vezme si ten neomezený. Ochranná opatření, která mají zabránit zneužití, spolehlivě zasáhnou toho, kdo chce situaci řádně prošetřit, zatímco útočník je už o krok dál. A čísla hrají proti těmto strážcům: když se rozdíl ve schopnostech open-weight modelů zmenší z deseti na čtyři měsíce, celý argument o kontrole ztrácí svůj základ, protože příslib kontrolovaných schopností platí jen tak dlouho, dokud omezení zajišťuje skutečnou převahu.
David Sacks se ostře ohrazuje proti regulaci vlastní vlády
Čínský model Kimi K3 od Moonshot AI se s 1679 body dostal do čela žebříčku Frontend Code Arena a posunul se tak o 17 míst před svůj předchozí model. David Sacks, Trumpův poradce pro AI, podle blockchainového média Cryptopolitan vyhodnotil výsledek jako varovný signál pro konkurenceschopnost USA a v příspěvku na síti X z toho obvinil domácí regulaci. Konkrétně zmínil omezení při výstavbě nových datových center jako zátěž pro americké AI laboratoře. Kimi K3 disponuje 2,8 bilionu parametrů a kontextovým oknem o velikosti jednoho milionu tokenů; Moonshot chce do 27. července zveřejnit open-weight váhy; v současnosti model běží přes Kimi.com a Moonshot API. → 디지털투데이 테크 뉴스레터
Synthszr Take: Jediné první místo v žebříčku pro frontend a Washington má svůj argument. Sacks spojuje 1679 bodů modelu Kimi K3 se stagnující výstavbou datových center, jako by byla kauzalita jasně prokázána. Není: Mezi skóre v kódování a schvalovací praxí pro datová centra je několik myšlenkových kroků, které přeskakuje, protože žebříček se cituje snáze než statistika o kapitálu. O ostřejší nátlakový prostředek se postaral Chamath s cenovým rozpětím: 0,50 dolaru oproti 56 dolarům za stejný milion tokenů, což je 112násobný rozdíl. Toto číslo se totiž vejde do každého rozhodování o rozpočtu.
Shopify zakazuje interní používání slabších modelů AI
Navzdory rostoucím cenám některé společnosti nekompromisně sázejí na nejdražší „frontier“ modely od OpenAI a Anthropic, informuje WSJ. V Shopify podle šéfa inženýringu Farhana Thawara nesmějí inženýři používat žádné slabší modely, protože ztracený lidský čas je dražší než čas výpočetní. Zakladatel Olive Bill Nguyen spotřeboval za šest týdnů 774 miliard tokenů, převážně pro soukromé účely, což odpovídá výpočetním nákladům přibližně 4,5 milionu dolarů. Spoluzakladatel Avoca Tyson Chen tuto volbu zdůvodňuje tím, že jejich workflow jsou „citlivé na tržby“ a každý procentní bod přesnosti se počítá. Naopak Spotify se podle hlavního architekta Niklase Gustavssona rozhodlo proti nejnovějším verzím Opus od Anthropic, protože jejich nárůst výkonu neospravedlňuje náklady. → www.wsj.com
Synthszr Take: Otázka vždy zní: „co na tom závisí“. Shopify počítá správně: Když levný model přehlédne chybu a inženýr ji tři hodiny hledá, byl ušetřený token tou nejdražší zkratkou dne. U Avoca každý bod přesnosti končí přímo v pracovním postupu klíčovém pro tržby platícího zákazníka, a tam se příplatek ospravedlní sám. Nguyennových 4,5 milionu dolarů ukazuje zakladatele, který si kupuje rychlost uvedení na trh (time-to-market), dokud se učí rychleji než konkurence. Spotify říká stejně racionálně ne, protože streamovací funkce nepotřebuje 38 procent v doktorandské zkoušce.
Meta integruje AI do svých reklamních nástrojů, značky ztrácejí kontrolu nad reklamami
Meta stále více tlačí inzerenty do svých reklamních nástrojů s podporou AI a výsledky jsou podle Business Insider chaotické: zkroucené končetiny, nesrozumitelný text a zcela pozměněné produkty. Business Insider hovořil s osmi inzerenty a šéfy agentur, kteří popisují řešení problémů s AI od Meta jako každodenní záležitost. U jedné značky pyžam navrhla Meta nový vizuál, který z propagované noční košile udělal tričko a kalhoty. Pro networkingovou skupinu žen v Montaně přidala AI do reklam muže. → Business Insider
Synthszr Take: Účet jde jasně na vrub značek. Platí za automatizaci a dostávají zpět produkt, který jejich vlastní značku používá proti nim: z noční košile se stane kalhotový kostým, do skupiny žen se dostanou muži. To opravdu hořké se skrývá v odpovědi Meta, že chyba je na straně zákazníka, zatímco bug zapíná funkce AI i v případě, že je uživatel vypnul. Značka žije z tiché kontroly nad každým kontaktním bodem, a přesně tu zde prodáváte za o něco vyšší pravděpodobnost prokliku. Když agentura nahlásí stejnou chybu u většiny ze svých 15 klientů a přesto se nic neděje, je to vědomé rozhodnutí přenést břemeno kvality na inzerenty.
Framer 3.0 umožňuje AI agentům navrhovat přímo na plátně a samostatně realizovat návrhy
Framer vydal ve verzi 3.0 AI agenty, kteří pracují přímo v rámci designového plátna (canvas). Podle oznámení v Product Hunt Weekly tito agenti přijmou zadání (briefing) a na jeho základě vytvoří kompletní stránky, založí komponenty, napíšou kód, napojí CMS a postarají se o SEO. Poskytovatel zdůrazňuje, že agenti přitom zůstávají v rámci stávajícího systému komponent a nenarušují ho. Technicky se napojují přímo na Claude Code a Cursor. Framer celou věc pozicuje jako náhradu za klasický moment předání, kdy se hotový soubor z Figmy předává vývojářům. Jádro sdělení: Agenti skutečně navrhují a samostatně realizují. → Product Hunt Weekly
Synthszr Take: Okamžik, kdy designér půl dne posouvá pixely, končí, a to je pro začátek výhra. Když jeden agent přeloží komponentu do kódu, druhý vytvoří varianty pro různé velikosti obrazovek a třetí napojí CMS, pak designér už nesedí u nástroje, ale nad výsledky. Jeho práce se posouvá k formulaci záměru a k hodnocení: musí zadání formulovat tak přesně, aby agenti vytvořili správnou věc, a musí poznat, kde natahují hranice designového systému. To je náročnější než Auto-Layout. Zajímavý důsledek spočívá v odstranění předávání vývojářům, protože přesně tento bod zlomu byl léta místem, kde se dobré návrhy rozmělňovaly. Kombinace tvůrčí síly a schopnosti posoudit kvalitu kódu bude cennější. Naopak role čistě manuální práce na plátně se pravděpodobně do konce roku 2026 dostanou pod znatelný tlak.
Anthropic vydává novou příručku pro promptování Claude Fable 5
Anthropic zveřejnil příručku, která popisuje změněné vzorce promptování a scaffoldingu pro nové modely Claude Fable 5 a Claude Mythos 5. Podle dokumentace se Fable 5 v několika ohledech chování liší od svého předchůdce Claude Opus 4.8, takže stávající prompty, nástroje a mantinely je třeba přizpůsobit. Největší rozdíl: jednotlivé dotazy na složité úkoly běží při vyšším nastavení „effort“ mnoho minut, autonomní běhy se mohou protáhnout na hodiny. Anthropic proto radí před migrací upravit klientské time-outy, streaming a ukazatele průběhu a běhy kontrolovat asynchronně, místo aby se na ně čekalo blokujícím způsobem. → TAAFT - There’s An AI For That
Synthszr Take: Nejzajímavější větou v celé příručce je jeden stavební kámen promptu proti nadměrnému plánování: „When you have enough information to act, act.“ Nový model má tendenci přemítat, rozebírat možnosti a znovu otevírat rozhodnutí, která již byla dávno učiněna. Musíte ho tedy aktivně odnaučit váhání, místo abyste mu jako dříve dávali více času na přemýšlení. To je praktická pointa každé generace modelů: Co bylo u předchůdce chytrou technikou promptování, stává se u nástupce starou zátěží, kterou si s sebou vlečete. Půl roku zažité prompty, pečlivě vytvořené mantinely, jemně vyladěné rozpočty na „přemýšlení“: mnohé z toho už u Fable 5 není pomocí, ale třecí plochou.
Si zve globální Jih ke spolupráci v oblasti AI a tlumí bezpečnostní rétoriku
Čínský prezident Si Ťin-pching na Světové konferenci o umělé inteligenci v Šanghaji nabídl rozšířenou spolupráci v oblasti AI s rozvojovými zeměmi. Podle CNBC Si přislíbil, že Čína umožní rozvojovým zemím účast v 5000 školicích a seminárních programech v oblasti AI a bude podporovat spolupráci s regionálními organizacemi, jako je Sdružení národů jihovýchodní Asie, Liga arabských států a Africká unie. Vývoj AI musí být symfonií mezinárodní spolupráce a nesmí se stát sólovou akcí jediné země, uvedl Si. Zároveň apeloval na povědomí o rizicích: AI musí zůstat bezpečná, kontrolovatelná a vždy pod lidskou kontrolou. → 디지털투데이 테크 뉴스레터
Synthszr Take: Zajímavý je zde seznam adresátů v pozadí: Sdružení národů jihovýchodní Asie, Liga arabských států, Africká unie. To jsou vlády, které od USA a Evropy slyšely hlavně o exportních kontrolách, omezeních na čipy a přednáškách o bezpečnosti modelů. Čína otáčí melodii a místo podmínek nabízí přístup: 5000 školicích míst, regionální dohody, 29 podpisů pod novou organizací pro spolupráci. Těch 5000 seminářů je přitom skutečnou pákou, protože vyškolí kohortu inženýrů, úředníků a zakladatelů startupů, kteří budou následně stavět na čínských modelech, čínském cloudu a čínských standardech. To je budování loajality zákazníků napříč příští generací, zabalené jako rozvojová pomoc.



