Alibaba vs. Moonshot: Qwen 3.8-Max má porazit Kimi 3
- • Alibaba uvádí Qwen 3.8-Max s 2,4 bilionu parametrů.
- • Australský zákaz pro osoby mladší 16 let má jen malý vliv na používání.
- • GPT-5.6 Luna výrazně překonává Fable v nákladech a opravách chyb.
Alibaba představuje Qwen 3.8-Max
Společnost Alibaba vydala model Qwen 3.8-Max, podle jejích slov nejvýkonnější model z rodiny Qwen, který je zpočátku dostupný pouze prostřednictvím vlastního QwenCloudu přes API. Model má 2,4 bilionu parametrů, z nichž 95 miliard je aktivních, a staví na architektuře Qwen 3.5. Poprvé Alibaba plánuje zveřejnit váhy modelu třídy Max: vydání s otevřenými váhami (open-weights) je ohlášeno na příští týden. Podle poskytovatele je hlavní důraz kladen na vícedenní autonomní úkoly v oblasti kódování, rešerší a projektové práce.
Pro doložení svých tvrzení ukazuje tým Qwen tři ukázky kódování. V jedné z nich model během více než 16 dnů vytvořil projekt oh-my-cli z prázdného adresáře a podle vlastních údajů přitom nasbíral 265 commitů, 127 pull requestů a 151 issues. Ve druhé ukázce reprodukoval výzkumnou práci o výběru dat při trénování LLM za zhruba pět dní a 125 hodin nepřetržitého provozu, přičemž napsal asi 7 600 řádků kódu a provedl 33 tréninkových kol na GPU. Tyto údaje pocházejí z vlastní prezentace společnosti Alibaba a je třeba je vnímat jako tvrzení poskytovatele.
Na Hacker News se diskuze točí především kolem menších otevřených modelů. Současně byla na příští týden oznámena open-weight verze Qwen3.8-27B. Několik komentátorů označuje předchůdce Qwen3.6-27B a -35B za nejlepší lokálně spustitelné modely, které znají; jeden z nich uvádí, že model 35B používá jako denní nástroj na svém Mac Studiu s rychlostí přibližně 50 tokenů za sekundu a v dubnu kvůli němu zrušil předplatné Claude.
Současně Bloomberg informuje o konkurentovi Moonshot. Jeho model Kimi K3 je trénován na přibližně 20 000 čipech Nvidia, které jsou poskytovány na základě smlouvy o výpočetním výkonu se společností Alibaba. Alibaba je jedním z největších investorů Moonshotu, ale zároveň i konkurentem: Kimi v některých metrikách překonal Qwen na vlastní infrastruktuře Alibaby, což podle Bloombergu vyvolalo interní zklamání. Zástupce Bílého domu navíc obviňuje Moonshot z nelegálního pořízení pokročilých čipů Blackwell od Nvidie. → qwen, ycombinator, bloomberg
Synthszr Take: Na tomto oznámení je pozoruhodné časové zpoždění: otevřené váhy přijdou až příští týden a vývojářská scéna už slaví. Důvěra v model se buduje na základě předchozí série, dlouho před samotným dnem vydání. Qwen 3.6-27B běží u jednoho z komentátorů jako denní nástroj na starém Macu a v dubnu ho stál předplatné Claude, při rychlosti 50 tokenů za sekundu. Taková prožitá zkušenost překoná jakoukoli benchmarkovou tabulku: je to důvod, proč je předobjednávka v hlavě dávno provedena, než si vůbec někdo může soubor stáhnout. Alibaba si toto očekávání zasloužila každým solidním vydáním. Ironii dodává Bloomberg, protože právě Kimi K3 překonal Qwen na vlastní infrastruktuře Alibaby v některých metrikách. Pověst, kterou si Qwen vybudoval, je to jediné v tomto závodě, co se nedá přes noc dotrénovat.
Australský zákaz sociálních sítí pro mladistvé do 16 let selhává
První zákon na světě, který zakazuje dětem mladším 16 let používat sociální média v Austrálii, vedl v prvních třech měsících jen k mírnému poklesu. Podle agentury Bloomberg kleslo používání v této věkové skupině z 85,9 % na 81,5 %. Jako hlavní důvod zpráva uvádí slabé ověřování věku: většina dospívajících mohla jednoduše dál používat své stávající účty nebo si založit nové. Zákon je mezinárodně považován za průkopnický a je sledován ostatními vládami jako možný precedent. První čísla ukazují, že mezi zákonným nařízením a jeho technickým vymáháním zeje velká propast. → StrictlyVC
Synthszr Take: 4,4 procentního bodu za tři měsíce: to je celý výsledek zákona, který je oslavován jako globální precedent. Chyba v uvažování se skrývá o úroveň níž, v ověřování věku. Zákon je jen tak silný, jak silný je jeho nejslabší bod technického vymáhání, a ten je zde tak měkký, že ho čtrnáctiletý obejde novým účtem. Kdo se někdy pokusil spolehlivě ověřit věk online, zná dilema: buď shromažďujete tvrdá data o identitě (noční můra pro ochranu osobních údajů), nebo se spoléháte na vlastní prohlášení, které každé dítě obelstí. Austrálie prohlásila složitou otázku za vyřešenou dekretem a skutečnou práci, ověřování, delegovala na platformy, které nemají ekonomický zájem na přísných kontrolách. Přesně stejná mezera se objeví u AI agentů, jakmile jim regulátoři předepíší věková nebo identitní omezení. Zákaz bez spolehlivé ověřovací technologie je jen powerpointová iluze a další země, které ho budou kopírovat, sklidí stejných 4,4 procentního bodu.
GPT-5.6 Luna poráží Fable od Anthropic: 1,80 dolaru oproti 104 dolarům
Paweł Huryn z newsletteru The Product Compass nechal v rámci vlastního benchmarku projít 105 skrytých chyb deseti frontier modely, a to ve 14 cyklech. Podle jeho údajů opravil model GPT-5.6 Luna od OpenAI při maximálním reasoning-effort 33 chyb za náklady na API ve výši 1,80 dolaru, zatímco model Fable 5 od Anthropic s 29 opravenými chybami stál 104 dolarů. OpenAI snížila cenu modelu Luna 30. července o 80 %; podle ceníku se ceny tokenů u Opus 5 a Luna liší 20 až 25krát, v Hurynových testech naměřil rozpětí od 20x do 90x. Stejný model Luna na úrovni „high effort“ místo „max“ zvládl pouze 13 chyb. Úroveň „effort“ tedy hraje zásadní roli. Huryn doporučuje Lunu na maximální effort pro náročné nebo asynchronní úkoly a nižší úroveň pro drobnou denní práci. Surová data, metodiku a logy podle svých slov zveřejnil na GitHubu; klíče k řešením zůstávají skryté. Model Luna je součástí plánu ChatGPT Plus za 20 dolarů. → Paweł from The Product Compass
Synthszr Take: Zajímavá část je, že někdo ten cenový rozdíl změřil: 105 chyb, 14 běhů, logy na GitHubu, klíče k řešením skryté, aby benchmark dál fungoval. Většina diskuzí o nákladech na modely se točí kolem dojmů a marketingových prezentací; tady leží na stole reprodukovatelné číslo. A to číslo říká: levnější model se správně nastavenou úrovní effort porazil 58krát dražší model, a v počtu opravených chyb byl dokonce mírně napřed. Pákovým efektem je konfigurace, nikoli hrubá síla. Účet za AI ve výši 200 dolarů by měl být nejprve otestován na dvou úrovních effort, se záznamem nákladů na vyřešený případ, místo aby se peníze investovaly do dalšího prémiového předplatného. Přesně tohle stojí jedno odpoledne a je to okamžitě proveditelné. Skutečnou kompetencí příštích měsíců je disciplína v routování: vědět, který úkol potřebuje jaký model na jaké úrovni, a to doložené měřením, nikoli odhadem.
CEO Replitu Masad přisuzuje úniky AI ze sandboxů začátečnickým chybám poskytovatelů
Amjad Masad, CEO společnosti Replit, se ve veřejném příspěvku vyjádřil ke zprávám o systémech AI, které unikají ze svého sandboxu. Jeho klíčové sdělení: takové incidenty rychle vyvolávají dojem hrozivé AI, přitom ale mnoho AI firem a novějších poskytovatelů sandboxů dělá velmi základní chyby. Podle vlastních slov Replit provozuje sandboxy od roku 2016 a byl přitom terčem útoků hackerů i státních aktérů, z čehož se firma mnohé naučila. Jako hlavní radu Masad uvádí, že je třeba vycházet z předpokladu, že zero-day zranitelnosti existují, a uvažovat v ochranných vrstvách v rámci zero-trust modelu. Příspěvek zmínil Zvi Mowshowitz ve svém newsletteru. → Zvi Mowshowitz from Don’t Worry About the Vase
Synthszr Take: Masad má pravdu, a to je nepohodlné pro všechny, kteří teď raději mluví o démonické AI, která chce uniknout. Když model vyjde ze sandboxu, někdo ledabyle ukul řetězy. Zajímavé číslo je zde rok 2016: Replit buduje izolační vrstvy téměř deset let, protože byly testovány státními aktéry, zatímco mnoho nových poskytovatelů sandboxů své kontejnery šroubuje dohromady tempem vývojové fáze a diví se, že to teče. Zero-trust a předpoklad, že zero-days již dávno existují, jsou řemeslem z dvou desetiletí bezpečnostní infrastruktury. Kdo svaluje vinu za únik na model, přesouvá vlastní zodpovědnost na pohodlnou projekční plochu. Skutečná práce spočívá v oprávněních, v síťové vrstvě a v otázce, čeho může kompromitovaný proces vůbec dosáhnout. Postavte izolaci tak, jako by útočník už měl root práva, a únik AI se stane poznámkou pod čarou, nikoli titulkem.
Google integruje do Google Earth generátor obrázků s AI, který umožňuje falšovat satelitní snímky
Google podle 404 Media ve čtvrtek zavedl do Google Earth novou funkci AI, která umožňuje libovolně manipulovat nebo zcela vymýšlet satelitní snímky. V příkladech uvedených autorem lze takto zobrazit místo, jako by tam došlo k útoku dronem, nebo přidat v Íránu atomovou elektrárnu, která ve skutečnosti neexistuje. Google Earth byl dosud považován za spolehlivý nástroj pro OSINT analytiky, kteří s jeho pomocí pozorovali konfliktní regiony nebo oblasti katastrof na dálku a sledovali změny v čase. 404 Media argumentuje, že stejný nástroj lze nyní stejně dobře využít k cílené dezinformaci. Podrobnosti o přesném provedení funkce zůstávají ve zprávě nejasné; zbytek článku je za platební bránou. → Becky from 404 Media
Synthszr Take: Škoda dopadá na malou, vysoce specializovanou skupinu, která léta žila z tiché autority satelitních snímků. OSINT analytici přistupovali k Google Earth jako k tomu, čím dlouho byl: neutrální, nákladně pořízený záznam fyzického světa, který nebylo možné jen tak přepsat. Právě tento nákladový práh představoval jeho hodnotu. Když si každý může během vteřin vyrenderovat jadernou elektrárnu v íránské poušti, ztrácí surový materiál této komunity svou důkazní sílu a práce se přesouvá od analýzy k úmornému ověřování samotného zdroje. To je druhá strana Jevonsova paradoxu: když tvorba obrazu nestojí prakticky nic, stává se skutečný, ověřitelný obraz skutečným nedostatkovým zbožím. Týmy horské služby, vyšetřovatelé lidských práv a váleční reportéři teď potřebují řetězec původu pro každý pixel, stejně jako Instagram v lednu kapituloval před AI padělky a vsadil na provenienci. Google mohl kryptograficky zabezpečit signaturu pravých snímků, než rovnou dodal tlačítko na padělání.
Azeem Azhar: Mezera v kontrole mezi AI a člověkem je strukturální, nikoli náhodná
Azeem Azhar ve svém newsletteru Exponential View poukazuje na asymetrii, kterou popsal již v roce 2021 ve své knize „The Exponential Age“. Jeho argument: provozujeme systémy s prakticky neomezenou pozorností a neúnavnou schopností jednat, které jsou pod dohledem lidí s omezenou pozorností a velmi konečným časem. Jako důkaz cituje zprávu agentury Reuters, podle níž zdroje obeznámené s tréninkovými postupy OpenAI potvrzují, že evaluace tam často probíhají ve vysokém tempu a objemu. Objem dat je podle těchto zdrojů tak velký, že zaměstnanci mají někdy potíže stíhat. Azhar klasifikuje nedávné incidenty s AI jako symptomy právě této strukturální nerovnováhy. → Azeem Azhar, Exponential View
Synthszr Take: Azharův pohled je nepohodlný, protože nevede k jednoduché opravě chyby. Stroj nespí, neunaví se, neztrácí pozornost před koncem pracovní doby. Člověk, který ho má dohlížet, nic z toho nedokáže vypnout. Pokud už vlastní lidé v OpenAI sotva stíhají při evaluacích tréninku, pak model dohledu jako princip selhává. Kontrolu jsme vždy definovali jako lidský dohled, a tento dohled se neškáluje. Upřímným závěrem je, že dohled se musí stát sám strojovým: systémy, které kontrolují systémy, s jasnými mantinely a automatickými zarážkami, zatímco člověk nastavuje pravidla, místo aby četl každý jednotlivý proces. Jinak mezera jednoduše poroste tempem výpočetního výkonu a nikdo se nikdy nerozhodl, že to tak má být.
Karpathy: AI vytváří na požádání celé světy, ale nedokáže zkontrolovat, co vytvořila
Andrej Karpathy, spoluzakladatel OpenAI a bývalý šéf AI v Tesle, popisuje na X posun ve schopnostech velkých jazykových modelů. Podle jeho pozorování LLM již nevytvářejí jen jednotlivé artefakty jako kód, texty nebo obrázky, ale stále častěji vysoce přizpůsobená, kompletní prostředí na vyžádání. Zároveň těmto modelům chybí schopnost nativně vnímat a ověřovat to, co samy vytvořily. Model tak může generovat celé rozhraní, simulaci nebo svět, aniž by měl spolehlivý vnitřní smysl pro to, zda je výsledek správný nebo funkční. Karpathy tak pojmenovává mezeru mezi tvůrčí silou a sebekontrolou. Jde o postřeh jednoho z nejvlivnějších praktiků v oboru, nikoli o nový produkt nebo studii. → us.list-manage.com
Synthszr Take: Stránka generování od momentu ChatGPT explodovala ve zrychleném tempu, stránka kontroly je zhruba tam, kde byla v roce 2022. To je ta skutečná asymetrie: model vám během vteřin ušije kompletní rozhraní, ale nemá pohled na to, co právě ušil. Pro každého, kdo staví software, se tím posouvá úzké hrdlo. Už nejde o otázku, zda stroj něco vyrobí, ale zda někdo nebo něco dokáže to vyrobené zkontrolovat, než to půjde live. Karpathy ukazuje na místo, kde vzniká hodnota příštích let: v evaluačních sadách, ve smyčkách vnímání, v automatizovaných auditních vrstvách, které kontrolují vytvořené. Kdo si kupuje jen rychlost generování a nechává kontrolní infrastrukturu růst jako dosud (tedy vůbec), hromadí si horu artefaktů, které už nikdo neověřil. Moje sázka: za dvanáct měsíců budeme mluvit méně o lepších generátorech a více o nástrojích, které generátorům koukají na prsty.
OpenAI snižuje ceny tokenů pod čínskou úroveň: Evans pochybuje o udržitelných maržích
Benedict Evans se ve svém newsletteru věnuje otázce, proč laboratoře vyvíjející modely neskončí jako infrastruktura s nízkými maržemi, navzdory dnešní cenové síle. Jeho argument: AI se v současnosti nachází v situaci nedostatku nabídky, kdy si poskytovatelé mohou prakticky diktovat ceny. K tomu se hodí, že OpenAI tento týden výrazně snížilo ceny řady svých ne úplně špičkových modelů a podle Evanse tak podbízí jak Anthropic, tak novou generaci téměř špičkových modelů z Číny. Náklady na inferenci od roku 2023 klesly o řády; snižování cen probíhá tak jako tak nepřetržitě. → Benedict Evans
Synthszr Take: Dnešní cenová síla laboratoří je čistě prémie za nedostatek. Dokud je úzkým hrdlem výpočetní kapacita, může si OpenAI diktovat ceny, ale právě ty miliardy, které nyní plynou do datových center (WSJ zmiňuje stavbu za 250 miliard, za kterou má ručit Nvidia), vytvářejí přebytek nabídky, který tyto ceny zase dožene. Známe to z raných dob AdWords: dokud přihazovalo jen pár průkopníků, zůstávaly ceny za proklik mírné, a teprve když se zapojili všichni, marže se obrátila. U inference klesly náklady od roku 2023 o řády a OpenAI nyní podbízí i levné čínské modely. Když poskytovatel přeskočí Paretovu křivku, aby získal zpět podíly od Anthropic, cenová válka už dávno začala.
CPO Whatnot Tom Verrilli: „najmi dobré lidi a nech je pracovat“ už nefunguje
Tom Verrilli, Chief Product Officer live-shoppingového tržiště Whatnot, vysvětluje v Lenny’s Podcast, proč byl jeho produktový tým založen na premise, že product managementu je vlastně líto. Whatnot je podle vlastních údajů nejrychleji rostoucím americkým tržištěm s obratem zboží (GMV) přes 8 miliard dolarů. Verrilli tvrdí, že několik málo, ale velmi seniorních produktových manažerů, kteří dělají skutečnou IC práci, překoná jakoukoli organizační strukturu orientovanou na metriky. Před Whatnotem byl CPO ve Twitchi a growth directorem v Twitteru. Dále popisuje, jak AI posouvá roli PM, na co se zaměřuje při nabírání lidí a proč běžný princip „najmi dobré lidi a nech je pracovat“ v praxi selhává. Rozhovor je součástí série s CPO z Netflixu a Anthropic o budoucnosti produktové práce v éře AI. → Lenny’s Newsletter
Synthszr Take: Verrilli říká nahlas to, co většina organizačních schémat zamlčuje: poměr PM k inženýrům je administrativní artefakt. GMV 8 miliard se buduje s pár lidmi, kteří sami sedí na produktu, místo aby moderovali tickety. Počty jsou jednoduché: každá další hlava s sebou nese náklady na koordinaci, které rostou rychleji než výstup, který dodá. Seniorní ICs přesně tento overhead odstraňují a AI tento efekt posiluje, protože rešerše a první implementace dnes probíhají v hodinách místo týdnů. Myšlenkový vzorec, že více lidí znamená více výkonu, je reliktem z doby, kdy lidé byli jedinou výpočetní kapacitou. Whatnot ukazuje, že tři lidé s reálnou rozhodovací pravomocí na měřitelném výsledku dokážou víc než tucet, který si navzájem posílá status updaty.
Astra od OpenAI řeší deset otevřených matematických problémů, každý s ověřitelným certifikátem Lean
Interně testovaná verze nadcházejícího modelu Astra od OpenAI přinesla řešení deseti desítky let otevřených problémů z matematiky a teoretické informatiky, každé doprovázené strojově ověřitelným certifikátem Lean-4. Zveřejněno to bylo 1. srpna spolu s 249stránkovým technickým rukopisem a 62stránkovým popisem postupu řešení. Všechny soubory s certifikáty jsou k dispozici pod licencí Apache-2.0 v repozitáři OpenAI na GitHubu. Výpočetní náklady na všech deset řešení vyčísluje OpenAI na přibližně 2 000 dolarů podle aktuálních tarifů Sol API.
Klíčovým výsledkem je konstrukce první známé nesofické grupy, což je protipříklad k otázce, která byla otevřená od zavedení pojmu soficity Michailem Gromovem v roce 1999. K tomu se přidává vyvrácení domněnky o rigiditě von Neumannových algeber, formulované v roce 1980 nositelem Fieldsovy medaile Alainem Connesem. Tři z deseti výsledků řeší problémy z katalogu Paula Erdőse, konkrétně Erdősovy problémy 183, 146 a 180. Další výsledky se týkají prvního zlepšení horní meze pro hustotu balení koulí ve vysokých dimenzích od roku 1978, věty o paralelním opakování pro kvantové hry a nových mezí v postkvantové kryptografii založené na mřížkách.
Šéf matematiky v OpenAI Sébastien Bubeck potvrdil výsledky na X a upozornil, že každý výsledek je dodáván s certifikátem Lean a protokolem chain-of-thought. Noam Brown, jeden z výzkumníků stojících za základní technikou test-time-reasoning, připustil, že model selhal u několika dalších cílů, mezi nimiž nebyl žádný z problémů tisíciletí, a dodal, že na každý problém bylo použito málo výpočetního výkonu. Thomas Bloom z University of Manchester, který spravuje Erdősův katalog a v říjnu 2025 veřejně vyvrátil dřívější nepravdivé tvrzení OpenAI, označil výsledky Astry na X za „velkou zprávu“.
Ne všechny reakce byly takové. Gary Marcus modelu přiznává sílu, ale varuje před kompozičním klamem: závěr, že systém, který exceluje v určitém druhu matematiky, je tím pádem dobrý ve veškeré matematice, veškeré vědě nebo ve všem, je logicky nesprávný. Elon Musk naopak zprávu interpretoval jako důkaz dosažení singularity. Matematický bloger Fernando Borretti vidí výsledky jako signál pro budoucnost, v níž modely provádějí hraniční výzkum a firmy, které zapojují lidi do kontrolní smyčky, prohrají proti těm, které to nedělají. → techtimes, substack, borretti, openai, github
Synthszr Take: V říjnu 2025 už OpenAI jednou takový průlom ohlásilo a Thomas Bloom, který spravuje Erdősovy problémy, tehdy tvrzení veřejně rozebral. Tentokrát na začátku není tweet, ale soubor .lean, který buď zkompiluje, nebo ne. Rozdíl spočívá v důkazním břemeni: při vyvrácení Erdőse v květnu muselo důkaz přečíst a odsouhlasit devět matematiků, což byl úvěr důvěry, který mohli splatit jen lidé se stejnými odbornými znalostmi. Jádro Lean dává binární verdikt, přepočítá ho každý notebook a tentýž Bloom, který to minulý rok zamítl, to nyní nazývá „velkou zprávou“. Oznámení nic nestojí a špatně stárnou; certifikát, který projde jádrem, je prvním důkazem důvěry v této oblasti, kterému nemusíte věřit, protože si ho můžete ověřit. Za 2 000 dolarů výpočetních nákladů přináší důkaz vlastní kontrolní součet, a to posouvá měnu z reputace na reprodukovatelnost.



