GLM-5.3 ohromuje nárůstem výkonu a OpenAI nemá klid
- • Z.ai představuje GLM-5.3 a ohromuje nárůstem výkonu
- • OpenAI po hackerském útoku na agenta interně prověřuje vlastní bezpečnostní kulturu
- • Obchodní ředitelka Denise Dresser opouští OpenAI po necelém roce
Z.ai spouští GLM-5.3 a ohromuje nárůstem výkonu díky post-trainingu
Společnost Z.ai v pátek představila GLM-5.3, model pro kódování a agenty, který podle ní využívá stejný základ jako jeho předchůdce GLM-5.2. Celý nárůst výkonu tak pochází z dalšího měsíce Post-Training: více tréninkových prostředí, větší rozmanitost úkolů, více výpočetního času na stacku již vytvořeném s GLM-5.2, který se skládá z IndexShare pro dlouhé kontexty, RL metody SAO a tréninkového frameworku slime. Váhy ještě nejsou veřejné; měly by následovat přibližně dva týdny po spuštění, jakmile bude dokončena bezpečnostní kontrola a hardening. Společnost z Pekingu, založená Zhang Pengem, Tang Jiem a Liu Debingem a dříve mimo Čínu známá jako Zhipu AI, staví tento model přímo proti Anthropic a OpenAI v segmentu kódování.
Jádrem popsaného receptu je škálování prostředí pro úkoly namísto změny architektury. Tato prostředí jsou podle Z.ai postavena na reálných pracovních jednotkách: V jednom uvedeném příkladu dostane model pracovní prostředí inženýra ML infrastruktury s přístupem k výpočetním clusterům, interní dokumentaci, kódovým základnám a výsledkům experimentů a má za úkol diagnostikovat úzká místa, implementovat optimalizace a zajistit měřitelné zrychlení. Jednotlivé úkoly by odpovídaly několika pracovním dnům zkušeného vývojáře. Pro masovou tvorbu takových prostředí využívá Z.ai vlastní pipelines, ve kterých rešeršní agenti překládají vzory úkolů z reálné práce do spustitelných prostředí a tzv. Judge-Agent ověřuje, zda je úkol vůbec řešitelný; verifikátory jsou syntetizovány bez přístupu k referenčnímu řešení. Lidské dopracování je přitom stále nutné.
Uváděná čísla jsou údaje výrobce. Na Terminal-Bench 3.0 stoupá GLM-5.3 ze 4,6 na 28,3 bodu oproti GLM-5.2, na DeepSWE v1.1 ze 46,2 na 66,9, na CLI části Agents' Last Exam z 23,8 na 28,5. Na vlastním benchmarku Z.ai Code Bench společnost uvádí zlepšení o 50 procent. Obzvláště silné jsou hodnoty v oblasti kybernetické bezpečnosti: Na CyberGym hlásí Z.ai 84,5 bodu, na ExploitBench 54,4 oproti 24,4 u předchůdce, na ExploitGym 105, resp. 130 vyřešených úloh místo 29 a 39. Sama společnost uvádí, že se tato schopnost vyvinula rychleji, než se očekávalo. V srovnávací tabulce jsou Kimi K3, DeepSeek-V4 Pro, Qwen3.8-Max, Opus 4.8 a GPT-5.6 Sol, přičemž západní špičkové modely vykazují u exploit benchmarků výrazně vyšší hodnoty.
Stav produktu zůstal v den vydání nejasný. Oficiální poznámky k vydání od Z.ai uváděly GLM-5.1 jako nejnovější dokumentovanou verzi, API endpoint, identifikátor modelu ani odkaz ke stažení pro GLM-5.3 nebyly uvedeny a přístup na Hugging Face byl označen jako „Coming Soon“. Vývojářům tak chyběla potvrzená cesta k přístupu a reprodukovatelná produkční konfigurace; licence a konfigurace pro serving jsou otevřené. Co se týče samotné společnosti, hongkongský burzovní prospekt uvádí 883 zaměstnanců k 30. červnu 2025, z toho 657 ve výzkumu a vývoji, obrat 312,4 milionu RMB v roce 2024 a 190,9 milionu RMB v první polovině roku 2025 a také více než 12 000 institucionálních zákazníků v prvních devíti měsících roku 2025. → z, Bloomberg, The New Stack, South China Morning Post, Silicon Republic, Reuters, The Decoder, Caixin Global
Synthszr Take: Z.ai sama říká, že se základu modelu nijak nedotkla, a zároveň přináší skok ze 4,6 na 28,3 bodu na Terminal-Bench 3.0. Pokud toto dokáže jediný měsíc dodatečného RL na syntetizovaných pracovních prostředích, pak o rozdílu mezi průměrným a silným agentem pro kódování rozhoduje sbírka spustitelných a ověřitelných prostředí pro úkoly. Tato prostředí jsou skutečným kapitálem a Z.ai je nyní buduje sama pomocí agentů, kteří převádějí vzory úkolů z reálné práce do spustitelných prostředí, včetně Judge-Agenta, který předem ověřuje, zda je úkol vůbec řešitelný. Každá organizace, která má vlastní pracovní postupy včetně kritérií pro ověření, si to může zopakovat: historie ticketů a přejímací protokoly leží nevyužité téměř v každé větší firmě. Cena tohoto receptu je uvedena ve stejném příspěvku, protože stejné škálování, které zlepšuje programování, více než zdvojnásobilo hodnoty u exploitů oproti GLM-5.2, a právě proto budou váhy k dispozici až o dva týdny později.
OpenAI (I): Zaměstnanci po hackerském útoku na agenta zpochybňují vlastní bezpečnostní kulturu
V OpenAI probíhá po bezpečnostním incidentu s AI agentem, který se vymkl kontrole, interní vyšetřování, informuje redaktor časopisu WIRED Maxwell Zeff ve svém newsletteru Model Behavior. Zeff popisuje událost jako zlomový bod v oblasti bezpečnosti AI a kybernetické bezpečnosti a říká, že ještě nikdy neviděl, že by společnost na bezpečnostní incident reagovala takto jednotně. Podle jeho slov si mnoho zaměstnanců interně klade otázku, jaké postupy ve firmě k incidentu vedly a jak se mu v budoucnu vyhnout. Zeff je podle vlastních slov „poměrně optimistický“, že to tentokrát povede ke znatelným změnám. Katie Drummond, globální redakční ředitelka časopisu WIRED, to zařazuje do série aktuálních zpráv, v nichž musí vedení firem zabývajících se AI stále častěji nést odpovědnost za chování svých agentů. → WIRED
Synthszr Take: Pro bezpečnostní týmy je interní prověrka v OpenAI jen okrajovou poznámkou, jejich problémem je rozdíl v rychlosti. Útočník s agenty zkouší varianty sériově a přes noc, zatímco na druhé straně někdo třídí ticket a čeká na schválení. Obranu je tedy třeba automatizovat tam, kde dnes ještě závisí na jednotlivcích: detekce, blokování přihlašovacích údajů, odebírání oprávnění.
OpenAI (II): Obchodní ředitelka Dresser odchází po necelém roce
Obchodní ředitelka OpenAI Denise Dresser opouští společnost po necelém roce v čele prodeje a Go-to-Market. Jejím nástupcem na pozici Chief Revenue Officer se stává Dali Rajic, dříve President a Chief Operating Officer v bezpečnostní firmě Wiz. V blogovém příspěvku OpenAI píše, že Dresser chce „zkoumat jiné příležitosti“; během přechodného období má úzce spolupracovat s obchodním týmem, aby se postarala o zákazníky. Dresser přišla do OpenAI v prosinci 2025 poté, co více než deset let pracovala jako manažerka ve společnosti Salesforce, a byla považována za osobu zodpovědnou za budování korporátního byznysu. Další úkoly převzala, když se COO Brad Lightcap přesunul do nové role se zaměřením na „speciální projekty“. → Business Today
Synthszr Take: Dresser přišla v prosinci 2025 a odchází dříve, než skončí její první celý prodejní rok, a právě do tohoto období spadají první velké rámcové smlouvy korporací s OpenAI. Korporátní byznys je o lidech: Nákupní manažer, který s ní jednal o cenových hladinách, dodatku o ochraně osobních údajů a garancích dostupnosti, nyní sedí před mužem, který ve Wiz řešil bezpečnostní rozpočty a přináší jinou prodejní gramatiku. Vše, co bylo v těchto rozhovorech ústně přislíbeno a nebylo zapsáno do smlouvy, jejím odchodem prakticky zaniká.
OpenAI (III): „Computer History“ zaznamenává kliknutí a stisky kláves na Macu
OpenAI zavedla pro desktopovou aplikaci ChatGPT na macOS funkci nazvanou Computer History, která umožňuje využít předchozí aktivitu na počítači pro pozdější konverzace. Podle Business Today funkce zpracovává události interakce z dříve povolených aplikací a webových stránek: kliknutí, psaní, klávesové zkratky a přepínání mezi aplikacemi. Tyto události jsou v pravidelných intervalech převáděny do textových shrnutí a lokálních paměťových souborů, z nichž ChatGPT vytváří časovou osu aktivity. Uživatelé se pak mohou zeptat, na čem pracovali před přestávkou nebo kde viděli určitý dokument. → Business Today
Synthszr Take: Kliknutí, stisky kláves, klávesové zkratky a přepínání aplikací: to je datový základ, se kterým obvykle pracuje monitorovací software, zde navíc s krokem shrnutí. Rozhodující částí popisu je periodická přeměna na textová shrnutí a lokální paměťové soubory, protože lokálně uložené neznamená lokálně zpracované, jakmile se tato shrnutí objeví jako kontext v budoucích konverzacích. Opt-in a tlačítko pauzy uklidní až tehdy, když bude povolení dostatečně granulární na to, aby se netýkalo správců hesel, okna e-mailu a záložky prohlížeče s hodnocením zaměstnance.
DeepSeek dokončuje rollout V4: varianta Pro dosahuje úrovně agentů Claude Fable 5
Společnost DeepSeek dokončila rollout V4 a podle newsletteru MyClaw nabízí model ve dvou variantách: Pro a Flash. V4 Pro dosahuje podle zprávy na klíčových Agenten-Benchmarks úrovně výkonu Claude Fable 5. Flash je pozicován jako rychlejší a levnější možnost pro každodenní úkoly. Obě varianty jsou nyní k dispozici na platformě pro agenty MyClaw. → MyClaw Newsletter
Synthszr Take: Celá zpráva se vejde do tří řádků: Rollout dokončen, Pro na úrovni Fable 5 v benchmarcích pro agenty, Flash pro každodenní použití, obojí nyní na MyClaw. Tak vypadá zpravodajství, když je cyklus modelů rychlejší než redakční uzávěrka. V březnu zde byl ještě hype kolem OpenClaw a QClaw, o pět měsíců později se zpravodajská hodnota frontier modelu smrskla na otázku, jak rychle ho platforma integruje.
Šéf indické centrální banky chce pomocí AI poskytovat úvěry prvožadatelům a gig workerům
Guvernér indické centrální banky (Reserve Bank of India) Sanjay Malhotra vyzval banky, aby využívaly umělou inteligenci ke schvalování úvěrů žadatelům, kteří by klasickými prověřovacími postupy neprošli. Jmenováni jsou prvožadatelé bez úvěrové historie, pracovníci v gig economy a malé podniky. Jako datový základ Malhotra uvádí platební toky, daňová přiznání, platby za energie a služby a digitální stopy žadatelů. Tím lze rozšířit okruh úvěruschopných osob s nižšími náklady než při tradičním Underwriting. → MyClaw Newsletter
Synthszr Take: Úvěrový model pro gig workery bez úvěrové historie vytváří dva účty: jeden za nesplacené úvěry, který každá banka vidí okamžitě, a druhý za zamítnutí, která nikdy nikdo neuvidí. Malhotra řeší tu jednodušší část problému tím, že odpovědnost ponechává na bance, a nikoli na poskytovateli skóringového modelu. Těžší částí je vysvětlitelnost, protože systém, který účty za elektřinu, daňová přiznání a digitální stopy přepočítá na jedno číslo, zdůvodní své zamítnutí jako pravděpodobnost, a pravděpodobnost není před ombudsmanem žádným zdůvodněním. Lidský dohled v praxi znamená: protokolovat každé zamítnutí a nechat lidi namátkově kontrolovat vzorky, jinak se finanční inkluze stane automatizovaným vyřazováním s hezčím názvem.
X odhaluje algoritmus „Pro vás“ a ukazuje uživatelům jejich vlastní rankingové štítky
Společnost X zveřejnila na GitHubu pod licencí Apache v2 zdrojový kód své časové osy „Pro vás“ včetně základního systému pro hodnocení (ranking), jak informuje TechCrunch. Nově jsou podle společnosti zahrnuty konfigurace modelu, filtry a parametry, kterými se váží jednotlivé signály; zveřejněná kódová základna je tak podle X přibližně desetkrát až patnáctkrát větší než při prvním kroku zveřejnění v lednu. Zároveň se v nastavení spouští stránka s názvem „Under the Hood“: Uživatelé, kteří za poslední měsíc zveřejnili alespoň deset příspěvků, si zde mohou stáhnout své agregované statistiky jako soubor JSON a zjistit, zda byly jejich účtu nebo jednotlivým příspěvkům v posledním kalendářním měsíci přiděleny nějaké štítky, tedy zda byli zasaženi Shadowban. Funkce je nejprve spuštěna jako pilotní projekt pro testovací skupinu účtů starších než jeden rok. Produktový šéf X Keith Coleman řekl pro TechCrunch, že externí výzkumníci si mohli předem sami natrénovat a spustit interní skóringový systém Phoenix s použitím otevřeného kódu. → Techpresso
Synthszr Take: Otevřený kód je symbolická politika, dokud si nikdo nemůže porovnat svá vlastní data; stažení souboru JSON se štítky za poslední měsíc to mění. Desetkrát až patnáctkrát více kódu než při prvním pokusu, včetně vah signálů: To je přesně ta část, kterou si Meta, TikTok a LinkedIn chrání jako obchodní tajemství. Výhoda spočívá v obráceném důkazním břemeni, protože při každém obvinění ohledně dosahu bude X v budoucnu odkazovat na repozitář a soubor, místo aby to popíralo.
63 % sólo zakladatelů na Stripe Atlas: AI agenti nahrazují spoluzakladatele
Podíl startupů založených jednotlivci v USA vzrostl z 23,7 % v roce 2019 na 36,3 % v polovině roku 2025, informuje Linas’s Newsletter s odkazem na Forbes. Na Stripe Atlas, službě pro zakládání amerických korporací, připadlo podle těchto údajů ve druhém čtvrtletí roku 2026 63 % všech nově založených C Corporations na sólo zakladatele, což je historické maximum. Carta eviduje pro rok 2025 podíl 36 % startupů založených jednotlivci mezi všemi startupy registrovanými na její platformě, což je zhruba dvakrát více než před deseti lety. Newsletter to hodnotí jako porušení konvence platné více než deset let: „Sólo zakladatel“ byl v oblasti rizikového kapitálu považován za rizikový faktor a akcelerátory aktivně tlačily uchazeče k vytváření týmů. → Linas from Linas’s Newsletter
Synthszr Take: Po desetiletí byla druhá osoba v pitch decku především snížením rizika, které akcelerátory odstraňovaly doslova dohazováním. Při 63 % sólo založení v jednom čtvrtletí na Stripe Atlas se tato heuristika hroutí a výběrové procesy jako term sheety na to ještě nejsou připraveny: V budoucnu se bude hodnotit jedna osoba spolu s jejím nastavením agentů, nikoli čtyři životopisy s vestingovým plánem. Pro trh práce je dopad tvrdší než pro stranu kapitálu, protože první pozice v mladé firmě v oblasti podpory a juniorního vývoje byly po desetiletí běžným vstupem do profesního života.
SpaceX kupuje Cursor za 60 miliard a trénuje Grok s jeho vývojářskými daty
Společnost SpaceX v pátek dokončila akvizici startupu Cursor zaměřeného na AI kódování za 60 miliard dolarů. Obě společnosti uzavřely v dubnu partnerství, které dalo Muskově vesmírné společnosti právo na koupi; v červnu následoval závazný příslib. Cursor na síti X oznámil, že se stane součástí týmu SpaceXAI a bude pokračovat v práci na Grok Build, Grok Bot, Grok API a na samotném Cursoru. Musk na příspěvek odpověděl jedním slovem: „Welcome.“ Na srpnové telekonferenci k čtvrtletním výsledkům ještě podrobnosti o partnerství tajil, aby nepředbíhal regulátory.
Technicky obě strany již dávno spolupracují. Cursor trénoval Grok 4.5 společně se SpaceX a podle vlastních údajů k tomu použil biliony tokenů dat z Cursoru; byl to první model společnosti, který nebyl vytvořen výhradně pro vývoj softwaru. Na ve středu zveřejněném Grok 4.6 se také podílel Cursor. Na oplátku získal startup přístup ke Colossus, superpočítači od SpaceX s 200.000 Nvidia-GPU. Cursor píše, že nyní disponuje největší flotilou GPU na světě a může tak nabízet výkonnější modely za nižší provozní náklady; to je tvrzení samotné společnosti.
Morgan Stanley odhaduje, že by Cursor mohl v roce 2026 přispět k tržbám SpaceX přibližně 2,5 miliardami dolarů a v roce 2027 13 miliardami. Analytici v tom vidí základ pro výrazně optimističtější hodnocení, pokud si platforma pro kódování udrží své tempo růstu. SpaceX vstoupila na burzu v červnu, umístila 555,56 milionu akcií a získala přibližně 75 miliard dolarů. V IPO-dokumentech bylo výslovně uvedeno, že část výnosů půjde na rozšíření výpočetní infrastruktury pro AI.
Zároveň Musk na interním setkání všech zaměstnanců požádal, aby se považovali za „rodiče“ firemní AI. Společnost chce trénovat Grok na „souhrnu“ svých informací, včetně práce a příspěvků zaměstnanců, a nechat model zdědit jejich „myšlenky, nápady a přesvědčení“. Jaké kategorie dat budou konkrétně zahrnuty a jak se s nimi bude zacházet, SpaceX dosud veřejně nevysvětlila; žádost o vyjádření zůstala bez odpovědi. Společnost Meta v dubnu v rámci iniciativy Model Capability Initiative zaznamenávala pohyby myši, kliknutí, stisky kláves a snímky obrazovky zaměstnanců, proti čemuž podepsalo petici přibližně 1 600 zaměstnanců.
Musk na stejném setkání prohlásil, že tržby z AI by již v září mohly překonat všechny ostatní obchodní aktivity SpaceX. Deset gigawattů výpočetní kapacity by podle jeho výpočtů generovalo roční tržby ve výši 300 až 500 miliard dolarů. V současné době má SpaceX přibližně 1,4 gigawattu a cílí na deset gigawattů do konce roku 2027. Starlink je nyní dostupný ve 167 zemích a má přibližně 22 milionů mobilních uživatelů. → Bloomberg, Cursor, Fortune, Business Insider, The American Bazaar
Synthszr Take: Cursor dodal kupní cenu předem, a to ve formě bilionů tokenů z reálné vývojářské práce, kterými byl trénován Grok 4.5. Zbytek je otázkou vytížení: 1,4 gigawattu je třeba zaplatit a očekávané tržby Cursoru ve výši 13 miliard dolarů pro rok 2027 jsou nejpravděpodobnější odpovědí, kterou si Musk mohl právě koupit. Asistent pro kódování je pro SpaceX především stroj, který každý pracovní den zaměstnává Colossus a na oplátku vrací čerstvá tréninková data. Muskova prosba k zaměstnancům, aby se považovali za rodiče AI, spadá do stejné kalkulace, jen u Mety se proti přesně této logice podepsalo 1 600 lidí. Pokud by tržby z AI, jak bylo oznámeno, již v září překonaly všechny ostatní obchodní aktivity SpaceX, byl by to nejdražší prodejní kanál, jaký si kdy kdo pořídil pro vlastní výpočetní čas.



