Musk láká na nové vydání Grok 4.6: „objektivně #1“
- • Grok 4.6 předčí Kimi K3 a dosahuje 61 bodů v AI-Indexu
- • Lovable si zajišťuje 400 milionů dolarů a vstupuje i EU
- • Mistral plánuje do roku 2030 jeden gigawatt vlastního výpočetního výkonu pro AI v Evropě
Grok 4.6 je lepší než Kimi K3 a levnější než OpenAI
Společnost SpaceXAI, dříve známá jako xAI, ve středu vydala Grok 4.6, a to necelý měsíc po Grok 4.5. Model dosahuje 61 bodů v indexu Artificial Analysis Intelligence Index, což je souhrnná hodnota z devíti benchmarků, a předstihuje tak čínský open-weights model Kimi K3 od společnosti Moonshot a je na stejné úrovni jako GPT-5.6 Sol Max od OpenAI. Před Grokem jsou už jen Claude Opus 5 od Anthropic s 63 body a Claude Fable 5 s 62 body. Oproti Grok 4.5 High, který měl 56 bodů, je to o pět bodů více.
Cena API zůstává 2 dolary za milion vstupních tokenů a 6 dolarů za milion výstupních tokenů, přičemž od 200 000 prompt tokenů se obě sazby zdvojnásobují. Podle výpočtů The Decoder je tak Grok 4.6 o více než 60 procent levnější než Claude Opus 5 (5/25 dolarů) a GPT-5.6 Sol (5/30 dolarů). Model je nyní k dispozici prostřednictvím API, v nástroji Cursor, v interním kódovacím nástroji Grok Build (součást předplatného SuperGrok od 30 dolarů měsíčně) a u partnerů jako OpenRouter, Vercel a Cloudflare. V prvním týdnu poskytuje SpaceXAI v nástrojích Cursor a Grok Build dvojnásobný objem zahrnutých tokenů.
Technicky SpaceXAI popisuje delší doplňkový tréninkový cyklus než u Grok 4.5, s kurátorovanými, modelem generovanými daty pro usuzování a technickými daty, a také se změněným optimalizátorem. Následně byly s Grok 4.5 nově vytvořeny trajektorie pro Supervised Fine-Tuning napříč různými úrovněmi usuzování, agent-harnesses a doménami a nápadné průběhy byly vyřazeny pomocí modelově založené kontroly. Reinforcement Learning se zaměřilo na agentní prostředí, jako je obecné kódování, optimalizace jádra, vývoj webu a CAD. Podle poskytovatele model u dlouhých řetězců úkolů častěji kontroluje vlastní dílčí práci, než pokračuje; toto tvrzení není nezávisle ověřeno.
Jednotlivé hodnoty jsou podle The New Stack nekonzistentní. Na CursorBench v3.2 dosahuje Grok 4.6 69,9 procenta (Grok 4.5: 66,7) a je před GPT-5.6 Sol Max s 67,2 procenty, ale za Fable 5 Max se 70,5 procenty. Na DeepSWE v1.1 stoupá hodnota z 54 na 65,9 procenta, zatímco Sol Max dosahuje 73 a Fable 5 Max 70 procent. V případě Terminal-Bench v3.0 se Grok zlepšuje z 15,7 na 26 procent, ale stále výrazně zaostává za Solem (34,6) a Fablem (34,1). Na benchmarku pro znalostní práci GDPval-AA v2 se model s Elo hodnocením 1 753 umisťuje na druhém místě za Claude Opus 5 a na složité úkoly potřebuje přibližně 53 kroků, zatímco Opus 5 jich potřebuje asi 103.
Elon Musk na síti X prohlásil, že Grok 4.6 je „objectively #1 when considering intelligence, speed & cost“. Gizmodo poukazuje na to, že návrat do vedoucí skupiny se časově shoduje s akvizicí poskytovatele kódovacích nástrojů Cursor, jehož reálná uživatelská data měla být údajně zahrnuta již do tréninku Grok 4.5. Den před vydáním modelu představila SpaceXAI beta verzi Grok Bot, systému pro trvale běžící agenty. Gizmodo zároveň konstatuje, že Grok se na veřejnosti proslavil především masovým generováním nahých obrázků bez souhlasu a že několik amerických úřadů vyjádřilo obavy o bezpečnost. → venturebeat, thenewstack, x, gizmodo, the-decoder
Synthszr Take: 61 bodů je aritmetický kompromis z devíti benchmarků a tento kompromis zahlazuje to, co v každodenní praxi dělá rozdíl. Na Terminal-Bench v3.0 má Grok 4.6 26 procent, zatímco Sol a Fable přes 34: V prostředí, které hodně pracuje v shellu, je to třetinové zaostávání, které je v souhrnném hodnocení zakryto silnými výsledky z CursorBench a FrontierCode. Nejvýmluvnější číslo z celé zprávy se v indexu vůbec neobjevuje: 53 kroků místo 103 u srovnatelných úkolů GDPval, protože počet kroků se přímo promítá do nákladů, zatímco jeden bod v indexu nikoho nic nestojí. Muskův výrok „objectively #1“ je logickým důsledkem toho, že se jediným prodejním argumentem stalo jediné číslo, ačkoli vychází z devíti velmi odlišných testů. Pokud váš agent optimalizuje jádro, bude na špici jiný model, než když vytváří prototypy frontendu, a žádný z těchto případů se v žebříčku neobjeví. Spustit deset skutečných tiketů z vlastního backlogu proti třem modelům a změřit náklady na vyřešený tiket: to je práce na dvě odpoledne a odpověď je spolehlivější než jakákoli pozice v leaderboardu.
Fond EU vstupuje do společnosti Lovable
Stockholmský startup Lovable získal v investičním kole Series C 400 milionů dolarů a je oceněn na 13,3 miliardy dolarů. Platforma umožňuje uživatelům vytvářet software pomocí popisu v přirozeném jazyce, což je metoda nyní známá jako Vibe Coding. Jako první o tom informoval Wall Street Journal; dříve se hovořilo o 300 milionech při ocenění 13,2 miliardy. Společně s Menlo Ventures je hlavním investorem Scaleup Europe Fund, investiční nástroj EU spravovaný švédskou společností EQT, který podle agentury Bloomberg disponuje kapitálem ve výši pěti miliard eur. Lovable je jednou z prvních zveřejněných investic tohoto fondu, jehož deklarovaným cílem je zabránit odlivu evropských růstových firem do Ameriky. Společnost uvádí, že ke konci měsíce směřuje k roční míře tržeb (run rate) ve výši téměř 600 milionů dolarů, což je podle jejích vlastních údajů téměř trojnásobek hodnoty uvedené v prosinci, a plánuje navýšit počet zaměstnanců o 50 procent na 450 osob. Mezi zákazníky patří Nvidia, Adidas, Hearst a Deutsche Telekom. → Techpresso
Synthszr Take: Ocenění se za osm měsíců zdvojnásobilo, míra tržeb (run rate) se za stejnou dobu téměř ztrojnásobila. V prosinci stálo 6,6 miliardy při run rate přes 200 milionů více než dnes 13,3 miliardy při 600 milionech: násobek tržeb klesl z přibližně 33 na zhruba 22, zatímco venku se mluví o bublině. Cena tedy zaostává za byznysem a právě to je skutečný signál boomu Vibe Coding: náklady na vývoj softwaru klesly natolik, že každý týden vzniká 1,2 milionu nových projektů, tedy staví se věci, které se dříve prostě nevyplatily. Slabinou je poločas rozpadu tohoto růstu. Míra tržeb je jen momentka a nikdo neví, kolik z 60 milionů projektů bude za rok ještě běžet, natož aby za ně někdo platil. Zendesk je zároveň zákazníkem i korunním svědkem skepse, když jeho vlastní produktový ředitel veřejně prohlašuje, že spolehlivost v takovém měřítku nestačí. Certifikaci a pojistku od Lloyd’s si můžete koupit, ale spolehlivý kód ne: zda se z 600 milionů stane udržitelný byznys, se rozhodne podle toho, co vygenerovaný kód vydrží v produkčním provozu.
Mistral chce do roku 2030 v Evropě vybudovat vlastní výpočetní výkon pro AI o velikosti jednoho gigawattu
Mistral oznamuje, že do roku 2030 vybuduje v Evropě výpočetní kapacitu až o velikosti jednoho gigawattu. Společnost tento krok zdůvodňuje cílem vytvořit suverénní infrastrukturu, tedy základnu pro AI, která nepoběží v datových centrech amerických poskytovatelů. Podle TLDR IT již Mistral usiluje o dlouhodobé závazky zákazníků, aby si zajistil expanzi. Doposud francouzská společnost provozuje své modely převážně na cizí infrastruktuře, mimo jiné u Microsoft Azure, Google Cloud a CoreWeave. Na začátku roku 2026 získal Mistral 722 milionů eur na vybudování vlastních datových center s hardwarem od NVIDIA ve Francii a Švédsku. Nyní zmíněná gigawattová hranice je cílovou hodnotou do konce desetiletí, nikoli stávajícím stavem výstavby. → TLDR IT
Synthszr Take: Jeden gigawatt do roku 2030 je v Evropě průmyslově-politické prohlášení a je tak i myšleno. To číslo zní velkolepě, dokud ho nepostavíte vedle stamilionových částek v řádu miliard, které američtí poskytovatelé investují do datových center jen v příštích dvou letech. Zajímavější než kapacita je věta, která za tím stojí: Mistral hledá dlouhodobé závazky zákazníků, než se bagry dají do pohybu. Suverenita se tak stává smlouvou, kterou evropské firmy musí podepsat, a právě zde se rozhodne, zda se z oznámení stane beton. Dokud budou nákupní a IT oddělení nadále optimalizovat podle ceny za token u hyperscalerů, zůstane ten gigawatt jen tiskovou zprávou s poznámkou pod čarou. Pro průmyslový podnik s daty o strojích, procesech nebo konstrukci je evropské kotevní nájemnictví dostupnou pojistkou proti politickým náhodám, rozhodně levnější než pozdější migrace pod časovým tlakem. Napínavou otázkou příštích dvanácti měsíců není, zda Mistral dokáže stavět, ale kdo podepíše smlouvy.
Gemini dosáhl miliardy uživatelů, ChatGPT tam byl už o několik týdnů dříve
CEO společnosti Google Sundar Pichai na síti X oznámil, že aplikace Gemini měsíčně oslovuje miliardu lidí a je tak nejrychleji rostoucím produktem v historii firmy. Je to 14. produkt od Googlu, který tuto hranici překročil. OpenAI této mety dosáhla již dříve: zpráva, že „ChatGPT používá více než miliarda lidí“, se objevila 6. srpna v blogovém příspěvku o scénářích použití, zatímco externí data podle agentury Reuters naznačovala miliardu již v červnu. Mluvčí OpenAI Lindsay McCallum uvedla, že počet Monthly Active Users překročil miliardu již před delší dobou a hranice týdenních uživatelů padla v červenci; konkrétní měsíční číslo společnost neuvádí. V únoru OpenAI hlásila 900 milionů týdně aktivních uživatelů, Google ve stejné době 750 milionů měsíčních uživatelů Gemini a na konci července pak 950 milionů. Šéf Gemini Josh Woodward napsal, že aplikace má přes 100 milionů aktivních uživatelů na iOS, což umisťuje drtivou většinu uživatelské základny na Android. Anthropic počty uživatelů nezveřejňuje; odhady se pohybují v řádech desítek milionů. → MyClaw Newsletter
Pohled Synthszr: Pichai oznámí miliardu v příspěvku, OpenAI ji zmíní v blogovém článku o případech použití. Hlasitost je nepřímo úměrná pozici na trhu a existuje pro to číslo: z 900 milionů v únoru na miliardu v červenci je to zhruba jedenáct procent za pět měsíců. Gemini ve stejném období vzrostl ze 750 na 950 milionů. Pro produkt, který byl léta v každé prezentaci uváděn jako nejrychleji rostoucí software všech dob, je vlastní křivka růstu tou nejnepříjemnější zprávou léta, proto ten tichý tón. Číslo Googlu má však jeden háček: dobrých 100 milionů aktivních uživatelů na iOS, zbytek na Androidu, kde je Gemini nainstalován již při rozbalení zařízení. To je distribuce maskovaná jako poptávka a vysvětluje to celkem přesně, proč OpenAI od léta investuje do vlastního hardwaru. Obě společnosti teď sedí na miliardě lidí a stejné otevřené otázce, kdo z nich vlastně platí.
Y Combinator uvolňuje svůj interní framework pro agenty QM pod licencí MIT
Y Combinator zveřejnil na GitHubu QM (zkratka pro Quartermaster), framework, který akcelerátor předtím měsíce používal pouze interně. Repo jej popisuje jako multiplayerový Agent Harness pro práci, použitelný ve Slacku a na webu. Podle YC systém běžel interně v účetnictví, v právním oddělení, v eventovém týmu a v engineeringu, přičemž QM byl vyvíjen pomocí samotného QM. Licence je MIT, podle newsletteru od Linase tak tým platí pouze za cloudový hosting a model-tokens. Zveřejnění přišlo deset dní po open-source vydání Buzz od společnosti Block, pracovního prostředí pro agenty založeného na Nostr, které chce nahradit Slack a GitHub, zatímco QM staví na stávajícím Slacku. → Linas from Linas’s Newsletter
Pohled Synthszr: Licence MIT znamená kopírovat, upravovat, komerčně využívat, aniž byste se kohokoli ptali na svolení. Pro všechny, kdo netrénují model a nezískávají investiční kolo, je tak k dispozici koordinační vrstva, na které většina projektů s agenty v posledním roce ztroskotala: několik lidí a několik agentů v jednom vlákně, sledovatelně, s jasným rozdělením úkolů. To, že se QM integruje do stávajícího Slacku, snižuje vstupní bariéru na jedno odpoledne, zatímco Buzz od Blocku vyžaduje, aby tým přesunul veškerou svou spolupráci. Těch 13 000 hvězdiček měří jen zvědavost, nic víc. Skutečná práce spočívá v oprávněních a v rozhodnutí, jaké úkoly agentovi vůbec svěřit, a to zůstává na týmu.
OpenAI přináší ChatGPT včetně Codexu nativně na Linux, s přístupem k lokálním repozitářům
OpenAI zveřejnilo preview oficiální desktopové aplikace ChatGPT pro Linux, poté co byl program léta dostupný pouze pro Mac a Windows. Podle AlphaSignal se jedná o nativní aplikaci, žádný wrapper prohlížeče ani nástroj příkazového řádku. Zahrnuje tři součásti: známého asistenta ChatGPT, ChatGPT Work pro týmové a pracovní úkoly a Codex, Coding-Agent, který umí číst lokální soubory, pracovat v existujících repozitářích a ovládat aplikace na počítači. Podporovány jsou Ubuntu 24.04 a 26.04 LTS, Debian 13 a Fedora 43 a 44. Instalace probíhá prostřednictvím balíčků .deb nebo .rpm pro x64 a ARM64, přičemž instalační program navíc přidá repozitář OpenAI, takže aktualizace probíhají přes apt. Stažení je zdarma, jednotlivé funkce vyžadují placený tarif. → AlphaSignal
Pohled Synthszr: Agent se přesouvá na stroj, kde leží zdrojový kód, a správa oprávnění je tam jako z roku 1995: jeden unixový uživatel, kterému patří vše, co se nachází v jeho domovském adresáři. Současně vědci ukazují, že šifrované „reasoning bloby“ od Claude, GPT a Gemini jsou přenositelné. Vezmete blob z modelu Opus, přesunete ho do levnějšího Haiku a model poslušně přečte obsah, zcela bez prolomení šifrování. Skenování přibližně 7 000 veřejně sdílených záznamů (traces) odhalilo 62 API klíčů, 33 e-mailových adres a 33 hesel. Laboratoře po zveřejnění provedly nápravu, ale načasování zůstává nevyvážené: hloubka přístupu roste v řádu týdnů, ochranné mechanismy v řádu čtvrtletí. V praxi to znamená dát agentovi vlastního systémového uživatele, zpřístupňovat repozitáře jednotlivě a přesunout přístupové údaje z projektových souborů do „secret store“; to je hotové za jedno odpoledne, instalace .deb trvá minutu. Agent s právem čtení celého domovského adresáře je rozhodnutí, ne výchozí nastavení.
Perplexity blokuje reklamy Times pro AI agenty a hrozí vydavatelům snížením skóre důvěryhodnosti
Společnost Perplexity potvrdila, že blokuje reklamu, kterou Time odnedávna zobrazuje v markdown verzích svých webových stránek, tedy ve verzi, kterou stahují AI agenti namísto lidských čtenářů. Digiday o tom informoval zhruba dva týdny předtím s tím, že Time jako první vydavatelství prodává takovéto reklamy pro agenty. Šéf komunikace Perplexity Jesse Dwyer označil formát pro Digiday za klamavý a uvedl, že vydavatelé, kteří používají „deceptive advertising like markdown ads“, riskují snížení hodnocení ve firemním vyhledávacím indexu včetně snížení Trust Score. Jak Perplexity definuje „klamavý“ a jak technicky funguje blokování, společnost neuvedla; Steven Liss z OpenAds.AI se pro Digiday domnívá, že agenti jsou jednoduše instruováni, aby reklamní bloky nestahovali. Samotný reklamní produkt pochází od reklamně-technologické firmy Mobian, která z briefingu značky vytváří obsah v Markdown formátu FAQ, vkládá jej na stránky Time a měří, jak často jej AI vyhledávače zachytí. Prvními kupci byly Ally Bank a Project Management Institute; zda budou jejich smlouvy upraveny, není jasné. Šéf Mobianu Jonah Goodhart pro Digiday uvedl, že odezva na formát byla dosud pozitivní, ale neuvedl žádná čísla. → MyClaw Newsletter
Pohled Synthszr: Time viděl zjevnou díru a pokusil se ji ucpat. Agent čte stránku, reklamní banner už nikdo nevidí, takže se sdělení prodá stroji. Tento plán ale funguje jen tehdy, pokud stroj spolupracuje, a Perplexity se za méně než dva týdny rozhodl, že spolupracovat nebude. Zajímavá je asymetrie v odůvodnění: to, co Time prodává jako ověřenou a označenou informaci značky, index jednostranně klasifikuje jako klamání, a Trust Score je hned vedle použit jako nátlakový prostředek. Ally Bank a Project Management Institute zaplatily za zviditelnění, Time dodal obsah a stažení agentem stále nic nestojí Perplexity. Dokud to tak zůstane, je jakákoli monetizace prostřednictvím obsahu stránky jen pokusem projít kolem pokladny bez souhlasu vrátného. Spolehlivou variantou je vyjednaná cena za stažení, se smlouvou namísto skrytého textového řádku. Všechno ostatní končí hrou na kočku a myš, kterou vydavatel prohraje.
Peking počítá 140 bilionů tokenů denně a činí z nich oficiální ekonomický ukazatel
Odborný newsletter Hello China Tech tvrdí, že čínský trh s AI lze přesněji sledovat prostřednictvím objemu tokenů, veřejných zakázek a cen než prostřednictvím žebříčků benchmarků modelů. Důvodem je březnové rozhodnutí Pekingu: Token, tedy nejmenší zpracovatelská jednotka, na kterou jazykové modely dělí texty, byl povýšen na oficiální ekonomický ukazatel. Autor uvádí jako výchozí hodnotu přibližně 140 bilionů denně zpracovaných tokenů na čínském trhu. Tím vzniká státem vykazované číslo spotřeby pro využití AI, srovnatelné s ukazateli pro elektřinu nebo nákladní dopravu. Autor si klade otázku, co tento účetní rámec zobrazuje a co naopak skrývá, a poukazuje na to, že tento argument přednesl již v listopadu a v dubnu ho dále rozvinul. Článek neuvádí žádná čísla o složení objemu ani o metodě sběru dat. → Hello China Tech
Pohled Synthszr: 140 bilionů tokenů denně je údaj o spotřebě, podobně vypovídající jako kilowatthodiny nebo tuny nákladu. Ukazuje, kolik dat proteče datovými centry, ale mlčí o tom, zda přitom někdo vyřešil nějaký problém. Model, který musí začít třikrát znovu, protože první dvě odpovědi byly nepoužitelné, vygeneruje třikrát více tokenů než ten, který se trefí napoprvé: neúspěšný pokus vypadá v indexu lépe než čisté řešení. K tomu se přidává dynamika cen: pokud ceny tokenů klesají rychleji, než roste jejich množství, ukazatel stoupá, zatímco tržby klesají. Veřejné zakázky a ceníky, které Hello China Tech sleduje souběžně, jsou tvrdší měnou, protože tam je vidět, kdo skutečně pokládá peníze na stůl. Index spojuje debatu se skutečnou poptávkou namísto výsledků testů, což se žebříčkům benchmarků dosud nepodařilo. Zajímavé to bude v okamžiku, kdy Peking rozdělí toto číslo podle odvětví: pak se ukáže, zda tokeny plynou do výroby a administrativy, nebo do chatbotů, které nikdo nepotřebuje.
Spotify označuje umělce vytvořené AI jako „AI Persona“ a vyřazuje je z doporučení
Spotify bude od poloviny září označovat profily umělců, jejichž identita je uměle vytvořena, odznakem „AI Persona“ a jejich hudbu standardně vyřadí z redakčních a algoritmických doporučení. Společnost tuto změnu oznámila v úterý. Umělci se mohou sami označit jako AI Persona, ale podle poskytovatele se Spotify nespoléhá pouze na toto vlastní prohlášení, ale dodatečně profily prověřuje, zda jméno a obrazový materiál nenaznačují fotorealisticky vytvořenou identitu. Kontrola začíná u profilů, které překročily předdefinované prahové hodnoty počtu posluchačů, aby byly nejprve zachyceny nejposlouchanější účty. Odznak se objeví v banneru profilu, v sekci „O mně“, ve vyhledávání a v řádcích skladeb v playlistech. Hudba od AI Persona se dostane do personalizovaných doporučení pouze tehdy, pokud uživatel aktivně sleduje daný profil. Toto pravidlo rozšiřuje směrnici Spotify pro AI ze září 2025, která již označuje skladby podle oborového standardu a zakazuje neautorizované Voice Cloning a deepfakes. → AI Secret
Synthszr Take: Pro posluchače je skutečnou otázkou, co znamená absence odznaku. Spotify podle vlastních slov nejprve kontroluje profily nad definovanými prahy poslechovosti, což v důsledku znamená, že u obrovského množství profilů pod touto hranicí chybějící označení pouze říká, že se na ně ještě nikdo nepodíval. Oznámení o transparentnosti, které je chápáno jako výrok o pravosti, ale je pouze výrokem o stavu kontroly, vytváří přesně tu nesprávnou důvěru. Tvrdší než odznak je druhá část: Kdo vypadne z redakčních a algoritmických doporučení, ztratí jediný distribuční kanál, který na Spotify skutečně přináší dosah. Od té chvíle se finančně vyplatí původ zakrývat. Zajímavým číslem proto nebude počet udělených odznaků, ale doba mezi nahráním nového profilu a jeho klasifikací. Pokud zůstane v řádu týdnů, je označení jen cedulí na otevřených dveřích. Smysluplný by byl třetí stav v rozhraní: zkontrolováno, nezkontrolováno, AI. Tři stavy jsou upřímnější než odznak, který hovoří jen jedním směrem.
CoEvoSkills nechává AI agenty, aby si sami psali a kontrolovali své balíčky skillů
Výzkumný tým vedený Hanrongem Zhangem a Philipem S. Yu představil metodu CoEvoSkills, pomocí které si agenti mohou takzvané skills vytvářet samostatně, místo aby je dostávali napsané ručně. Skills jsou koncept zavedený společností Anthropic: Zatímco tool je jedna ucelená funkce, skill se skládá ze strukturovaného balíčku vzájemně závislých souborů pro vícestupňové odborné úkoly. Autoři tvrdí, že manuální tvorba takových balíčků je náročná a vede k nesrovnalostem mezi lidským a strojovým chápáním úkolů, což snižuje výkon agentů v hodnoceních na SkillsBench. Stávající metody sebezdokonalování jsou prý přizpůsobeny jednotlivým toolům a kvůli vyšší složitosti je nelze přímo přenést na skills. CoEvoSkills proto spojuje Skill Generator, který balíčky postupně přepracovává, s Surrogate Verifier, který je vyvíjen souběžně a poskytuje zpětnou vazbu, aniž by znal skutečný obsah testů. Podle autorů metoda na SkillsBench překonává pět srovnávacích metod jak s použitím Claude Code, tak Codexu, a je přenositelná na šest dalších jazykových modelů. Práce byla přijata na konferenci COLM, kód je veřejně dostupný na GitHubu. → Techpresso
Synthszr Take: Zajímavá část se skrývá ve verifikátoru, ne v generátoru. Fine-tuning posouvá váhy v black boxu, nikdo si nemůže zpětně v diffu přečíst, co se změnilo. Skill je balíček souborů: čitelný, verzovatelný, smazatelný. Přesně proto je sebezdokonalování na této úrovni provozně zvládnutelné, zatímco v rámci vah modelu zůstává problémem důvěry. Skutečnou technickou sázkou této práce je, že ověřovatel, který vůbec nevidí ground-truth testy, přesto poskytuje použitelnou zpětnou vazbu a při souběžném vývoji nezačne přikrášlovat výsledky svého vlastního generátoru. To, že to funguje napříč šesti dalšími jazykovými modely, je silnějším signálem než vítězství nad pěti baselines. Prakticky to znamená, že knihovna vlastních skillů se stává aktivem, o které se pečuje jako o kód, včetně review, rollbacku a vlastnictví. Když si agenti píší své vlastní pracovní pokyny, inženýrská práce se přesouvá k otázce, co definuje dobrý skill, a tato kritéria nemůže dodat žádný vědecký článek, ta pocházejí z vlastní domény. Za dvanáct měsíců nebude zajímavějším ukazatelem, kolik skillů agent vygeneroval, ale kolik z nich člověk po nahlédnutí do repozitáře opět vyhodil.



