Exploze nákladů na tokeny: Čína využívá příležitosti
- • Firmy zažívají šok z rozpočtů na AI, hrozí drahé chyby.
- • Xiaomi revolucionalizuje trh se slevami až 99 procent.
- • StepFun přináší levný vysoce výkonný smíšený model s působivými čísly.
Náklady na AI explodují: Firmy přidělují tokeny na příděl a hledají ROI
Firmy v roce 2024 zahájily fázi experimentování s AI s otevřenou peněženkou a nyní tvrdě narážejí na realitu: některé již po třech měsících spálily svůj roční rozpočet. Uber v březnu vyčerpal celý svůj rozpočet na agentickou AI, CTO společnosti Meta Andrew Bosworth interně varuje před nesmyslným plýtváním tokeny a v jedné špičkové finanční instituci zaměstnanci měsíčně pálí statisíce dolarů za nejjednodušší dotazy na prémiové modely. Poskytovatelé mezitím přešli z modelů „all-you-can-eat“ na účtování podle spotřeby, zatímco Google již měsíčně zpracovává 3,2 bilionu tokenů – což je sedmkrát více než před rokem. To, co bylo zamýšleno jako signál pro Wall Street, se stává pastí nákladů: firmy nyní omezují přístup k AI na příděl, směřují zaměstnance k levnějším modelům a Microsoft dokonce omezuje přístup k Anthropic Claude pro vývojáře, kteří mají místo toho používat interní nástroje. → Wall Street Journal
Synthszr Take: Večírek skončil. Po roce „tokenmaxxing“ – kdy zaměstnanci používali AI jako samoúčel – přichází účet. Jeden z vedoucích pracovníků to trefně přirovnává: „Když vaše dcera potřebuje doučování z algebry, nemusíte platit Alberta Einsteina.“ Je to klasický cyklus humbuku, jen v rekordní rychlosti: nejprve vše řešit prémiovými modely, pak zjistit, že 82 % výdajů nepřináší žádný měřitelný užitek. Skutečný příběh je ale jiný: právě zažíváme zrod počítačové disciplíny. Firmy se (bolestivě) učí, že integrace AI není technologický problém, ale problém organizační. Kdo si nyní vybuduje správné struktury řízení a propojí využití tokenů s obchodními výsledky, bude mít za dva roky obrovský náskok.
Xiaomi: globální platforma pro AI tokeny snižuje cenu až o 99 %
Xiaomi oznamuje drastické snížení cen pro své MiMo-V2.5-API a zároveň ukončuje pobídkový program na 100 bilionů tokenů. Ceny klesají až o 99 %, zatímco využití tokenů pro stávající uživatele se zvyšuje 5 až 8krát. Nová cenová struktura platí celosvětově od 27. května 2026. Pobídkový program pro tvůrce, který běžel od dubna, byl předčasně ukončen poté, co bylo všech 100 bilionů tokenů plně rozděleno. Technicky je snížení cen umožněno optimalizovanými inferenčními systémy: s HiCache na bázi SWA klesá objem dat KV-cache na sedminu, zatímco počet uložitelných tokenů se pětinásobně zvyšuje. Xiaomi pozicuje platformu jako globální alternativu k západním poskytovatelům AI s cílem „umožnit více lidem používat lepší modely“. → Hello China Tech
Synthszr Take: Xiaomi zde dělá klasický čínský tah: rozdrtit ceny, navýšit objem, převzít trh. 99% snížení ceny při současném 5 až 8násobném zvýšení výkonu – to není optimalizace, to je vzkaz pro OpenAI a Anthropic. Technické detaily (snížení KV-cache na sedminu) ukazují skutečnou inženýrskou práci namísto pouhého dotování. To, co Xiaomi nazývá „MiMo Orbit“, by mohlo být začátkem globální tokenové platformy, která cenově převálcuje západní poskytovatele. Předčasné ukončení programu na 100 bilionů tokenů naznačuje masivní poptávku. Bude zajímavé sledovat, zda si Xiaomi udrží kvalitu, nebo zda se zde odehrává stará hra: nejprve zaplavit trh, poté zvýšit ceny.
StepFun: Model se 198 miliardami parametrů za cenu GPT-4o-mini
StepFun zveřejňuje na Hugging Face model Mixture-of-Experts Vision-Language se 198 miliardami parametrů, který na jeden token využívá pouze 11 miliard parametrů. Model dosahuje rychlosti 400 tokenů za sekundu s kontextovým oknem 256k a nabízí tři volitelné úrovně úsudku (reasoning). Vtip je v tom, že s cenou 0,20 dolaru za milion vstupních tokenů se pohybuje v cenové relaci GPT-4o-mini, ale podává výrazně vyšší výkon. Na SimpleVQA (Search) dosahuje 79,2 bodu, na SWE-Bench PRO druhé místo s 56,3 – model dokáže samostatně procházet repozitáře s více soubory a generovat funkční patche. Dostupnost přes StepFun Open Platform (globálně i v Číně), OpenRouter a NVIDIA NIM umožňuje jeho okamžité produktivní využití. → AINews
Synthszr Take: Známe to: výkon světové třídy za zlomek západních cen. 198 miliard parametrů zní ohromně, ale skutečnou pákou je sparse MoE architektura s pouhými 11 miliardami aktivních parametrů – masivně šetří výpočetní výkon při stejném výkonu. Tři úrovně úsudku (reasoning levels – nízká, střední, vysoká) jsou navrženy pragmaticky: vývojáři mohou přepínat mezi rychlostí a hloubkou podle případu použití. Skutečnost, že model běží na Mac Studio se 128 GB RAM, ukazuje novou realitu: špičková AI se stává komoditou. Co mě ale zaráží: extrémně nízké ceny za tento výkon naznačují masivní dotace. StepFun pravděpodobně pálí kapitál za tržní podíly – otázkou je, jak dlouho to vydrží.
Internet se přezbrojuje: Stroje místo lidí
Cloudová infrastruktura byla dosud zaměřena na lidi: předvídatelné kliky, posouvání a streamy. AI agenti se chovají jinak. Bleskově spouštějí stovky databázových dotazů, prohledávají dokumenty a volají API – a stejně rychle zase mizí. Amazon na to reaguje a přestavuje jádro své cloudové infrastruktury. AWS představilo novou generaci OpenSearch Serverless: systém navržený speciálně pro nepředvídatelné pracovní vzorce AI agentů. Během několika sekund se škáluje nahoru, když jsou agenti aktivní, a klesá na 0, když pauzírují. Cloudflare hlásí, že boti již tvoří 31 % veškerého HTTP provozu. „Nelidský provoz předstihne lidský provoz v první polovině roku 2027,“ předpovídá manažerka Cloudflare Lai Yi Ohlsen. → TechCrunch
Synthszr Take: Internet se stává infrastrukturou pro stroje. AWS nyní odděluje výpočetní výkon (compute) od úložiště (storage) – dříve musela běžet alespoň jedna instance, jako trvale pronajaté parkovací místo. Nyní zákazníci platí pouze za skutečné využití. Google se chce do konce roku stát zároveň vstupní i výstupní stránkou webu (jak jsem psal po I/O). Důsledek: Kdo dnes ještě buduje infrastrukturu pro lidské vzorce klikání, vyvíjí pro včerejšek. Databricks a Snowflake se již pozicují jako paměťové systémy pro AI. Každý vedoucí pracovník se může rozhodnout hned zítra ráno: investice do infrastruktury musí být koncipovány s prioritou pro agenty (agent-first), jinak budete v roce 2027 platit za prázdná parkovací místa.
Anthropic a xAI: Kdo říká pravdu?
Společnost Anthropic si pronajala cluster Colossus od xAI – za 1,25 miliardy dolarů měsíčně. Jedná se o největší transakci s výpočetním výkonem v historii AI. Ale zatímco dokument S-1 společnosti xAI jasně hovoří o tříleté době trvání do května 2029, Elon Musk na Twitteru píše o 180denním pronájmu s 90denní výpovědní lhůtou. Rozpor mezi dokumentem pro SEC („zákazník souhlasil s placením měsíčního poplatku do května 2029“) a tweetem CEO („Jedná se o 180denní pronájem“) vyvolává otázky: buď Musk špatně uvedl detaily své vlastní smlouvy, nebo je dokument S-1 zavádějící. Obojí by bylo problematické během období klidu (Quiet Period) před vstupem na burzu. Muskovo zdůvodnění: pokud by byl výpočetní výkon (compute) nedostatkový, chtějí si ponechat možnost získat kapacity zpět. → Techpresso
Synthszr Take: 15 miliard dolarů ročního obratu od jediného zákazníka – to je působivé i na Muskovy poměry. To, co se zde jeví jako zmatek v detailech smlouvy, ukazuje na hlavní problém ekonomiky AI: výpočetní výkon (compute) je novou měnou a kdo ovládá GPU clustery, diktuje podmínky. Anthropic platí za výpočetní výkon více, než jaký obrat má leckterý koncern z indexu DAX. 90denní doložka? Damoklův meč nad trénováním modelů společnosti Anthropic. Pokud bude xAI potřebovat kapacity pro vlastní projekty, Anthropic se náhle ocitne bez infrastruktury. Je to vertikální integrace zadními vrátky, maskovaná jako cloudová služba. SEC pravděpodobně nezasáhne (u Muska to dělají zřídka), ale poselství je jasné: v éře AI jsou poskytovatelé výpočetního výkonu novými strážci brány (gatekeepers).
Opus 4.8: Strategie promptování pro špičkový model od Anthropic
Linas Beliūnas představuje 31stránkový návod, jak z Claude Opus 4.8 dostat maximální výkon. Klíčovou pákou je systém úrovní úsilí (Effort-Level-System) s pěti stupni od „low“ po „max“, přičemž Opus 4.8 již při minimálním úsilí dosahuje špičkového výkonu modelu Opus 4.7 při maximálním úsilí. Nová funkce Dynamic Workflows umožňuje modelu Claude psát vlastní orchestrační skripty a spouštět paralelní sub-agenty – inženýři z Anthropic ji interně používají již měsíce. Náklady zůstávají na 5 dolarech za milion vstupních tokenů a 25 dolarech za milion výstupních tokenů. Beliūnas doporučuje: začít s modelem Sonnet 4.6, pro složité úlohy vyžadující úsudek (reasoning) přejít na Opus 4.8 a pro objemové úkoly použít Haiku 4.5. Prakticky relevantní: při úrovni úsilí „xhigh“ nebo „max“ by se mělo nastavit minimum 64 000 tokenů, aby měl model dostatek prostoru na přemýšlení. → Linas from Linas's Newsletter
Synthszr Take: Anthropic se svým oceněním 965 miliard dolarů v den vydání Opus 4.8 vyslal jasný signál: ekonomika tokenů brutálně škáluje nahoru. Systém úrovní úsilí je v podstatě funkce pro disciplínu výpočetního výkonu – platíte za dobu přemýšlení, kterou potřebujete. Zatímco všichni mluví o agentické AI, Anthropic s Dynamic Workflows dodává potřebnou infrastrukturu: Claude si píše vlastní orchestrační skripty a sám spravuje sub-agenty. To připomíná Jevonsův paradox: čím efektivnější je zdroj (zde: síla úsudku), tím více se spotřebovává. Při 25 dolarech za milion výstupních tokenů a limitech 64k tokenů na jedno spuštění se rychle dostáváme k dvouciferným dolarovým částkám za jediný složitý úkol. Účet se vyplatí, pokud výstup generuje odpovídající obchodní hodnotu – ale dny bezstarostného experimentování s prompty jsou pryč.
Linear: Systém pro vývoj produktů pro týmy a AI agenty
Linear se pozicuje jako „nový druh“ nástrojů pro vývoj produktů, explicitně navržený pro spolupráci mezi lidmi a AI agenty. Systém slibuje integraci celého pracovního postupu od nápadu po revizi kódu (code review) – s agenty, kteří mohou samostatně zpracovávat issues, psát PRD a vytvářet pull requesty. Demo ukazuje agenta „Codex“, který v reálném čase reaguje na problémy s výkonem iOS a samostatně vyvíjí řešení. Linear zdůrazňuje tři klíčové sliby: účelově vytvořený (purpose-built, orientovaný na postupy prvotřídních produktových týmů), nativně pro AI (AI-native, agenti jako rovnocenní členové týmu) a optimalizovaný pro rychlost (speed-optimized, snížení režie pro vyšší velocity). Mezi zákazníky patří Ramp, GitHub a OpenAI. → Techpresso
Synthszr Take: Linear vydává správné signály: AI agenti jako plnohodnotní kolegové vývojáři, bezproblémová integrace od PRD po PR, zaměření na rychlost. Demo ukazuje agenta Codex, který během několika sekund analyzuje a opraví problém s výkonem iOS – působivě zinscenované. Ale to skutečně zajímavé leží jinde: Linear definuje vývoj produktu jako systém, ve kterém lidé a agenti používají stejné nástroje. Místo prodeje AI jako doplňku (jako většina ostatních) buduje Linear celou architekturu s prioritou pro agenty (agent-first). To by mohl být rozhodující rozdíl: pokud se agenti stanou skutečně 10x produktivnějšími, potřebují prostředí optimalizované pro jejich způsob práce. Linear sází na to, že klasické nástroje jako Jira nebo Asana tuto transformaci nezvládnou. Sázka by mohla vyjít – za předpokladu, že agenti skutečně dodají slibovanou produktivitu.
Slack: Automatizace v boji proti inflaci nástrojů (toolflation)
79 % zaměstnanců tvrdí, že jejich firma nic nedělá proti únavě z nástrojů (tool fatigue). Téměř každý pátý denně přepíná mezi aplikacemi více než 100krát – to stojí více než 100 hodin ročně. Slack slibuje řešení se svým Workflow Builderem: automatizace přímo tam, kde se odehrává práce, bez znalosti kódu. Nové funkce jako AI generované pracovní postupy, podmíněné větvení (conditional branching) a rozšířené integrace se Salesforce mají z platformy učinit centrální nervový systém firemních procesů. U společnosti Wayfair již automatizace šetří 25 000 pracovních hodin ročně, celkem v Slacku denně běží 3 miliony pracovních postupů. → Techpresso
Synthszr Take: Problém je skutečný – řešení je jen částečné. Bojovat proti únavě z nástrojů přidáváním dalších funkcí do hlavního nástroje připomíná starou IT moudrost: standardy jsou skvělé, každý by měl mít svůj vlastní. Slack se vyvíjí v Microsoft Office Suite komunikace: teoreticky umí všechno, prakticky týmy využívají jen 10 % funkcí. Skutečná inovace leží jinde: 80 % tvůrců pracovních postupů (workflow-builderů) nejsou technicky zaměření lidé. To ukazuje skutečnou demokratizaci – když si marketingoví manažeři mohou sami vytvářet své schvalovací procesy, aniž by museli čekat na IT. Háček je v tom, že každý z těchto 3 milionů denních pracovních postupů představuje další závislost na Slacku. Salesforce hru chápe: nejprve monopolizovat komunikaci, pak na ní postavit procesy, a nakonec je přechod nemožně drahý.
Orchestrační daň: Kognitivní kapacita jako úzké hrdlo v éře agentů
Kognitivní přetížení způsobené AI agenty se dá měřit. Inženýři z Google tento týden diskutovali o fenoménu, který nazývají „orchestrační daň“ (Orchestration Tax): lidský vývojář se stává sériovým úzkým hrdlem v paralelním systému. Spuštění 20 agentů najednou neznamená, že se vyprodukuje 20krát více kódu. Každé rozhodnutí, každá revize kódu, každé řešení konfliktu musí projít přesně jedním procesorem: lidským mozkem. Paralelnost agentů naráží na sériovou povahu lidské pozornosti. Výsledek: vývojáři se cítí produktivnější než kdy dříve a zároveň vyčerpanější než kdy jindy. → Nico Lumma from Five Things
Synthszr Take: Orchestrační daň je Amdahlův zákon v čisté podobě: sériová část (lidský úsudek) tvrdě omezuje celkovou rychlost systému. Vývojář s 8 agenty nemá 8násobnou produktivitu, ale 8násobné náklady na přepínání kontextu. Každé přepnutí mezi výstupy agentů stojí minuty, ne mikrosekundy jako u CPU. Řešení nespočívá ve větší disciplíně nebo delší pracovní době. Spočívá v architektuře vlastní pozornosti jako vzácného zdroje. Kdo to ignoruje, skončí u povrchních revizí kódu nebo u toho, co Addy Osmani nazývá „kognitivní kapitulace“ (cognitive surrender): přijmete výstup agenta, protože vám chybí mentální energie na vlastní posouzení. Ironická pointa: AI agenti nás činí produktivnějšími v té části, která nikdy nebyla úzkým hrdlem.
Vrchol humbuku: Nákup domu za akcie Anthropic nebo OpenAI
Prodejce domu v San Franciscu nabízí svůj dům v hodnotě tří milionů dolarů v Duboce Triangle výměnou za akcie společností Anthropic nebo OpenAI. Nabídka běží 24 hodin a makléřka Rachel Swann je zaplavena dotazy. Prodejcem je místní developer luxusních nemovitostí, který věří oběma AI firmám. Nemovitost o rozloze 232 metrů čtverečních má 3metrové stropy, zakázkové vestavby a dálkově ovládaná solární střešní okna. Titulek inzerátu zní: „Akcie Anthropic nebo OpenAI budou zváženy jako platba.“ Trh s nemovitostmi v San Franciscu a akcie AI mají jedno společné: vysokou poptávku, nízkou nabídku a explodující ceny. → Business Insider
Synthszr Take: To je dokonalá karikatura současného humbuku kolem AI. Developer nemovitostí mění beton za papírové peníze od firem, které nikdy nevyplatily ani cent na dividendách. Skutečná pointa je jinde: obě akcie jsou stejně nelikvidní jako samotný nákup domu – Anthropic a OpenAI se obchodují pouze na sekundárních trzích za astronomické ceny. Prodejce sází na to, že další kolo financování ocenění ještě zdvojnásobí (OpenAI cílí na 150 miliard). To, co se zde vydává za inovaci, je ve skutečnosti barterový obchod mezi dvěma přehřátými třídami aktiv. Pokud se toto stane novou normou v San Franciscu, měli bychom se připravit na další kreativní platební prostředky – možná opce na akcie Tesly za příští byt?



