älter | neuer
Exploderen Token-Kosten: China nüppt de SchangsSynthszr
Apple Podcasts
Spotify
synthszr #152 vun Samstag, den 30.05.2026

Exploderen Token-Kosten: China nüppt de Schangs

  • • Ünnernehmen hebbt bi KI-Budgets en Schock kregen, düre Fehler droht.
  • • Xiaomi revolutschoneert den Markt mit Priesnalass vun bet to 99 Perzent.
  • • StepFun bringt en günstig High-Performance-Mischmodell mit indrucksvulle Tallen.

KI-Kosten explodeert: Ünnernehmen ratschoneert Tokens un söökt den ROI

Ünnernehmen hebbt 2024 jemehr KI-Experimenteerphaas mit apen Geldbeutel anfungen un stött nu hart op de Realität: Welke hebbt jemehr Johrsbudget al na dree Maanden verbrennt. Uber hett in’n März sien kumplett Budget för agentic AI sprengt, Meta-CTO Andrew Bosworth mahnt intern gegen sinnlose Tokenverschwendung, un bi en Top-Finanzinstitutschoon verbrennt Mitarbeiders jeden Maand Hunnerdduusende Dollar för de eenfachsten Fragen an Premium-Modellen. De Anbeders sünd nu vun All-you-can-eat-Modellen op verbruuksbaseerte Afreken ümstegen, wieldes Google al 3,2 Billionen Tokens jeden Maand verarbeidt — dat sünd sövenmol so veel as vör een Johr. Wat as Signal an de Wall Street dacht weer, warrt to en Kostenfall: Ünnernehmen ratschoneert nu den AI-Togang, stüürt Mitarbeiders to günstigeren Modellen un Microsoft limiteert sogor den Togang to Anthropic Claude för Entwicklers, de stattdessen interne Tools bruken schöölt. → Wall Street Journal

Synthszr Take: De Fete is vörbi. Na een Johr „Tokenmaxxing“ — Mitarbeiders, de de AI-Nutzung as Sülvstzweck bedrievt — kümmt nu de Reken. En Executive vergliekt dat drapen: „Wenn dien Dochter Nahülp in Algebra bruukt, musst du nich Albert Einstein betahlen.“ Dat is de klassische Hype-Zyklus, bloots in Rekordtempo: Toeerst allens mit Premium-Modellen dootslahn, denn faststellen, dat 82% vun de Utgaven keen meetboren Nutzen bringt. De würkliche Geschicht hier is aver en annere: Wi beleevt jüst de Geboort vun de Computerdisziplin. Ünnernehmen lehrt (mit Pien), dat de AI-Integratschoon keen Tech-Problem is, man en Organisatschoonsproblem. Wecker nu de richtigen Governance-Strukturen opboot un de Token-Nutzung an Business-Outcomes koppelt, warrt in twee Johren en massiven Vörsprung hebben.

Xiaomi: globale KI-Token-Plattform senkt Pries üm bet to 99%

Xiaomi künnigt drastische Priesredukschonen för sien MiMo-V2.5-API an un beendt togliek dat 100-Billionen-Token-Anreizprogramm. De Priesen fallt üm bet to 99%, wieldes de Token-Nutzung för al dor wesen Brukers üm dat 5- bet 8-facke stiggt. De ne’e Priesstruktur gellt af den 27. Mai 2026 weltwiet. Dat siet April lopen Creator-Incentive-Programm wörr vörtiedig beendt, nadem all 100 Billionen Tokens vullstännig verdeelt weren. Technisch mööglich maakt warrt de Priesredukschoon dörch optimerte Inference-Systemen: Mit SWA-baseertem HiCache fallt dat Datenvolumen vun den KV-Caches op en Söventel, wieldes sik de Tall vun de spiekernboren Tokens verfievfackt. Xiaomi positschoneert de Plattform as globale Alternative to westliche KI-Anbeders mit dat Teel, „mehr Minschen dat Bruken vun betere Modellen mööglich to maken“. → Hello China Tech

Synthszr Take: Xiaomi maakt hier den klassischen China-Move: Priesen pulveriseern, dat Volumen hoochfohren, den Markt övernehmen. 99% Priesredukschoon bi gliektiedig 5- bet 8-facke Leistungsstiegerung – dat is keen Optimieren, dat is en Ansage an OpenAI un Anthropic. De technischen Details (KV-Cache op en Söventel reduzeert) wiest echte Ingenieursarbeid statt blot Subventschonen. Wat Xiaomi hier „MiMo Orbit“ nöömt, kunn de Anfang vun en globale Token-Plattform ween, de westliche Anbeders prieslich uthevelt. Dat vörtiedige Enn vun dat 100-Billionen-Token-Programm düüdt op en massive Nafraag hen. Spannend warrt, ob Xiaomi de Qualität hollen kann oder ob hier dat ole Speel löppt: toeerst den Markt överfloden, denn de Priesen anheven.

StepFun: 198 Milliarden Parameter-Modell to’n GPT-4o-Mini-Pries

StepFun publizeert op Hugging Face en 198-Milliarden-Parameter-Mixture-of-Experts-Vision-Language-Modell, dat blot 11 Milliarden Parameters pro Token bruukt. Dat Modell schafft 400 Tokens pro Sekunn bi en 256k-Kontextfinster un beedt dree wählbore Reasoning-Stopen. De Clou: Mit $0.20 pro Million Input-Tokens liggt dat prieslich in’n Bereich vun GPT-4o-mini, leist aver düütlich mehr. Op SimpleVQA (Search) kummt dat op 79,2 Punkten, op SWE-Bench PRO op den tweten Platz mit 56,3 – dat Modell kann sülvstännig Multi-File-Repositories dörchsöken un funktschoneren Patches genereren. De Verfügborkeit över StepFun Open Platform (global un in China), OpenRouter un NVIDIA NIM maakt dat foorts produktiv bruukbor. → AINews

Synthszr Take: Man kennt dat: Weltklass-Performance to’n Brokdeel vun de westlichen Priesen. 198 Milliarden Parameters klingt gewaltig, aver de sparse MoE-Architektur mit blot 11 Milliarden aktiven Parameters is de egentliche Hevel – se spoort massiv an Compute bi glieker Leistung. De dree Reasoning-Levels (low, medium, high) sünd pragmatisch konzipeert: Entwicklers köönt je na Use Case twüschen Tempo un Deepd wesseln. Dat dat Modell op Mac Studios mit 128 GB RAM löppt, wiest de ne’e Realität: Frontier-KI warrt to en Commodity. Wat mi stutzig maakt: De extrem nerrigen Priesen för disse Performance düüdt op massive Subventschonen hen. StepFun verbrennt wohrschienlich Kapitaal för Marktandeelen – de Fraag is blot, wo lang dat gootgeiht.

Dat Internet rüst op: Maschinen statt Minschen

De Cloud-Infrastruktur weer bit nu op Minschen utricht: vörherseggbore Klicks, Scrolls un Streams. KI-Agenten verhoolt sik anners. Se start blitzaardig Hunnerten vun Datenbankaffragen, dörchsöökt Dokumenten un roopt APIs af – un verswinnt jüst so gau wedder. Amazon reageert dorop un boot en Karn vun sien Cloud-Infrastruktur üm. AWS hett en ne’e Generatschoon vun OpenSearch Serverless vörstellt: En System, dat speziell för de unberekenboren Arbeitsmuster vun KI-Agenten utklamüstert wörr. Dat skaleert binnen Sekunnen hooch, wenn Agenten aktiv warrt, un sinkt op 0, wenn se pauseert. Cloudflare mellt, dat Bots al 31% vun den ganzen HTTP-Traffic utmaakt. „Nich-minschlichen Traffic warrt den minschlichen Traffic in de eerste Hälft vun 2027 överholen“, prognostizeert Cloudflare-Managerin Lai Yi Ohlsen. → TechCrunch

Synthszr Take: Dat Internet warrt to en Maschineninfrastruktur. AWS trennt nu Compute vun Storage – vörher müss jümmer tominnst een Instanz lopen, as en duerhaft hüerten Parkplatz. Nu betahlt de Kunnen blot noch för de tatsächliche Nutzung. Google will bet Enn vun’t Johr togliek In- un Utgangssiet vun’t Web warrn (as ik na de I/O schreven heff). De Konsequenz: Wecker vundaag noch Infrastruktur för minschliche Klickmuster boot, entwickelt för güstern. Databricks un Snowflake positschoneert sik al as KI-Gedächtnissystemen. Dat kann jede Föhrungskraft morgen fröh besluten: Infrastruktur-Investitschonen mööt Agent-first dacht warrn, sünst betahlt man 2027 för leddige Parkplätz.

Anthropic un xAI: Wecker seggt de Wohrheit?

Anthropic hett sik bi xAIs Colossus-Cluster inhüert – för 1,25 Milliarden Dollar pro Maand. Dat is de gröttste Compute-Transaktschoon in de KI-Historie. Aver wieldes xAIs S-1-Filing kloor vun en dreejohrige Looptied bet Mai 2029 snackt, twittert Elon Musk vun en 180-Daag-Lease mit en 90-Daag-Künnigungsfrist. De Diskrepanz twüschen dat SEC-Dokument („the customer has agreed to pay a monthly fee through May 2029“) un den CEO-Tweet („This is a 180-day lease“) smitt Fragen op: Entweder hett Musk sien egen Verdragsdetails verkehrt dorstellt, oder dat S-1-Filing föhrt in de Irr. Beides weer in de Quiet Period vör den Börsengang problemaatsch. Musk sien Begrünnen: Falls Compute knapp warrt, wull man sik de Optschoon apenhollen, Kapazitäten torüchtoholen. → Techpresso

Synthszr Take: 15 Milliarden Dollar Johresumsatz dörch en enkelten Kunn – dat is sülvst för Musk-Verhältnisse indrucksvull. Wat hier as Verdragsdetail-Verwirren daherkümmt, wiest dat Karnproblem vun de KI-Ökonomie: Compute is de ne’e Währung, un wecker de GPU-Clusters kontrolleert, dikteert de Bedingungen. Anthropic betahlt mehr för Rekenleistung, as mennig DAX-Konzern Umsatz maakt. De 90-Daag-Klausel? En Damoklessweert över Anthropic sien Modell-Training. Wenn xAI de Kapazitäten för egen Projekten bruukt, steiht Anthropic op eenmal ahn Infrastruktur dor. Dat is vertikale Integratschoon dörch de Achterdöör, tarnt as Cloud-Service. De SEC warrt wohrschienlich nich ingriepen (se doot dat bi Musk selten), aver de Naricht is kloor: In de KI-Ära sünd Compute-Providers de ne’en Gatekeepers.

Opus 4.8: Prompting-Strategien för Anthropic sien Spitzenmodell

Linas Beliūnas leggt en 31-sietige Anleiden vör, woans man ut Claude Opus 4.8 de maximale Leistung rutholt. De zentrale Hevel: dat Effort-Level-System mit fiev Stopen vun „low“ bet „max“, wobi Opus 4.8 bi minimalem Effort al de Spitzenleistung vun Opus 4.7 bi maximalem Effort henkriggt. Dat ne’e Dynamic Workflows-Feature maakt dat för Claude mööglich, egen Orchestrierungs-Skripten to schrieven un parallele Sub-Agenten hoochtofohren – Anthropic-Ingenieurs bruukt dat intern siet Maanden. De Kosten blievt bi 5 Dollar pro Million Input-Tokens un 25 Dollar pro Million Output-Tokens. Beliūnas raadt: mit Sonnet 4.6 anfangen, bi komplexe Reasoning-Opgaven op Opus 4.8 upgraden, för Volumen-Tasks Haiku 4.5 bruken. Praktisch relevant: Bi xhigh oder max Effort schull man en Minimum vun 64.000 Tokens fastleggen, dormit dat Modell noog Ruum to’n Denken hett. → Linas from Linas’s Newsletter

Synthszr Take: Anthropic hett mit sien 965-Milliarden-Dollar-Bewertung an’n sülven Dag as de Opus 4.8-Veröffentlichung en Statement sett: De Token-Ökonomie skaleert brutaal na baven. Dat Effort-Level-System is in’n Karn en Compute-Disziplin-Funkschoon – du betahlst för de Denktied, de du bruukst. Wieldes all över Agentic AI snackt, levert Anthropic mit Dynamic Workflows de dorför nödige Infrastruktur: Claude schrifft sien egen Orchestrierungs-Skripten un managt Sub-Agenten sülvst. Dat erinnert an dat Jevons-Paradoxon: Je effizienter de Ressource (hier: Reasoning-Power), desto mehr warrt se verbruukt. Bi 25 Dollar pro Million Output-Tokens un 64k Token-Limits pro Run snackt wi gau vun tweistellige Dollarbedrääg för en enkele komplexe Opgaav. De Reken geiht op, wenn de Output den passenden Geschäftswert generiert – aver de Daag vun dat sorglose Prompt-Experimenteren sünd vörbi.

Linear: Produktentwicklungssystem för Teams un KI-Agenten

Linear positschoneert sik as „ne’e Spezies“ vun Produktentwicklungs-Tools, explizit för de Tosamenarbeit twüschen Minschen un KI-Agenten konzipeert. Dat System versprickt, den ganzen Workflow vun de Idee bet to’n Code-Review to integreren — mit Agenten, de sülvstännig Issues bearbeiden, PRDs verfaten un Pull Requests erstellen köönt. Dorbi wiest de Demo en „Codex“-Agenten, de in Echttied op iOS-Performance-Problemen reageert un sülvstännig Lösungen entwickelt. Linear betoont dree Karnverspreken: Purpose-built (an de Praktiken vun eerstklassige Produktteams orienteert), AI-native (Agenten as gliekberechtigte Teammaten) un Speed-optimiert (Redukschoon vun Overhead för högere Velocity). To de Kunnen höört Ramp, GitHub un OpenAI. → Techpresso

Synthszr Take: Linear maakt de richtigen Töön: KI-Agenten as vullweertige Entwickler-Kollegen, nahtlose Integratschoon vun de PRD bet to’n PR, Fokus op Tempo. De Demo wiest en Codex-Agenten, de binnen Sekunnen en iOS-Performance-Problem analyseert un beheevt — indrucksvull inszeneert. Aver dat egentlich Spannende liggt woanners: Linear defineert de Produktentwicklung as System, in dat Minschen un Agenten desülven Warktüüch bruukt. Statt KI as Add-on to verkopen (as de meesten), boot Linear de hele Architektur agent-first op. Dat kunn de entscheedende Ünnerscheed ween: Wenn Agenten würklich 10x produktiver warrt, bruukt se en Ümgeven, de op jemehr Arbeitswies optimert is. Linear sett dorop, dat klassische Tools as Jira oder Asana disse Transformatschoon nich bemeistern köönt. De Wedd kunn opgeihn — vörutsett, de Agenten levert tatsächlich de versprokene Produktivität.

Slack: Automatiseren, üm de Toolflation to bekämpen

79% vun de Arbeitnehmers seggt, dat jemehr Ünnernehmen nix gegen Tool-Möödigkeit deit. Meist jeder Föffte wesselt jeden Dag över 100-mol twüschen Apps – dat kost mehr as 100 Stunnen pro Johr. Slack versprickt mit sien Workflow Builder de Lösung: Automatiseren direkt dor, woneem de Arbeit passeert, ahn Code-Kennis. Ne’e Features as KI-genererte Workflows, Conditional Branching un utwiedte Salesforce-Integratschonen schöölt de Plattform to’n zentralen Nervensystem för Ünnernehmensafloopen maken. Bi Wayfair spoort de Automatiserens al 25.000 Arbeitsstunnen in’t Johr, alltohoop loopt jeden Dag 3 Millionen Workflows in Slack. → Techpresso

Synthszr Take: Dat Problem is reell – de Lösung is blot deelwies. Tool-Möödigkeit dörch noch mehr Features in’t Master-Tool to bekämpen, erinnert an de ole IT-Wiesheit: Standards sünd super, jeder schull sien egen hebben. Slack entwickelt sik to de Microsoft-Office-Suite vun de Kommunikatschoon: Theoretisch kann dat allens, praktisch bruukt Teams blot 10% vun de Features. De egentliche Innovatschoon liggt woanners: 80% vun de Workflow-Builder sünd Keen-Technikers. Dat wiest de wohre Demokratiseren – wenn Marketing-Managers jemehr egen Genehmigungsprozessen opboen köönt, ahn op de IT to töven. De Haken: Jeder vun disse 3 Millionen täglichen Workflows is en wiedere Afhängigkeit vun Slack. Salesforce versteiht dat Speel: toeerst de Kommunikatschoon monopoliseern, denn de Prozessen dorop opboen, an’t Enn is de Wessel unmööglich düer.

De Orchestrierungsstüer: Kognitive Bandbreed as Engpass in’t Agenten-Tietöller

De kognitive Överlastung dörch KI-Agenten lett sik meten. Google-Ingenieurs diskuteern disse Week över en Phänomen, dat se „Orchestration Tax“ nöömt: De minschliche Entwickler warrt to’n seriellen Flaschenhals in en parallelen System. 20 Agenten togliek lopen to laten bedüüt nich, dat 20-mol so veel Code produktiv warrt. Jede Entscheiden, jede Code-Review, jede Konfliktlösung mutt dörch genau een Prozessor gahn: dat minschliche Bregen. De Parallelität vun de Agenten dröppt op de serielle Natur vun de minschliche Opmarksamkeit. Dat Resultat: Entwicklers föhlt sik produktiver as je tovör un togliek utpowerter as je tovör. → Nico Lumma from Five Things

Synthszr Take: De Orchestrierungsstüer is Amdahl sien Gesett in Reinform: De serielle Andeel (minschlich Oordeelsvermögen) begrenzt de Gesamtgeschwindigkeit vun’t System hart. En Entwickler mit 8 Agenten hett nich 8-facke Produktivität, man 8-facke Kontextwesselkosten. Jeder Wessel twüschen Agenten-Outputs kost Minuten statt Mikrosekunnen as bi CPUs. De Lösung liggt nich in mehr Disziplin oder in längere Arbeidsdaag. Se liggt in de Architektur vun de egen Opmarksamkeit as knappe Ressource. Wecker dat ignoreert, lannt bi överflächliche Code-Reviews oder bi dat, wat Addy Osmani „cognitive surrender“ nöömt: Man akzepteert den Agenten-Output, wiel de mentale Energie för de egen Bewerten fehlt. De ironische Pointe: KI-Agenten maakt uns produktiver bi den Deel, de nie de Engpass weer.

Peak Hype: Huuskoop mit Anthropic- oder OpenAI-Aktien

En Huusverköper in San Francisco beedt sien dree Millionen Dollar düer Huus in Duboce Triangle gegen Aktien vun Anthropic oder OpenAI an. Dat Anbott löppt siet 24 Stunnen, de Maklersche Rachel Swann warrt mit Anfragen överflod. De Verköper is en lokalen Luxusentwickler, de an de beiden KI-Firmen glöövt. De 232 Quadraatmeter grote Immobilie kümmt mit 3-Meter-Decken, Custom-Inboen un feernstüerte Solar-Böverlichter. De Lead vun de Anzeig: „Anthropic or OpenAI stock will be considered as payments.“ San Francisco sien Immobilienmarkt un KI-Aktien hebbt een Saak gemeen: hoge Nafraag, wenig Anbott, exploderen Priesen. → Business Insider

Synthszr Take: Dat is de perfekte Karikatur vun den aktuellen KI-Hype. En Immobilien-Developer tuuscht Beton gegen Papeergeld vun Firmen, de noch nie en Cent an Dividend betahlt hebbt. De wohre Pointe liggt woanners: Beide Aktien sünd so illiquide as de Huuskoop sülvst – Anthropic un OpenAI hannelt blot op Sekundärmärkten to Maandpriesen. De Verköper wedd dorop, dat de nächste Funding-Runn de Bewerten nochmaal verdubbelt (OpenAI strevt 150 Milliarden an). Wat hier as Innovatschoon dörchgeiht, is egentlich en Bartering-Deal twüschen twee överhitte Asset-Klassen. Wenn dat de ne’e Normalität in San Francisco warrt, schullen wi uns op wiedere kreative Betahlmiddel instellen – villicht Tesla-Optschonen för de nächste Egendomswohnung?

Mentioned in this article

De Sommer-Utgaav vun CODE CRASH is dor

2. UTGAAV. 440 SIEDEN (100+ MEHR). AF 20 EUR (PAPERBACK).

De Sommer-Utgaav vun CODE CRASH is dor

De nien agentischen KI-Systemen verlangt en radikale Ännern in't Denken doröver, wo Ünnernehmen vandaag opstellt wesen mütten, üm op'n Markt bestahn to könen. De Sommer-Utgaav vun CODE CRASH spannt dorüm den Bogen vun de Produktentwickeln över de Ünnernehmensoopstellen un Führung bet hen to de Kultur in't hütige KI-Tietolter — un tekent dorbi en övernaschen optimistisch Utkieken op Düütschland as Standort.

codecrash.ai →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.