Meta drifft AI-Slop vöran un China sien Unafhangigkeit
- • Meta stellt Muse Image vör, en neet KI-Bildmodell för Insta un WhatsApp
- • Chineesche KI-Modellen domineert jümmer mehr den US-Markt dörch Priesvördeelen
- • China plaant Maßnahmen för den Schuul vun sien KI-Systemen vör Togreep ut dat Butenland
Meta maakt de AI-Slopisierung vun Insta un WhatsApp gauer
Meta launcht vundaag Muse Image, en KI-Bildmodell, dat direkt in Instagram un WhatsApp löppt. Brukers köönt dormit Fotos maken, de jemehr gewöhnlichen Posts liek sünd: Strandselfies, ole Familienbiller wedderherstellen oder sik as Kneedfigur dorstellen. Dat is dat eerste Bildmodell ut Meta sien ne’e Eenheit Meta Superintelligence Labs, för de Mark Zuckerberg na den Torüchstand in’t verleden Fröhjohr Milliarden utgeven hett. Muse Image ersetzt in de Meta-AI-App de bither tokochte Technologie vun Midjourney; en Video-Gegenstück mit den Naam Muse Video is as Vörschau ankünnigt. Alltohoop will Meta dit Johr bet to 145 Milliarden Dollar in KI steken, wiel togliek dusende Steden streken warrt. De Weg weer holprig: In’n Juni hett en Bug in Meta sien KI-Kunnendeenst Hackers över 34.000 Instagram-Kontos angriepen laten. KI-Chef Alexandr Wang versprickt intern en Spitzenmodell mit den Naam Watermelon, dat mit OpenAI sien best Modell mithollen schall. → www.nytimes.com
Synthszr Take: Meta buut de KI nich as Chat-Finster blangenbi, man dorhen, woneem de Lüüd sowieso sünd (dree Milliarden Brukers jeden Dag in Instagram un WhatsApp). Dat is de eenzige sinnvolle Antwoort op de Fraag, worüm man na OpenAI un Google noch en Bildmodell bruukt: Muse Image mutt nich funnen warrn, dat liggt al in’n Feed. Jüst dorüm is de Brook mit Midjourney folgerichtig, denn wokeen Distribution hett, will de Formel för den Spood nich meden. Liekers blifft de Nalaag to sehn. Muse Spark hinkt achterher, dat Spitzenmodell heet noch Watermelon un gifft dat bit nu bloots as Verspreken, un 145 Milliarden Dollar Investment blangen Massenentlaten maakt en Druck vun Verwachten, den en smucken Golden-Hour-Filter alleen nich driggt. In en poor Weken schöölt Warvkunnen dat Modell för Anzeigen bruken köönt, un dor entscheedt sik dat, of ut dat Feature Ümsatz warrt oder bloots Rekenkösten. De Hevel liggt in de Distribution, nich in’n Benchmark, un dat is de een Koort, de Meta würklich in de Hand höllt.
Chineesche KI-Modellen erovert den US-Markt
Amerikaansche Firmen buut jemehr KI-Produkten jümmer mehr op chineesche Modellen as DeepSeek, Alibaba sien Qwen un Zhipu sien GLM 5.2 op. Över de Entwicklerplattform OpenRouter liggt de Andeel vun chineesche Modellen an’n Token-Verbruuk siet den 8. Februar jede Week över 30 Perzent, mit en Spitzenweert vun 46 Perzent. In’n Snitt vun de twölf Maanden dorvör weern dat 11 Perzent, in de eerste Hälft vun 2025 sogor blots 4,5 Perzent. De Andriever is de Pries: Open-Source-Modellen ut China sünd luut OpenRouter 60 bet 90 Perzent günstiger as de Spitzenmodellen vun OpenAI un Anthropic. Dat Startup Lindy hett in’n Juni sien ganzen Traffic vun Claude op DeepSeek ümtogen un spoort dormit na Angaav vun CEO Flo Crivello Millionen binnen Maanden. Bi de Leistung warrt de Afstand lütter: GLM 5.2 keem bi en veel beachteten agentischen Benchmark een Perzentpunkt an Anthropic sien Opus 4.8 ran, för üm un bi een Föfftel vun de Kösten. Brookings-Expert Kyle Chan schätzt den Torüchstand vun chineesche Modellen op söss bet negen Maanden. → www.cnbc.com
Synthszr Take: De Sprung vun 4,5 Perzent op tiedwies 46 Perzent Token-Andeel in en halv Johr wiest, wo gau Compute-Disziplin insett, wenn de Reken wehdeit. Solang Kapital billig weer, hett man dat beste Modell nahmen un nich fraagt, wat dat köst. Nu leidt jedet vernünftige Team de eenfachen Opgaven op dat billigste Modell, dat goot noog is, un jüst dit Segment winnt de chineesche Bülg jüst. In’n Mai weer DeepSeek noch in Beweertensgespreken mit Staatsfonds, vundaag ersetzt dat bi Lindy kumplett Claude, un de Performance is bi de Kern-Use-Cases sogor stegen. Dat lett een denken an Linux gegen de slaten Unix-Derivate: apen, günstig un irgendwann eenfach de Standard, an den keeneen mehr vörbikummt. Wokeen en riepe KI-Strategie hett, schull disse Week sien Token-Verbruuk na Opgaventyp opslöteln un de anspruchslosen Workloads gegen en apen Modell testen; dat wat man spoort is reell un glieks to meten. Exportkuntrullen un Reguleern köönt dat politisch langsam maken, man gegen en Köstenkurv, de in’n Keller suust, hölpt keen Verordnung.
China diskuteert över en Grote Muur üm sien Billig-KI
China hett wekenlang mit Alibaba, ByteDance un Z.ai över Inschränken vun den Togreep ut dat Butenland op de egenen KI-Systemen verhannelt, as Reuters bericht. Bedrapen weern luut Bericht sowohl Open-Source- as ok proprietäre Modellen, inklusive noch nich publiek maakte Modellen, as ok Regeln, na de Investoren chineesche KI-Startups överhaupt finanzeren dröfft. Op Anwiesen vun Peking hett Meta al all Verbinnen to dat Startup Manus mit chineesche Wörteln kappt, blots rund söss Maanden na de 2-Milliarden-Dollar-Övernahm. Togliek wennt sik chineesche Entwicklers vun Nvidia af un sett op Chips ut egen Land, flankert vun Pekings Toseggen, in fief Johren rund 2 Billionen Yuan (üm un bi 294 Milliarden Dollar) in egene Rekenzentren to steken. Utlöser is de technische Opholprozess: Z.ai sien GLM-5.2 hett in Cybersecurity-Benchmarks dat Niveau vun proprietäre US-Modellen reckt, traineert för en Brookdeel vun de Kösten. Tosätzlich maakt Anthropic sien Mythos unseker, en Modell, dat sülvst in robuste Cyberafwehren Swacksteden finnt. Yuval Noah Harari nöömt de Trennlien, de dor entsteiht, den „Silicon Curtain“. → gizmodo.com
Synthszr Take: Jüst in den Momang, in den China sien günstige Open-Source-Modellen för US-Firmen, de klamm sünd, attraktiv warrt, treckt Peking den Vörhang to. Dat is de egene Ironie: De Diffusionskraft, de GLM & Co. eerst to en echten Faktor maakt hett, warrt nu to en natschonale Ressource verkloort un inmuurt. För all, de buten vun dat US-China-Duopol wirtschapen doot, is dat keen Randthema, man en strategische Fraag. Wokeen vundaag chineesche Modellen in sien Stack leggt, schull inreken, dat de Togang morgen politisch afschalt warrn kann, so as Manus dat na 294 Daag beleevt hett (groff rekent). De praktische Tog disse Week: Modell-Afhangigkeiten inventariseren un för jeden kritischen Use Case en tweten, ideologisch neutralen Bezugsweg defineern. De 57 Perzent vun’t Welt-BIP buten vun Washington un Peking bruukt jüst dat: KI, de nich an en Grenz ennt. De Silicon Curtain is noch nich to, aver wokeen eerst reageert, wenn he tofallt, hett den verkehrten Anbeder wählt.
China sien KI-Laboren plaant egene Chips
Gliek twee chineesche KI-Laboren drängt in’t Silizium. Deepseek entwickelt luut Reuters en egen Chip för Inference — de Phaas, in de traineerte Modellen Antwoorten maakt, nich dat Training. Dat Startup snackt mit Design-, Produkschoons- un Spiekerfirmen un stellt siet Maanden still Chip-Ingenieurs in, ahn apentliche Utschrieven. Togliek nimmt Deepseek to’n eersten Mal extern Kapital op: 7 Milliarden Dollar bi en Beweerten vun 52 bet 59 Milliarden — in’n Mai stünnen noch 45 Milliarden in’n Ruum. Ok Zhipu AI, dat Labor achter de Open-Source-Reeg GLM, överleggt luut The Information en egen Chip, wiel de GLM-Nafraag de verfügbore Compute-Kapazität sprengt. Achtergrund vun beide Schreed: US-Exportkuntrullen sniedt chineesche Firmen vun de modernsten Chips un Spiekers af. Un de Trend is global — Anthropic verhannelt mit Samsung över de Produkschoon, OpenAI arbeidt ok an egen Silizium. → Techpresso / The Information
Synthszr Take: De egene Punkt stickt in dat Woort Inference. Deepseek griept nich dat Training an, woneem Nvidia sien Borggraven an’n deepsten is, man den Deel, de jeden Dag lopen mutt un de Reken fritt — dat kommodifizeerbor Enn vun de Weertschöppen, woneem Volumen un Kösten hangt. Dat Zhipu to de sülve Tied den sülven Weg prüft, seggt mehr över den Engpass as över de Ambition: Compute is in China jüst dat knappste Goot överhaupt, un Nvidia lett sik dor nich free nabestellen. De 7 Milliarden frisch Kapital bi Deepseek sünd keen Tofall blangen dat Chip-Projekt — Silizium köst Suurstoff. Interessant is de Togliekstied över Blöck weg: Anthropic geiht na Samsung, OpenAI buut sülvst, China sien Laboren treckt na. Jedeen, de eernsthaft skaleert, weigert sik, den düürsten un strategisch heikelsten Layer een enkelten Toleverer to överlaten. De spannende Fraag is nich, of disse Chips goot warrt — egene Chips bruukt Johren un Milliarden, un vele Ankünnigen ennt as Verhandelnsmass gegenöver Nvidia. Se is, of de Exportkuntrullen de Produkschoon un Spieker so wiet todreiht, dat ut China sien Plään Zombie-Projekten warrt. För all annern gellt: Wokeen vundaag Inference-Kösten kalkuleert, schull inplanen, dat de Nvidia-Opslag middelfristig ünner Druck kummt — un de Modell-Ebene mit Afsicht uttuuschbor hollen. Wokeen den Stack vun ünnen hett, de gifft de Priesen baven vör.
Token-Kösten: Anthropic will CFOs tofreden stellen
Anthropic hett dree ne’e Funkschonen in Claude Enterprise utrullt, mit de Organisatschonen jemehrn Token-Verbruuk överwachen un deckeln köönt. Spend Alerts wohrschaut Admins bi 75 un 90 Perzent vun’t Limit, Mitarbeiders bi 75 un 95 Perzent, mit en Anfraag-Knoop direkt in de App. Över „Costs vs. Outputs“ lett sik de Output gegen de Kösten stellen, un mit „Model Defaults“ köönt Admins günstigere Modellen as Standard setten, rullenbasiert oder för de hele Organisatschoon. De Achtergrund: Na dat Tokenmaxxing in de eerste Johreshälft 2024 sünd de Inference-Kösten an vele Steden eskaleert. Uber hett sien Johres-KI-Budget in de eersten veer Maanden verbrannt, Databricks-CEO Ali Ghodsi snack vun „hair on fire“. Luut Ramp-Daten vun’n 6. Juli bruukt 77 Perzent vun de Firmen mit Frontier-LLMs Anthropic-Modellen, en Plus vun 40 Punkten binnen een Johr. Un dat, ofschoonst Anthropic sien annualiseerte Ümsatz vun 9 op 47 Milliarden Dollar sprungen is. → The Deep View
Synthszr Take: De Verköper buut di freewillig den Spoorknoop in, wiel sien Kass klingelt as nie tovör. Klingt paradox, is aver de eenzige klook Reken: Wokeen 2026 as de sekere, verlätliche Enterprise-Partner gellen will, kann sik keen CFOs mit brennen Hoor leisten. De Uber-Tall is de egene Wohrschau – en Johresbudget in veer Maanden weg, dat passeert jüst denn, wenn man Adoption per Leaderboard anreizt un keeneen op de Grenzkösten kiekt. Wat hier würklich tellt, sünd de Model Defaults: Wokeen standardmäßig op dat düürste Modell start, betahlt en Stüür för Bequemlichkeit, de sik över dusende Sessions summeert. Disse Week lett sik dat afstellen, dat Setting sitt in de Organisatschoonsinstellungen un bruukt keen Grundsatzdebatt. Anthropic wett op den Roop statt op den kortfristigen Verbruuk, un mit 77 Perzent Marktaandeel bi de Frontier-Brukers is dat de souveränere Positschoon. Compute-Disziplin warrt 2026 to’n Wettbewarvsvördeel, un wokeen de nu inföhrt, spoort nich bloots Geld, man behöllt de Kuntrull över de egene Toollandschap.
Compute hanneln: Wall Street finnt den KI-Rohstoff
Ornn, en vun Andreessen Horowitz finanzeert Startup, hett en Seed-Runn över 33 Millionen Dollar insammelt, üm en Marktplatz för den Hannel mit Rekenleistung optobuen, liek as de etableerten Öölmärkt. De Idee: KI-Firmen schöölt Compute över Futures afsekern, so as Flegersellschappen jemehr Kerosinpries oder Herstellers jemehr Metallpriesen. Goldman Sachs schätzt, dat twüschen 2026 un 2031 weltwiet rund 7,6 Billionen Dollar in Compute, Stroom un Rekenzentren fleten doot, man de Finanzinfrastruktur, de dorför nödig is, gifft dat luut de Bank noch nich. Jüst de will Ornn levern, al integreert in dat Bloomberg Terminal un de ünner en De-minimis-Utnahm arbeidt, wiel gröttere Hüüs noch op regulatorische Freegaven töövt. CME plaant Compute-Futures op de Basis vun’n Silicon-Data-Benchmark, de Intercontinental Exchange GPU-Futures koppelt an Ornn sien Priesindex. De Haken blifft physikaalsch: GPU-Kapazität lett sik nich lagern, un jede ne’e Nvidia-Generatschoon maakt de olen Chips weertlos, jedeen Benchmark jaagt also en Asset achterher, dat an Weert verlüst. CEO Kush Bavaria stellt dat Ganze butendem as en amerikaanschen Vördeel gegenöver China dor un arbeidt na egen Utsaag nich mit chineesche Laboren. → Axios AI+
Synthszr Take: Compute warrt to’n Rohstoff, un Wall Street rükt de 7,6 Billionen. Dat is de logische Foortsetten vun dat, wat wi in’n Mai al sehn hebbt, as OpenAI garanteerte Rekenleistung as Lockmiddel anboot: Wokeen den GPU-Togang afsekert, sekert de egene Tokumst. Blots is Compute eben en wedderböstig Rohstoff, wiel unbruukte Kapazität eenfach weg is un jede ne’e Nvidia-Generatschoon de Kalkulatschoon över’n Hupen smitt. En Terminmarkt op en Asset, dat jedet Johr an Weert verlüst un nich to lagern is – dat warrt en hart Stück Finanz-Engineering. Liekers lohnt sik de Blick nu, nich later: Wokeen Compute langfristig inköfft, schull Priesafsekern un Benchmarking as egen Disziplin behanneln, anstatt sik blind an Vöraf-Verdrääg vun enkelte Hyperscalers to binnen. Ornn warrt villicht nich de Winner ween, aver de Richt stimmt. Compute warrt villicht nie hanneln as Ööl, un jüst dorüm warrt de eerste, de dat funkschoneren afbillt, en eenzigoordigen Vördeel hebben.
JadePuffer: Ransomware, de sik in Echttied anpasst
Sekerheitsforschers hebbt mit JadePuffer de eerste bekannte „agentic ransomware“ dokumenteert, also Afpressersoftware, de sik in Echttied an ehr Ümgegend anpasst. Anstatt en starr Skript aftoarbeiden, wedderhaalt JadePuffer enkelte Schreed, wenn se fehlslaat, un arbeidt sik so egenstännig dörch en kumplette Afpresseroperatschoon vun Anfang bet Enn. De Bericht vun Bill Toulas bi BleepingComputer beschrifft dat as en dörchgahn Keed: Togang kriegen, Daten afgriepen, verslöteln, Lösegeld foddern – allens ahn dat en Minsch bi jeden Grenzfall nastüern mutt. Bemarkenswert is de Retry-Logik, mit de de Software Hinnerns ümgeiht, de klassische Ransomware to’n Stillstand bringen wörrn. Dormit verschufft sik de Angriepersiet vun vörprogrammeerte Aflööp hen to Systemen, de sülvst entscheedt, woans se an’t Teel kommt. Dat is de Punkt, an den de Agenten-Logik, de wi siet Maanden in Produktivumgevungen bejubeln, op de anner Siet ankummt. → us.list-manage.com
Synthszr Take: De sülve Autonomie, de en Coding-Agenten nachts dörch dien Backlog arbeiden lett, drifft nu en Afpresseroperatschoon an, de sik sülvst repareert, wenn en Schreed fehlsleiht. JadePuffer is de Bewies, dat „Retry until success“ ok för de Gegensiet funkschoneert. Wokeen sien Afwehr noch op bekannte Signaturen un faste Angreepsmusters stütt, verdeffendeert gegen en Dreihbook, dat de Angrieper längst wegsmeten hett. De egen Guardrails mööt disse Week op den Prüfstand: Segmenteren, Rechten-Minimeren un Backups, de ok denn hoolt, wenn en Prozess twintig Anlööp nimmt. Na de iraanschen Angrepen in’n März un dat DarkSword-Tool op GitHub is dat de nächste logische Schreed, un he keem gauer, as de mehrsten Sekerheitsbudgets verlöövt. De gode Naricht: Agentische Verdeffenderen lett sik mit de sülven Warktüüch buen, un wokeen nu anfangt to automatiseren, hett noch Vörsprung. Symmetrie sleiht Panik.
Agent-Native Memory: Dat Gedächtnis vun de KI-Agenten
En neet Paper (arXiv, inreicht in’n Juni 2026 vun Shao Kun Han un Kollegen) nimmt sik dat Gedächtnis vun LLM-Agenten mal ut Datenbank-Perspektive vör, anstatt dat as gewöhnlich as Blackbox to behanneln. De Autorn leggt Agent-Memory in veer Modulen utenanner: Repräsentatschoon un Spiekern, Extrakschoon, Retrieval mit Routing un Maintenance. Op disse Basis hebbt se 12 repräsentative Memory-Systemen plus twee Baselines över fief Benchmark-Workloads un 11 Datensätz dörchmeten. Dat zentrale Resultat: Keen enkelte Architektur winnt över all Szenarien, de Wirksamkeit hangt dorvun af, wo goot de Gedächtnisstruktur to den jeweiligen Engpass vun den Workload passt. Över fiengledrige Ablation-Studien quantifizeert se butendem Repräsentatschoonstro, Retrieval-Präzision, Update-Korrektheit un Langtiedstabilität. Un se wiest en kloren Kösten-Nutten-Effekt: lokal begrenzte Pleeg vun’t Gedächtnis is düütlich günstiger as en globale Reorganisatschoon. De Kood liggt apen op GitHub. → Aakash Gupta
Synthszr Take: Endlich mitt mal een, wat Agenten würklich düür un instabil maakt. De mehrsten Teams optimiseert an’t Modell rüm, dorbi hett de Wahl vun de Memory-Architektur en veel längere Halvweertstied as de Wahl vun’t LLM. De interessanteste Befund stickt in’n Köstendeel: lokale Pleeg sleiht globale Reorganisatschoon, wiel man nich jedet Mal dat hele Gedächtnis nee oprüümen mutt, wenn sik en Detail ännert. Wokeen vundaag Agent-Fleets in Produkschoon bringt, schull jüst hier ansetten, denn de Compound-Engineering-Loop leevt dorvun, dat Erkenntnissen bestahn blievt un bi’n nächsten Run wedder afroopbor sünd. Dat keen Architektur överall domineert, is keen Utreed för Beliebigkeit, man de Opdrag, dat Gedächtnis an den tatsächlichen Engpass vun den egen Workload uttorichten. De veer Modulen ut dat Paper döögt glieks as Checkliste för dat nächste Architektur-Entscheiden. Wokeen dat ignoreert, betahlt sien Agenten-Reken dubbelt: eenmal in’n Compute un eenmal in de Instabilität.- -Metakognitiv Feedback hölpt LLMs to mehr Unsekerheit
Tech-Arbeidskräft 2026: En Belegschap deelt sik
Lenny Rachitsky un Noam Segal hebbt to’n tweeten Mal in Reeg en grote Ümfraag ünner Tech-Anstellte utweert, un dat Bild vun 2026 wiest en deep deelte Belegschap. Op de Fraag, woans KI jemehr Sülvstbild as Profis ännert hett, seggt 49 Perzent „amplified“ (se köönt mehr un Beteres), wiel sik 13,9 Perzent „destabiliseert“ un wiedere 5 Perzent eenfach „entweertet“ föhlt. Jüst disse Sülvstinornen seggt de Karrierestimmen mehr vörut as Rull, Senioritätsstoop oder Firmengrött tohoop (standardiseert β vun +0,39 för Optimismus, +0,60 för dat Wieterempfehlen vun dat egen Feld). De signifikante Burnout steeg binnen een Johr vun 44,7 op 55,7 Perzent, de Karriereoptimismus full vun 54,8 op 48,7 Perzent. 53 Perzent wörrn Neestarters vun jemehr egen Beroop afraden, ofschoonst vele för sik sülvst toversichtlich blievt. 82 Perzent bericht vun metbor högere Produktivität, doch de gröttste Sorg is nich Jobverlust (blots 22 Perzent), man mehr Arbeit för’t sülve Geld (51 Perzent) un en Tempo, dat nich to hollen is (46 Perzent). Designer un Researcher sünd de verunsekerte Grupp, Gründers blievt de glücklichsten Minschen in de Bransche. → Lenny’s Newsletter
Synthszr Take: De 82 Perzent föhlte Produktivität sünd de interessanteste Weert vun de hele Ümfraag, wiel se een an en ungemötliche Studie vun METR ut 2025 denken lett: Erfohrene Entwicklers föhlen sik mit KI twintig Perzent gauer un weern negenteihn Perzent langsamer. Output föhlt sik an as Fortschritt, un disse Lück twüschen Wohrnehmen un Meten is jüst de Zoon, in de 51 Perzent den Verdacht kriegt, dat se bloots mehr för’t sülve Geld doot. De egene Delen löppt nich twüschen Junior un Senior, man twüschen de, de KI as Hevel begrepen hebbt, un de, de noch dat dode Peerd vun de ole Rullenlogik riedt. De Klaus-Fall gifft dat in jede Firma: de 22-Johr-Expert, de eerst still tokiekt un denn triumphal de Edge Cases finnt, anstatt sik nee uttofunnen. Wokeen disse Week in de Personalplanung kiekt, schull weniger op Titels un mehr op de Sülvstinornen achten, denn de entscheedt över Binnen un Burnout. De Organisatschonen, de nu Befähigen statt Druck för mehr Tempo organiseert, hoolt jemehr Lüüd. De annern verwesselt en höger Tempo mit en betere Richt.
De rode Königin un de Gödel-Automat: KI, de den Maatstaff mitwassen lett
En Forscherteam üm Alex Iacob un Nicholas D. Lane (Cambridge/Flower Labs) hett mit de Red Queen Gödel Machine (RQGM) en Framework för rekursive Sülvstverbeteren vörstellt, dat mit en olen Denkfehler brickt: Bitherige sülvstoptimere Agenten prüft sik an en fasten Verifier, Benchmark oder labelten Datensatz, de sik nich mitbeweegt. De RQGM maakt de Beweerten sülvst to’n Deel vun de Verbeterensslööp. De Söök löppt in Epochen mit faste Beweerten binnen de Epoch, wiel sik de Nuttenfunkschoon an de Epochengrenzen ännert, so dat de Garantien pro Epoch gellt, wiel sik dat Teel wiederentwickelt. Al bi verifizeerbor Coding-Opgaven höögt en tosätzlich Agent-as-a-Judge-Signal de Test-Pass-Rate över den bitherigen Stand vun de Technik, un dat mit 1,35x bet 1,72x weniger Token. Bi wetenschaplich Schrieven un Reviewing as ok bi Olympiade-Bewiesen reckt co-evolveerte Autorn 1,78x bet 1,86x högere Annahmquoten, co-evolveerte Graders 9 Perzent högere Genauigkeit. De brisanteste Befund: De starkste Baseline-Reviewer winkt KI-genereerte Papers mit bet to 1,91-fache Rate dörch, vergleken mit minschliche, bet en adversariaal Teel Reviewers finnt, de bi Maschien un Minsch liek streng sünd. → Techpresso
Synthszr Take: De interessanteste Satz in’t hele Paper is de 1,91. De beste vörhannene Reviewer akzepteert KI-Papers meist dubbelt so geern as minschliche, un keeneen hett’t markt, wiel de Maatstaff stillstünn. Jüst dat is de Fall, in de Coding-Agenten vundaag hangt: Se optimiseert brillant för de Klausur un loopt an’t Verstahn vörbi, wenn de Verifier fast blifft. De RQGM dreiht doran, indem se den Spoodmaatstaff sülvst evolveren lett, un dat dat bavenop Token spoort statt köst, maakt de Saak praktisch statt akademisch. Wokeen vundaag Agenten in Produkschoon bedrifft, schull disse Week de egen Evals op den Prüfstand stellen un fragen, of se mehr meten doot as dat, woneem de Agent op traineert hett. En Beweertenskriterium, dat nie mitwasst, is keen Sekerheit, dat is en blinnen Plack mit Tiedstempel. Wokeen den Maatstaff schrieven kann, de sik mit dat System wiederentwickelt, programmeert de Maschien, de programmeert.



