Musk trommelt för dat ne'e Grok 4.6 Release: „objectively #1“
- • Grok 4.6 haalt Kimi K3 över un kummt op 61 Punkten in'n AI-Index
- • Lovable sekert sik 400 Millionen Dollar un de EU stiggt mit in
- • Mistral plaant bet 2030 een Gigawatt egen KI-Rekenleistung in Europa
Grok 4.6 beter as Kimi K3, billiger as OpenAI
SpaceXAI, dat fröhere xAI, hett an’n Middeweek Grok 4.6 rutbröcht, keen Maand na Grok 4.5. Dat Modell kriggt 61 Punkten in’n Artificial Analysis Intelligence Index, en Sammelweert ut negen Benchmarks, un liggt dormit vör dat chineesche Open-Weights-Modell Kimi K3 von Moonshot un ok glieks op mit OpenAI sien GPT-5.6 Sol Max. Vör Grok staht blots noch Anthropic sien Claude Opus 5 mit 63 un Claude Fable 5 mit 62 Punkten. In’n Vergliek to Grok 4.5 High, dat bi 56 leeg, sünd dat fiev Punkten mehr.
De API-Pries blifft bi 2 Dollar för jede Million Input-Token un 6 Dollar för jede Million Output-Token, af 200.000 Prompt-Token verdubbelt sik beid Sätz. Na de Reken von The Decoder liggt Grok 4.6 dormit mehr as 60 Perzent ünner Claude Opus 5 (5/25 Dollar) un GPT-5.6 Sol (5/30 Dollar). To kriegen is dat Modell nu glieks över de API, in Cursor, in dat huusegen Coder-Warktüüg Grok Build (Deel von dat SuperGrok-Abo af 30 Dollar in’n Maand) un ok bi Partners as OpenRouter, Vercel un Cloudflare. In de eerste Week gifft SpaceXAI in Cursor un Grok Build dat dubbelte Kontingent, wat dorbi is.
Technisch beschrifft SpaceXAI en längeren tosätzlichen Trainingslauf as bi Grok 4.5, mit kurateert, von’t Modell maakt Reasoning- un Technikdaten un en ännerten Optimizer. Achterna schall man mit Grok 4.5 de Trajektorien för dat Supervised Fine-Tuning över verscheden Reasoning-Stopen, Agenten-Harnesses un Domänen nee maakt un opfallige Verlööp per modellbaseert Prüven utsorteert hebben. Dat Reinforcement Learning ziel op agentische Ümgegenden as allgemeen Coden, Kernel-Optimieren, Web-Utwickeln un CAD. Na Angaven von den Anbeder prüft dat Modell bi lange Opgavenkeden fäker sien egen Twischenarbeit, ehrdat dat wiedermookt; unafhängig nakeken is dat nich.
De Enkeltweerten sünd na The New Stack nich eenheitlich. Op CursorBench v3.2 kummt Grok 4.6 op 69,9 Perzent (Grok 4.5: 66,7) un liggt vör GPT-5.6 Sol Max mit 67,2, aver achter Fable 5 Max mit 70,5 Perzent. Op DeepSWE v1.1 stiggt de Weert von 54 op 65,9 Perzent, wiel Sol Max 73 un Fable 5 Max 70 Perzent schafft. Bi Terminal-Bench v3.0 verbetert sik Grok von 15,7 op 26 Perzent un blifft düütlich achter Sol (34,6) un Fable (34,1). Op den Wetenarbeits-Benchmark GDPval-AA v2 steiht dat Modell mit en Elo-Weert von 1.753 op Platz twee achter Claude Opus 5 un bruukt för komplexe Opgaven üm un bi 53 Schreed, wo Opus 5 so wat 103 bruukt.
Elon Musk hett op X verkloort, Grok 4.6 weer „objectively #1 when considering intelligence, speed & cost“. Gizmodo wiest dorop hen, dat de Trüggkehr in de Spitzengrupp to de sülve Tied is as de Övernahm von den Coder-Anbeder Cursor, de ehr realen Brukerdaten al in dat Training von Grok 4.5 inflaten wesen schöölt. Een Dag vör dat Modell harr SpaceXAI mit Grok Bot en System för duerhaft lopen Agenten in de Beta bröcht. Gizmodo hollt togliek fast, dat Grok in de Apentlichkeit vör allen dör dat massenhaft Maken von nich-inverstahn Naaktbiller opfullen is un mehr US-Behörden Sekerheitsbedenken anmellt hebbt. → venturebeat, thenewstack, x, gizmodo, the-decoder
Synthszr Take: 61 Punkten sünd en arithmetisch Kompromiss ut negen Benchmarks, un disse Kompromiss maakt dat glatt, wat in’n Alldag den Ünnerscheed mookt. Op Terminal-Bench v3.0 steiht Grok 4.6 bi 26 Perzent, Sol un Fable bi över 34: In en Setup, dat veel in de Shell arbeidt, is dat en Drüddel Trüggstand, de in’n Sammelweert von starke CursorBench- un FrontierCode-Tallen todeckt warrt. De utseggkräftigste Tall von de ganze Rutgaav steiht gor nich in’n Index: 53 Schreed statt 103 bi vergliekbore GDPval-Opgaven, wiel de Tall von de Schreed direkt op de Reken dörchslagt, wiel en Indexpunkt nümms wat köst. Musk sien „objectively #1“ is de logische Folg dorvun, dat en enkelte Tall to’n Verkoopsargument worrn is, ofschoonst se sik ut negen ganz ünnerscheedliche Prüfungen tohoopsett. Wenn dien Agent Kernel optimiert, is en anner Modell vörn, as wenn he Frontend-Prototypen boot, un keen von de beiden Fäll steiht in de Ranglist. Teihn echte Tickets ut dat egen Backlog gegen dree Modellen lopen laten un de Kosten för elk afarbeidt Ticket meten: twee Nahmiddagen Arbeit, un de Antwoort is solider as jede Leaderboard-Positschoon.
EU-Fond stiggt bi Lovable in
Dat Stockholmer Startup Lovable hett 400 Millionen Dollar in en Series C insammelt un warrt dorbi mit 13,3 Milliarden Dollar beweert. De Plattform lett Brukers Software per natüürliche Spraakbeschrieven boen, en Verfohren, dat nu as Vibe Coding bekannt is. Toeerst harr dat Wall Street Journal doröver bericht, vörher weer von 300 Millionen bi 13,2 Milliarden snackt worrn. Co-Lead is blangen Menlo Ventures de Scaleup Europe Fund, en EU-Investitschoonsvehikel, dat von den sweedschen Vermögensverwalter EQT manageed warrt un na Bloomberg över en Pott von fiev Milliarden Euro verföögt. Lovable is een von de eersten apenleggten Investments von dissen Fond, de sien utdrücklich Teel is, europääsche Wachtumsfirmen dorvör to bewohren, na Amerika aftowannern. Dat Ünnernehmen seggt, dat se to’n Enn von’n Maand op en Johresumsatzraat von knapp 600 Millionen Dollar tostüert, na egen Angaven meist dat Dreefache von den Weert, de in’n Dezember nöömt wörr, un will de Mannschop üm 50 Perzent op 450 Lüüd opstocken. To de Kunden tellt Nvidia, Adidas, Hearst un de Düütsche Telekom. → Techpresso
Synthszr Take: De Beweertung hett sik in acht Maanden verdubbelt, de Umsatzraat in de sülve Tied meist verdreefacht. In’n Dezember köst 6,6 Milliarden op goot 200 Millionen Run Rate mehr as vundaag 13,3 Milliarden op 600 Millionen: Dat Umsatzveelfache is von rund 33 op so wat 22 fullen, wiel buten över de Blaas snackt warrt. De Pries löppt dat Geschäft also achteran, un genau dat is dat egentliche Signal von den Vibe-Coding-Boom: De Bokosten för Software sünd so wiet sunken, dat 1,2 Millionen ne’e Projekten pro Week tostannen kaamt, also Saken boot warrt, de sik vörher schlicht nich reekent hebbt. De apen Flank liggt in de Halfweertstied von dat Wassen. En Umsatzraat is en Momentopnahm, un nümms weet, wo vele von de 60 Millionen Projekten in een Johr noch loopt, laat staan betahlt warrt. Zendesk is togliek Kunn un Kroontüüg för de Skepsis, wenn de egen Produktdirekter apen seggt, dat de Toverlässigkeit in’n groten Maat nich langt. Zertifizeren un en Police von Lloyd’s kann’n köpen, belastboren Code nich: Of ut 600 Millionen en dreegfähig Geschäft warrt, warrt sik doran entscheden, wat de genereerte Code in’n Produktivbedriev uthollt.
Mistral will bet 2030 een Gigawatt egen KI-Rekenleistung in Europa boen
Mistral künnigt an, bet 2030 in Europa Rekenkapazität von bet to een Gigawatt optoboen. Dat Ünnernehmen begrünnt den Schreed mit dat Teel von suveräne Infrastruktur, also en KI-Basis, de nich op de Rekenzentren von amerikaansche Anbeders löppt. Na TLDR IT warvt Mistral al üm langfristige Kunnentosagen, üm de Expansion aftosekern. Bet nu bedrifft dat franzöösche Ünnernehmen sien Modellen mehrstendeels op frömde Infrastruktur, ünner annern bi Microsoft Azure, Google Cloud un CoreWeave. Anfang 2026 harr Mistral 722 Millionen Euro insammelt, üm egen Rekenzentren mit NVIDIA-Hardware in Frankriek un Sweden to boen. De nu nöömte Gigawatt-Mark is en Teelgrött bet to’t Enn von dat Johrteihnt, keen aktuellen Utbostand. → TLDR IT
Synthszr Take: Een Gigawatt bet 2030 is in Europa en industriepolitische Ansaag, un se warrt ok so meent ween. De Tall klingt groot, bet man se blangen de drestelligen Milliardenbedrääg leggt, de US-Anbeders alleen in de nächsten twee Johr in Rekenzentren stecken. Intressanter as de Kapazität is de Satz dorachter: Mistral söcht langfristige Kunnentosagen, ehrdat de Bagger rullt. Suveränität warrt dormit to en Verdrag, den europääsche Ünnernehmen ünnerschrieven mööt, un genau dor warrt sik entscheden, of ut de Ankünnigung Beton warrt. Solang Inkoop un IT wieder na Pries pro Token bi de Hyperscalers optimiert, blifft dat Gigawatt en Pressemitdelen mit Footnoot. För en Industrieünnernehmen mit Maschinen-, Prozess- oder Konstrukschoonsdaten is en europääsche Ankermeederschap en betahlbore Versekerung gegen politische Tofäll, op jeden Fall düütlich billiger as en latere Migratschoon ünner Tieddruck. De spannende Fraag för de nächsten twölf Maanden is nich, of Mistral boen kann, man wokeen de Verdrääg ünnerschrifft.
Gemini reckt een Milliard Brukers, ChatGPT weer al Weken vörher dor
Google-CEO Sundar Pichai hett op X mitdeelt, dat de Gemini-App elkeen Maand een Milliard Minschen reckt un dormit dat an’n gausten wassen Produkt in de Firmengeschicht is. Dat is dat 14. Google-Produkt, dat disse Grenz överstiggt. OpenAI harr de Mark al vörher knackt: De Naricht, dat „mehr as een Milliard Minschen ChatGPT bruukt“, stünn an’n 6. August in en Blogpost över Insatzszenarien, wiel externe Daten na Reuters al in’n Juni op een Milliard hendüüdt hebbt. OpenAI-Sprekersch Lindsay McCallum seggt, de Monthly Active Users harrn de Milliard vör längere Tied överstegen, weekenwies weer de Mark in’n Juli fullen; en konkrete Maandstall nöömt dat Ünnernehmen nich. In’n Februar harr OpenAI 900 Millionen weekenwies aktive Brukers mellt, Google to de sülve Tied 750 Millionen maantliche Gemini-Brukers, Enn Juli denn 950 Millionen. Gemini-Baas Josh Woodward schreef, de App harr över 100 Millionen aktive Brukers op iOS, wat den ganz överwegen Deel von de Brukerbasis op Android ansiedelt. Anthropic gifft keen Brukertallen rut; Schätzungen liggt in’n tweestelligen Millionenberiek. → MyClaw Newsletter
Synthszr Take: Pichai mellt de Milljard as en Post, OpenAI packt se in en Blogpost över Anwennensfäll. De Luutstärk is ümkehrt to de Marktpositschoon, un dorvör gifft dat en Tall: vun 900 Milljonen in’n Februar op en Milljard in’n Juli sünd üm un bi ölven Perzent in fief Maanden. Gemini keem in de sülve Tiet vun 750 op 950 Milljonen. För en Produkt, dat Johren lang as de an’n gausten wassen Software vun all Tieden dör jede Präsentatschoon reich wurrn is, is de egene Kurv de ungenehmste Naricht vun’n Sommer, dorüm de liese Toon. Google sien Tall hett aver en Bipackzettel: goot 100 Milljonen aktive Brukers op iOS, de ganze Rest op Android, woneem Gemini al bi’t Utpacken vun’t Gerät installeert is. Dat is Distributschoon, verpackt as Nafraag, un dat verkloort teemlich nau, worüm OpenAI siet den Sommer Geld in egene Hardware steken deit. Beide sitt nu op en Milljard Minschen un de sülve apen Fraag, wat dorvun egentlich betahlt.
Y Combinator gifft sien intern Agenten-Framework QM ünner MIT-Lizenz free
Y Combinator hett QM (kort för Quartermaster) op GitHub publizeert, en Framework, dat de Accelerator vördem Maanden lang blots intern bruukt hett. Dat Repo beschrifft dat as Multiplayer-Agent Harness för de Arbeit, to bruken in Slack un in’t Web. Na Angaven vun YC leep dat Systeem intern in de Bookhollerie, in de Rechtsafdelen, in’t Event-Team un in’t Engineering, wobi QM sülvst mit QM wiederentwickelt worrn is. De Lizenz is MIT, luut Linas’s Newsletter fallt för en Team dormit blots Cloud-Hosting un Model-Tokens an. De Publizeern keem teihn Daag na Blocks Open-Source-Release Buzz, en Nostr-baseerten Agenten-Arbeitsplatz, de Slack un GitHub aflösen will, wiel QM op dat vörhannene Slack opboot. → Linas from Linas’s Newsletter
Synthszr Take: MIT-Lizenz heet koperen, ümboen, kommerziell insetten, ahn een na Verlööf to fragen. För all, de keen Modell traineert un keen Runn insammelt, liggt dormit de Koordinatschoonsschicht apen, an de de mehrsten Agenten-Projekten in’t letzte Johr hangenbleven sünd: mehr as een Minsch un mehr as een Agent in enen Thread, navulltreckbor, mit en klor Opgavenverdelen. Dat QM sik in dat vörhannene Slack inhaken deit, drückt de Instiegshinnern op enen Namiddag, wiel Blocks Buzz verlangt, dat en Team sien hele Tosamenarbeit ümtreckt. De 13.000 Stars meet Neeschier, sünst nix. De egentliche Arbeit sitt in de Berechtigungen un in de Entscheden, wat för Opgaven man enen Agenten överhaupt in de Hand gifft, un de blifft bi’t Team.
OpenAI bringt ChatGPT mitsamt Codex nativ op Linux, mit Togriep op lokale Repos
OpenAI hett en Preview vun de offizielle ChatGPT-Desktop-App för Linux publizeert, na’t dat Programm Johren lang blots för Mac un Windows geev. Luut AlphaSignal hannelt sik dat üm en native Anwennen, keen Browser-Wrapper un keen Kommandozeelen-Warktüüg. Bünnelt sünd dree Bestanddelen: de bekannte ChatGPT-Assistent, ChatGPT Work för Team- un Arbeitsplatzopgaven un Codex, en Coding-Agent, de lokale Dateien lesen, in vörhannene Repositories arbeiden un Anwennen op de Maschien stüern kann. Ünnerstütt warrt Ubuntu 24.04 un 26.04 LTS, Debian 13 as ok Fedora 43 un 44. De Installatschoon löppt över .deb- oder .rpm-Paketen för x64 un ARM64, wobi de Installer tosätzlich en OpenAI-Repository indriggt, so dat Updates över apt nafleeten doot. De Download is kostenlos, enkelte Funkschonen bruukt en betahlten Tarif. → AlphaSignal
Synthszr Take: De Agent treckt op de Maschien, op de de Bornkood liggt, un de Rechtenverwalten dor is de vun 1995: en Unix-Bruker, den allens höört, wat ünner sien Home-Verzeichnis liggt. To de sülve Tiet wiest Forschers, dat de verslötelten Reasoning-Blobs vun Claude, GPT un Gemini portabel sünd. Man nimmt en Blob ut Opus, schufft em in’t billigere Haiku, un dat Modell leest den Inholt brav vör, ganz ahn broken Verslöteln. En Scan vun rund 7.000 apentlich deelte Traces hett 62 API-Keys, 33 E-Mail-Adressen un 33 Passwöör to Daag föddert. De Labors hebbt na de Opdecken nabessert, aver de Taktung blifft scheef: Togriepsdeepd wasst in Weken, Schuulmechanismen in Quartalen. Praktisch heet dat, den Agenten en egen Systeembruker to geven, Repositories enkelt freetogeven un Togangsdaten ut de Projektdateien in en Secret-Store to verlagern; dat is an enen Namiddag erledigt, de .deb-Installatschoon duert en Minuut. En Agent mit Leesrecht op dat kumplette Home-Verzeichnis is en Entscheden, keen Vörinstellen.
Perplexity blockeert Times-Anzeigen för KI-Agenten un drauht Publishers mit Trust-Aftog
Perplexity hett bestätigt, dat se de Warf blockeert, de Time siet Korten in de Markdown-Versionen vun ehr Websieden utlevert, also in de Faten, de KI-Agenten ansteed vun minschliche Lesers afropen doot. Digiday harr goot twee Weken vörher bericht, dat Time as eersten Verlag solek Agenten-Anzeigen verköfft. Perplexity sien Kommunikatschoonschef Jesse Dwyer hett dat Format gegenöver Digiday as arglistig betekent un verkloort, Verlagen, de „deceptive advertising like markdown ads“ insetten doot, riskeert en Afweerten in’n firmenegen Söökindiex mitsamt Aftog bi’n Trust Score. Woans Perplexity „arglistig“ defineert un woans de Blockaad technisch funktschoneert, hett dat Ünnernehmen nich beantwoort; Steven Liss vun OpenAds.AI vermoodt gegenöver Digiday, dat de Agenten eenfach anwiest warrt, Warfblöck nich aftoropen. Dat Warfprodukt sülvst kummt vun de Warftechnik-Firma Mobian, de ut en Marken-Briefing Markdown-Inholten in’t FAQ-Format maakt, se in de Time-Sieden insett un meten deit, wo faken KI-Söökmaschinen se opgriepen doot. Eerste Köpers weern Ally Bank un dat Project Management Institute; of ehr Verdrääg anpasst warrt, is apen. Mobian-Chef Jonah Goodhart sä to Digiday, de Resonanz op dat Format weer bit nu hen positiv, hett dorvör aver keen Tallen nöömt. → MyClaw Newsletter
Synthszr Take: Time hett dat klookschiete Lock sehn un versöcht, dat to stoppen. De Agent leest de Siet, dat Warfbanner süht nümms mehr, also verköfft man de Boodschap even an de Maschien. De Reken geiht blots op, solang de Maschien mitspeelt, un Perplexity hett in weniger as twee Weken beslaten, dat se dat nich deit. Intressant is de Asymmetrie in de Begrünnen: Wat Time as markenverifizeerte, kenntekente Informatschoon verköfft, stuuft de Index eensiedig as Arglist in, un de Trust Score liggt glieks as Druckmiddel dorneven. Ally Bank un dat Project Management Institute hebbt för Sichtborkeit betahlt, Time hett de Inholten levert, un de Afroop dör den Agenten kost Perplexity wiederhen nix. Solang dat so blifft, is jede Monetariseren över den Siedeninholt sülvst blots en Versöök, ahn Tostimmen vun’n Dörwächter an de Kass vörbitokamen. De belastbore Variant is en uthannelt Pries pro Afroop, mit Verdrag ansteed vun en verstekene Textregel. Allens annere ennt in en Runn Katt un Muus, de de Verlag verleert.
Peking tellt 140 Billionen Tokens an’n Dag un maakt se to en offizielle Weertschopskenntall
De Branschen-Newsletter Hello China Tech argumenteert, dat Chinas KI-Markt sik genauer över Tokenvolumen, apentliche Utschrieven un Priesen lesen lett as över de Ranglisten vun de Modell-Benchmarks. Achtergrund is en Entscheden ut Peking vun’n März: De Token, also de lüttste Verarbeidens-Eenheit, in de Spraakmodellen Texten uteneen nehmen doot, is to en offizielle ökonomsche Kenntziffer maakt worrn. As Utgangsweert nöömt de Autor rund 140 Billionen Tokens, de jeden Dag in’n chineeschen Markt verarbeidt warrt. Dormit gifft dat en staatlich utwiesen Verbruukstall för KI-Bruuk, to verglieken mit Kenntziffern för Stroom oder Göderverkehr. De Autor stellt de Fraag, wat disse Bookhollerie-Rahmen afbillt un wat he utblennt, un wiest dorop hen, dat he dat Argument al in’n November opstellt un in’n April deper maakt harr. Tallen to de Tosamensetten vun’t Volumen oder to de Methood, woans dat opnahmen warrt, nöömt de Bidrag nich. → Hello China Tech
Synthszr Take: 140 Billionen Tokens an’n Dag is en Verbruukstall, liek utsaagkräftig as Kilowattstünnen oder Frachttonnen. Se wiest, wo veel dör de Rekenzentren löppt, un swiggt doröver, of dorbi irgendkeen en Problem lööst hett. En Modell, dat dreemal nee ansett, wiel de eersten beiden Antwoorten nich to bruken weern, maakt dreemal so veel Tokens as een, dat foorts draapt: De Fehlversöök süht in’n Index beter ut as de schone Lösen. Dorto kummt de Priesdynamik: Fallt de Tokenpriesen gauer, as de Mengd wasst, stiggt de Indikator, wiel de Ümsätz krimpen doot. De Utschrieven un Prieslisten, de Hello China Tech parallel mitlesen deit, sünd de hardere Währung, denn dor steiht, wokeen würklich Geld op den Disch leggt. De Index koppelt de Debatt an de würkliche Nafraag ansteed vun Testergevnissen, wat de Benchmark-Ranglisten bit nu hen nich henkregen hebbt. Opklären deit dat in den Moment, wenn Peking de Tall na Branschen opslötelt: Denn wiest sik, of de Tokens in de Produkschoon un Verwalten fleeten doot oder in Chatbots, de nümms bruukt.
Spotify markeert KI-Künstlers as „AI Persona“ un smitt se ut de Anraden rut
Spotify kenntekent af Mitt September Künstlerprofilen, de ehr Identität künstlich maakt is, mit en „AI Persona“-Badge un nimmt ehr Musik standardmatig ut de redaktschonellen un algorithmischen Anraden rut. Dat Ünnernehmen hett de Ännern an’n Dingsdag bekannt geven. Künstlers köönt sik sülvst as AI Persona utwiesen, na Angaven vun den Anbeder verlött sik Spotify aver nich alleen op disse Sülvstutkunft, man pröövt Profilen tosätzlich dorop, of Naam un Bildmaterial op en fotorealistisch maakte Identität hendüüdt. De Pröven fangt bi Profilen an, de vördefineerte Höörerswellen överschreden hebbt, dormit de an’n fakensten höörten Accounts toeerst faat warrt. Dat Badge kummt in’t Profilbanner, in’n About-Bereich, in de Söök un in de Track-Regen vun Playlists. Musik vun en AI Persona lannt blots denn in de personaliserten Anraden, wenn en Bruker dat Profil aktiv folgt. De Regel maakt Spotify sien KI-Richtlien vun September 2025 grötter, de Titels al över en Branschenstandard kenntekent un nich autoriseert Voice Cloning un Deepfakes verböödt. → AI Secret
Synthszr Take: För den Tohörer is de egentliche Fraag, wat dat Fehlen vun dat Badge bedüden deit. Spotify prüft na egen Utsaag toeerst Profils baven defineerte Tohörerswellen, un dat heet in’n Ümkehrsluss: In de grote Masse dor ünner seggt en fehlen Label blots, dat noch nümms henkeken hett. En Transparenzhinwies, de as en Utsaag över Echtheit leest warrt, aver blots en Utsaag över den Prüfstatus is, produzeert exakt dat verkehrte Vertruen. Harter as dat Badge wirkt de tweete Deel: Wecker ut de redakschonellen un algorithmischen Anraden flüggt, verlüst den eenzigen Vertriebsweg, de op Spotify würklich Reekwiett bringt. Vun dor an lohnt sik dat Versleiern vun de Herkumst finanziell. De spannende Tall warrt dorüm nich de Antall vun vergeven Badges ween, man de Tiet twüschen den Upload vun en nee Profil un sien Instopen. Blifft de in’n Bereich vun Weken, is dat Label en Schüld an en apen Dör. Sinnvull weer en drüdden Tostand in’t Interface: prüft, nich prüft, KI. Dree Tostännen sünd ehrlicher as en Badge, dat blots in een Richt snackt.
CoEvoSkills lett KI-Agenten jemehr Skill-Paketen sülvst schrieven un sülvst pröven
En Forscherteam üm Hanrong Zhang un Philip S. Yu hett mit CoEvoSkills en Verfohren vörstellt, mit dat Agenten de so nöömten Skills egenstännig maken köönt, anstatt dat se jem vun Hand schreven kriegt. Skills sünd en vun Anthropic inföhrt Konzept: Wiel en Tool en enkelte, afslaten Funkschoon is, besteiht en Skill ut en struktureert Bünnel vun Dateien, de vunenanner afhangig sünd, för mehrstopige Fachopgaven. De Autoren argumenteert, dat dat manuelle Maken vun sücke Paketen opwännig is un to Afwieken twüschen minschlich un maschinell Opgavenopfaten föhrt, wat de Agentenleistung in Utwertungen op SkillsBench drückt. Bestahende Sülvstverbeterungs-Verfohren sünd op enkelte Tools tosneden un laat sik wegen de högere Komplexität nich direkt op Skills överdragen. CoEvoSkills koppelt dorüm en Skill Generator, de de Paketen Schritt för Schritt överarbeidt, mit en Surrogate Verifier, de mitwickelt warrt un Trüchmellen gifft, ahn de egentlichen Testinhalten to kennen. Na Angaven vun de Autoren överdript dat Verfohren op SkillsBench fiev Verglieksverfohren sowohl ünner Claude Code as ok ünner Codex un överdräggt sik op söss wiedere Spraakmodellen. De Arbeit is bi de COLM annahmen, de Code liggt apentlich op GitHub. → Techpresso
Synthszr Take: De interessante Deel stickt in’n Verifier, nich in’n Generator. Fine-Tuning verschufft Gewichten in en Blackbox, nümms kann achteran in’t Diff nalesen, wat sik ännert hett. En Skill is en Bünnel Dateien: lesbor, versioneerbor, löschbor. Exakt dorüm is Sülvstverbeterung op disse Even bedrievlich to beharrschen, wiel se in’t Modellgewicht en Vertruensproblem blifft. De egentliche technische Wedd vun de Arbeit is, dat en Prüfer, de de Ground-Truth-Tests gor nich süht, liekers bruukbor Feedback levert un bi’t Mitentwickeln nich anfangt, sien egen Generator schööntosnacken. Dat dat över söss tosätzliche Spraakmodellen weg driggt, is dat stärkere Signal as de Sieg över fiev Baselines. Praktisch heet dat: De Bibliothek vun de egen Skills warrt to en Asset, dat man pleegt as Code, mit Review, Rollback un Egendömer. Wenn Agenten jemehr egen Arbeidsanwiesen schrievt, verlagert sik de Ingenieursarbeit op de Fraag, woran en Skill as goot gellt, un disse Kriterien kann keen Paper mitlevern, de kaamt ut de egen Domään. In twölf Maanden warrt de spannendere Kenntaall nich ween, woveel Skills en Agent genereert hett, man woveel dorvun en Minsch na en Blick in’t Repo wedder rutschmeten hett.



