älter | home
Den plný novinek: Google je stále ve hře a Meta si nárokuje prvenství v kódováníSynthszr
synthszr #248 z čtvrtek 3. září 2026

Den plný novinek: Google je stále ve hře a Meta si nárokuje prvenství v kódování

  • • Google uvádí Gemini 3.8 Flash – třetí model za pouhých šest týdnů.
  • • Meta představuje Muse Spark 1.3 a vidí se v souboji s OpenAI.
  • • Google spouští Google Pics jako alternativu ke Canvě v rámci předplatného Workspace pro firmy.

Google vydává Gemini 3.8 Flash: třetí model Flash za šest týdnů

Společnost Google vydala 2. září 2026 Gemini 3.8 Flash a jeho bezpečnostní variantu Gemini 3.8 Flash Cyber, a to tři týdny po předchozí verzi 3.7 Flash. Jedná se o třetí vydání modelu Flash během šesti týdnů a čtvrté během čtyř měsíců. Zaváděcí cena zůstává 0,75 dolaru za milion vstupních tokenů a 3,75 dolaru za milion výstupních tokenů; její platnost vyprší 31. prosince 2026 a poté se zdvojnásobí na 1,50, respektive 7,50 dolaru. Model zpracovává text, obrázky, video, audio a PDF s kontextovým oknem 1 048 576 tokenů a maximálně 65 536 výstupními tokeny. Model Gemini 3.5 Pro, ohlášený v červnu, se dosud neobjevil; v srpnu přešel šéf DeepMind Demis Hassabis na pozici předsedy a operativní řízení převzal Koray Kavukcuoglu jako SVP.

Podle Googlu překonává model 3.8 Flash na DeepSWE v1.1 pro dlouhodobé softwarové inženýrské úkoly většinu větších frontier modelů za zlomek nákladů. V indexu Artificial Analysis Intelligence Index dosahuje model na vysoké úrovni reasoningu 59 bodů, o tři více než jeho předchůdce, a vyrovnává se tak GPT-5.6 Sol a Grok 4.6. Nad ním jsou GLM-5.3 a Kimi K3 s 60 body, Grok 4.6 a GPT-5.6 Sol s 61 body, Claude Opus 5 s 63 body a Claude Fable 5.1 s 66 body. Co se týče nákladů, Flash 3.8 stojí podle Artificial Analysis 0,58 dolaru za úkol v indexu, zatímco Fable 5.1 stojí 3,76 dolaru. V testu agentního využití počítače OSWorld-2.0 se model oproti 3.7 Flash zlepšil, ale stále výrazně zaostává za Claude Opus; v Terminal-Bench 4.0 dosahuje 19,1 procenta.

Samotný Google přiznává, že 3.8 Flash spotřebovává více tokenů: model provádí dodatečné kroky úsudku (reasoning) a iterativně volá nástroje. Podle měření Artificial Analysis stojí jeden úkol přibližně o 40 % více než u předchozí verze, přestože cena za token zůstala nezměněna. Důvodem je o 30 % více výstupních tokenů a více cyklů (turns) na jeden průběh agenta. Vývojáři si mohou i nadále vybírat mezi nízkou, střední a vysokou úrovní úsudku (reasoning) nebo zůstat u modelu 3.7 Flash.

Varianta Cyber nahrazuje Gemini 3.5 Flash Cyber a je dostupná výhradně prostřednictvím nového programu Fairwind, který zahrnuje přibližně 650 partnerů, včetně Accenture, CrowdStrike, Datadog, Palo Alto Networks, Snowflake, Wiz a Center for Internet Security. Účastníci získají navíc přístup k agentovi CodeMender. Podle interních údajů poskytovatele zaznamenal bezpečnostní tým Chrome 2,6krát vyšší přesnost oprav, cloudový tým našel kritickou zranitelnost za dvě hodiny a v CWE-Bench je úspěšnost (pass rate) 47,2 %. Oba modely podle výrobce obsahují ochranné mechanismy proti zneužití v oblastech CBRN a ofenzivních kybernetických operací.

Současně byl model 3.8 Flash ještě v den vydání zařazen do nabídky modelů v režimu AI Mode ve vyhledávání Google. Robby Stein, viceprezident pro produkty Google Search, oznámil jeho dostupnost pro předplatitele Google AI Pro a Ultra po celém světě s možností výběru pomocí ikony plus ve vstupním řádku. Uživatelé bezplatné verze nemají možnost výběru modelu a nadále používají výchozí nastavení. U předchozích dvou generací Flash se nový model později stal globálním výchozím nastavením. → Search Engine Land, The New Stack, The Verge, Vals AI, Ars Technica, The Register, Search Engine Journal, blockchain, NPowerUser, MarkTechPost

Pohled Synthszr: Tři modely Flash za šest týdnů, 21denní odstup mezi 3.7 a 3.8: Tuto frekvenci si nikdo nenasadí dobrovolně, ale proto, že mu chybí vlastní vlajková loď. Slibovaný Gemini 3.5 Pro na červen se nikdy neobjevil, Hassabis se v srpnu přesunul na pozici předsedy a od té doby si Google udržuje viditelnost prostřednictvím levnější třídy, ve které je schopen dodávat. Pro všechny, kdo tyto modely integrují do produktů, je skutečným nákladovým faktorem právě tato kadence: evaluace, která před třemi týdny běžela na 3.7 Flash, dnes měří model, který se v nabídce již ani neobjevuje, a o 40 % vyšší náklady na úkol si všimnete až na faktuře za následující měsíc. Konkurenční tlak se nepozná podle bodů v benchmarcích, ale podle toho, jak krátce nechá poskytovatel svůj vlastní model na trhu. S velkou pravděpodobností přijde do Silvestra ještě jeden Flash a 1. ledna se tarif tak jako tak zdvojnásobí.

Meta se s Muse Spark 1.3 prohlašuje za rovnocenného soupeře pro OpenAI a Anthropic

Společnost Meta vydala 2. září 2026 model Muse Spark 1.3, dosud nejvýkonnější model z Meta Superintelligence Labs, a prohlašuje, že tím dohnala vedoucí laboratoře. Šéf AI Alexandr Wang označil model v rozhovoru pro Bloomberg za dosud největší výkonnostní skok společnosti, podle jeho slov je „konkurenceschopný“ s Claude Fable 5.1 a „lepší než“ GPT-5.6 Sol, zejména v generování kódu. Model je okamžitě dostupný prostřednictvím Meta Model API a v Muse Code, přičemž jeho zavedení do Facebooku, Instagramu a aplikace Meta AI bude následovat v nadcházejících dnech. Jedná se o čtvrté vydání modelu Spark od debutu této rodiny v dubnu 2026.

Nezávislé měření od Artificial Analysis toto tvrzení částečně podporuje. Varianta max dosahuje 62 bodů v Intelligence Index a řadí se tak na 6. místo z 636 hodnocených modelů, za Claude Fable 5.1 a Claude Opus 5. Zákazníkům dostupná úroveň xhigh dosahuje 61 bodů a je tak na stejné úrovni jako GPT-5.6 Sol (max), Grok 4.6 (high) a Claude Opus 5 (high), přičemž Muse Spark 1.2 dosáhl v srpnu 57 bodů. Varianta max zůstává v omezeném náhledu pro partnery. Vlastní srovnávací tabulka společnosti Meta byla vytvořena na interním Harness a není tedy stejným typem důkazu jako externí index.

Cena za úkol u Muse Spark 1.3 je 0,55 dolaru ve srovnání s 0,95 dolaru u GPT-5.6 Sol a 0,94 dolaru u Grok 4.6, což je o 42 % méně než u OpenAI při stejném bodovém hodnocení. Ve srovnání z 2. září nebyl žádný model s alespoň 59 body levnější; nejblíže byl Gemini 3.8 Flash s 59 body za 0,58 dolaru. Ceny tokenů zůstaly nezměněny: 1,25 dolaru za milion vstupních tokenů, 4,25 dolaru za výstup a 0,15 dolaru za cachovaný vstup. Oproti svému předchůdci však náklady na úkol vzrostly z 0,40 na 0,55 dolaru, protože bylo naměřeno o přibližně 57 % více vstupních tokenů na úkol. Úroveň Contributor s nižšími rate limity a využitím promptů pro trénování stojí 0,10 dolaru za vstup a 0,20 dolaru za výstup.

Největší zisky jsou ve vícestupňovém využití nástrojů: V benchmarku Tau3-Bench Banking vzrostla hodnota z 35 na 47 %, v Terminal-Bench 2.1 z 80 na 85 %. Dvě měření zaznamenala pokles: AA-LCR z 83 na 79 % a přesnost Omniscience o tři procentní body při vyšší míře abstinence. Podle společnosti model v případě nejednoznačných promptů klade doplňující otázky, v případě zablokování přizve uživatele a před provedením potvrzuje závažné akce. Režim „max reasoning“ má být dodán po dalších bezpečnostních testech. Mark Zuckerberg na X také oznámil, že „brzy“ zveřejní verzi Muse Spark s otevřenými vahami, poté co Meta s rodinou Spark přešla od řady Llama k vlastní strategii. → Artificial Analysis, SiliconANGLE, implicator, unite, The Register

Pohled Synthszr: Slovo ‚vyrovnaný‘ pochází z hovoru s analytiky a stěží obstojí i na základě vlastních měření. 62 bodů oproti 61 dělí Muse Spark od modelů Claude a varianta s 62 body je dostupná v omezeném náhledu pro vybrané partnery, takže ji nemůže ověřit nikdo, kdo by ji chtěl nasadit do produkce. Wang v Bloombergu označuje model za „lepší než“ GPT-5.6 Sol, zatímco srovnávací tabulka Mety běží na vlastním Harnessu Mety a dvě nezávisle naměřené hodnoty klesly: AA-LCR z 83 na 79 %. Spolehlivé číslo najdeme v řádku s cenou: 0,55 dolaru za úkol oproti 0,95 dolaru u OpenAI při stejném indexovém hodnocení 61. Po více než 14 miliardách dolarů za ScaleAI a Wanga zde Meta prodává cenové prvenství a nazývá to remízou.

Google spouští alternativu ke Canva: je součástí předplatného Workspace

Google vstupuje na trh s každodenními designovými úkoly s vlastním nástrojem pro obrázky a design nazvaným Google Pics. Produkt se stane součástí Google Workspace pro firemní zákazníky a bude navíc dostupný pro předplatitele Google AI Pro a Ultra. Podle TechCrunch by se měl v nadcházejících týdnech dostat k většině zákazníků Workspace. Technicky běží Google Pics na obrazovém modelu Googlu Nano Banana. Je určen pro tvorbu plakátů, příspěvků na sociální sítě, ilustrací a podobných vizuálů, tedy pro úkoly, které dnes obvykle končí v Canvě nebo Adobe Express. Na rozdíl od Canvy zde neexistuje žádné tržiště, kde by ilustrátoři a fotografové mohli nahrávat šablony a vydělávat na licenčních poplatcích: obsah vzniká pomocí Prompt z modelu, který byl trénován na práci kreativců. → Techpresso

Pohled Synthszr: Canva a Adobe Express musí od nynějška vysvětlovat, proč by měla firma platit za druhé předplatné na design, když v již zaplaceném předplatném Workspace běží něco srovnatelného. Přesně tak Google Slides zlevnil prezentační software a Meet videokonference: prostřednictvím balíčků, nikoli lepším produktem. Vstup do Docs a Slides je slabým místem, protože právě tam vzniká běžná grafika, pro kterou si dnes marketingové týmy objednávají licence Canva.

Claude Fable 5.1 je v benchmarku kódování u Cursoru jednoznačně nejlepším modelem

Společnost Cursor zařadila Claude Fable 5.1 do svého vývojového prostředí a označuje ho za nejsilnější model pro kódování, jaký dosud testovala. Podle Cursoru dosahuje model 73,4 procenta v CursorBench 3.2, interním testovacím postupu pro praktické programovací úlohy, a předčí tak všechny ostatní testované modely. Jako hlavní novinku poskytovatel uvádí, že Fable 5.1 následně kontroluje vlastní napsaný kód, rozpoznává vlastní chyby a pokračuje v plnění úkolu, místo aby se po výstupu zastavil. Model je podle Cursoru navržen pro dlouhé, vícestupňové pracovní kroky, které probíhají bez neustálé průběžné kontroly. Čtení z mezipaměti (cache-reads) má být o 75 procent levnější než u Fable 5, což výrazně zlevňuje opakovaně používaný kontext. → AlphaSignal

Pohled Synthszr: Model, který se dostane do výběru modelů v IDE, kde vývojáři tráví polovinu pracovního dne, dosáhl více než ten, který vede tabulku benchmarků. Těch 73,4 procenta je vlastní měření společnosti Cursor s jejím vlastním testovacím postupem, což je sice v pořádku, ale vypovídá to především o vhodnosti pro tento konkrétní nástroj. Na konci oznámení stojí věta, o kterou ve skutečnosti jde: V týmech a organizacích musí administrátor Fable 5.1 nejprve povolit na dashboardu.

Best Buy nechává umělou inteligenci dělat 80 procent kreativní práce, redukuje 22 systémů pro správu obsahu na pět

Společnost Best Buy podle vlastních údajů buduje Content Supply Chain s podporou AI a za tímto účelem sloučila 22 samostatných systémů pro správu obsahu (asset systems) do pěti. Spravuje se zde přibližně 1,4 milionu položek (assets), každá včetně metadat, uživatelských práv a stavu schválení. Jádrem změny je dělba práce v kreativní produkci: úkoly s vysokým objemem vykonává umělá inteligence až do stupně dokončení přibližně 80 procent, zbývajících 20 procent přebírají designéři a designérky. Společnost uvádí tři podmínky, bez nichž by toto rozdělení podle jejího vyjádření nebylo udržitelné: governance, propojené pracovní postupy a doprovodný change management. → MyClaw Newsletter

Pohled Synthszr: 80 procent přípravné práce strojem, 20 procent dokončení člověkem: toto rozdělení zní jako spolehlivý výpočet, nikoli jako prezentace pro představenstvo. Posledních 20 procent je přitom ta drahá část, protože zahrnuje posouzení značky, otázky práv a rozhodnutí, zda může být daný motiv vůbec zveřejněn. Konsolidace 22 systémů do pěti je proto skutečným předpokladem: bez čistých metadat a aktuálního stavu schválení chybí člověku nakonec základ, na kterém může rozhodovat v minutách místo ve dnech.

Americká vláda se ve sporu o autorská práva staví za OpenAI proti New York Times

Americká vláda se poprvé zapojila do soudních sporů o autorská práva týkajících se trénování AI a podpořila stanovisko společnosti OpenAI. V podání předloženém v úterý u federálního soudu na Manhattanu podle deníku The Guardian argumentuje, že trénování modelů na materiálech chráněných autorským právem je „mimořádně“ transformativní, a proto se na něj vztahuje doktrína Fair Use. The New York Times obviňuje OpenAI a jejího největšího investora Microsoft od podání žaloby v roce 2023 z toho, že bez povolení použili miliony novinových článků k trénování chatbota; k žalobě se připojily i další noviny. Takové podání má poradní, nikoli právně závazný charakter, ale mohlo by technologickým gigantům v řízeních poskytnout podporu. Náměstek ministra spravedlnosti Stanley Woodward Jr. na síti X napsal, že dominance v oblasti AI je klíčová pro národní bezpečnost a prosperitu a že vláda nenechá zemi zaostat kvůli „prostě chybnému chápání autorského práva“. → The Guardian

Pohled Synthszr: Právně toto podání nikoho nezavazuje, ale politicky nově uspořádává hrací pole. Věta, že trénování je „mimořádně“ transformativní, bude od nynějška viset ve vzduchu v každém z desítek probíhajících řízení, včetně těch proti společnostem Anthropic a Meta. Po dvou protichůdných soudních rozhodnutích v loňském roce bude soud, který rozhodne proti OpenAI, v budoucnu rozhodovat i proti deklarovanému postoji vlastní výkonné moci – a soudci jsou jen lidé.

Soud ruší Hegsethův zákaz zadávání zakázek, Lutnick prohlašuje Anthropic opět za přijatelnou

Ministr obchodu Howard Lutnick opět zařadil Anthropic na „správnou stranu“ Trumpovy administrativy, informuje Axios na základě rozhovoru, který převzala agentura Reuters. Předcházel tomu spor s ministerstvem obrany: Pete Hegseth vyloučil Anthropic z určitých vojenských zakázek poté, co společnost odmítla schválit použití svých modelů Claude pro domácí sledování a autonomní zbraňové systémy. Anthropic následně podala žalobu u kalifornského soudu. Dne 27. srpna dal americký soudce v tomto sporu společnosti za pravdu. Anthropic a ministerstvo obchodu podle agentury Reuters na Lutnickovo vyjádření zpočátku nereagovaly. → Reuters

Pohled Synthszr: Dne 27. srpna rozhodl kalifornský soud, a tím byl zákaz zadávání zakázek od ministra obrany zrušen dříve, než Lutnick vůbec musel najít svou usmiřovací formuli. Společnost Anthropic odmítla schválit použití pro domácí sledování a autonomní zbraňové systémy, podala žalobu a vyhrála: její vlastní podmínky použití nyní obstojí u soudu, nejen v podnikové komunikaci. Pro každého dodavatele, který obchoduje s vládními úřady, je to pádný precedent, protože šéf jednoho resortu již nemůže jednostranně blokovat zakázky v rozporu se smluvními podmínkami. Skutečný přínos spočívá v nákupu: vojenský zákazník, který ví, že podmínky jeho dodavatele jsou soudně vymahatelné, kalkuluje jinak než ten, kdo doufá v politickou přízeň.

Peking nutí Tencent, Alibabu a ByteDance otevřít své Walled Gardens

Čínské ministerstvo průmyslu a informačních technologií (MIIT) vyzvalo přední internetové koncerny v zemi, aby ukončily vzájemné blokování externích odkazů. Na schůzce 9. září byli předvoláni vedoucí pracovníci společností Tencent, Alibaba, ByteDance a Baidu, kteří museli do 17. září předložit plány implementace, informuje Caixin. Praxe budování takzvaných Walled Gardens je běžná již léta: produktový odkaz z Taobao nelze otevřít ve WeChatu, videa z Douyinu nelze přímo přeposílat kontaktům na WeChatu a Alibaba naopak blokuje WeChat Pay na platformách Taobao a Tmall. Zhao Zhiguo, vedoucí příslušného úřadu MIIT, na tiskové konferenci uvedl, že blokování odkazů narušuje uživatelský zážitek a trh a že otevírání by mělo probíhat postupně. Jde o značné dosahy: Tencent má s aplikacemi WeChat a QQ téměř 1,9 miliardy aktivních uživatelů měsíčně, Alibaba prostřednictvím Taobao a Alipay 1,6 miliardy a Douyin 640 milionů. → Hello China Tech

Synthszr Take: Odkaz, který lze otevřít, je nejlevnější formou politiky hospodářské soutěže, jakou může stát mít. Tencent má téměř 1,9 miliardy měsíčně aktivních účtů a velká část hodnoty tohoto čísla závisí na tom, že odkaz na Taobao ve WeChatu vede do prázdna. Pokud tato bariéra padne, náklady na akvizici uživatelů klesnou pro všechny, kdo nevlastní miliardovou aplikaci, a konkurenční výhoda se zmenší na to, co poskytuje samotný produkt.

Adobe přidává do chatu ve Slacku více než 70 kreativních funkcí

Společnost Adobe spustila integraci s názvem „Adobe for Slack“, která přináší více než 70 funkcí z aplikací Firefly, Express, Photoshop, Premiere, Acrobat, InDesign, Illustrator, Stock a Lightroom přímo do tohoto messengeru. Uživatelé zadají úkol Slackbotu v přirozeném jazyce, bot vybere vhodný nástroj Adobe a přitom má přístup jak k obsahu z kanálů a pláten Slacku, tak k souborům v Adobe Creative Cloud. Jako příklady použití Adobe uvádí mimo jiné převod tabulky na graf, vytváření marketingového a sociálního obsahu ze šablon, tvorbu variant již schváleného obsahu nebo hromadné úpravy velkého množství obrázků.

Aplikace je okamžitě dostupná pro zákazníky Slacku s tarify Business+ a Enterprise+, a to na webu, mobilu i desktopu. Účet Adobe není nezbytně nutný, placené předplatné odemyká další funkce a přístup k vlastním cloudovým aktivům. Technicky to navazuje na podporu Model Context Protocol ze strany Slackbotu, která byla zavedena v červnu a jejímž prostřednictvím byly nejprve připojeny Canva a Figma. Již na konci loňského roku Adobe integroval nástroje Express do Slacku, avšak s výrazně omezenějším rozsahem funkcí.

Počet „více než 70 nástrojů“ odpovídá rozsahu, který Adobe již dříve uvedl pro svůj ChatGPT-plugin, a implementace se zdá být na obou platformách téměř identická. Analytik společnosti Forrester Joe Cicman hodnotí tento krok tak, že Adobe otevírá své nástroje nové skupině uživatelů, aniž by musel vytvářet nové rozhraní nebo odrazovat stávající profesionální uživatele; v praxi to může marketérům umožnit rychleji testovat mnoho nápadů na kampaně. Samotný Adobe uvádí jako argument pro Firefly, že jeho generování obrázků neporušuje autorská práva. Salesforce minulý týden oznámil, že integruje vlastní funkce do modelu Claude od Anthropic, s otevřenou beta verzí ještě tento měsíc. → Engadget, TechTarget

Synthszr Take: Přínos spočívá v eliminaci přepínání: žádné přecházení do prohlížeče, žádné stahování, žádné opětovné nahrávání, žádné „pošli mi ještě jednou finální verzi“. Každý, kdo někdy koordinoval schvalovací procesy pro 200 produktových obrázků v jednom kanálu, ví, že práce nespočívá ve Photoshopu, ale v neustálém přeskakování mezi kanálem, složkou a nástrojem. Adobe si tento kontextový přechod přivlastňuje a umožňuje, aby se samotné vlákno stalo pracovním prostorem, včetně obsahu kanálů a pláten jako zdroje materiálu. Skutečnost, že pro začátek není nutný účet Adobe, činí věc z provozního hlediska ještě jasnější: stážista v marketingovém kanálu vytvoří variantu, aniž by kdokoli musel žádat o licenci. Snížení tření je nenápadné a v tiskových zprávách se o něm málokdy jásá, ale právě ono rozhoduje o tom, zda se integrace bude za čtyři týdny používat, nebo skončí jako další nevyužitý kreativní dashboard.

Vodoznak od Anthropic v Claude Fable 5.1 spolehlivě označuje prózu, ale kód jen částečně

Společnost Anthropic vydala model Claude Fable 5.1 a do generovaných textů vkládá statistický podpis, který však u programového kódu funguje jen omezeně. Metoda je založena na technologii SynthID-Text od Google DeepMind a nepřidává žádná metadata ani skryté znaky, ale mění náhodnost při výběru dalšího tokenu. U dostatečně dlouhé odpovědi tak vzniká vzor, který lze prokázat pomocí správného klíče; kopírování ho neodstraní, ale výrazné přepsání ano. V přirozeném jazyce to funguje dobře, protože pro stejné sdělení obvykle existuje více formulací. U kódu je situace jiná: jiný název proměnné, operátor nebo volání funkce může změnit chování programu, proto Anthropic označení vynechává tam, kde je pro správnost nutný určitý token. Signál se může objevit v méně pevně daných částech, jako jsou komentáře, a krátké odpovědi nemusí obsahovat dostatek podkladů pro spolehlivý důkaz. Společnost tento krok oznámila 14. srpna po podpisu Kodexu chování EU o transparentnosti obsahu generovaného AI, spolu s přibližně 190 dalšími signatáři; označování probíhá celosvětově a starší modely Claude mají následovat v nadcházejících měsících.

Technicky je Fable 5.1 nástupcem modelu Fable 5 se stejnými cenami za vstup a výstup, s kontextovým oknem o velikosti jednoho milionu tokenů a maximálně 128 000 výstupních tokenů. Čtení z mezipaměti (cache-reads) nyní stojí jen čtvrtinu, tedy 0,25 dolaru za milion tokenů. Anthropic odhaduje úspory pro typické pracovní zátěže na přibližně 25 procent, u silně agentních procesů až na 45 procent. V interním testu pro agentní vědeckou práci společnost uvádí 52,6 procenta oproti 24,7 procenta u Fable 5. Důvod této cenové akce je známý: měsíc po uvedení na trh připadalo podle Ramp AI Index na Fable pouze 6 procent tokenů Anthropic nakoupených firmami.

Pro stávající integrace existují tři změny, které narušují zpětnou kompatibilitu. Vynucené použití nástrojů (forced tool use) již není podporováno a při použití tool_choice s hodnotou „any“ nebo konkrétním nástrojem vrátí chybu 400, protože myšlení (thinking) je u těchto modelů trvale aktivní a vynucené volání by ho přeskočilo. Bloky myšlení (thinking blocks) jsou vázány na model, který je vytvořil, a úprava předchozích kol konverzace je činí neplatnými. Anthropic navíc omezuje, kdy mohou nové účty API přebírat obdržené bloky myšlení do změněné konverzace, a zdůvodňuje to tím, že tato praxe byla ve velkém měřítku využívána k destilaci jejich vlastních modelů. Dále přibývají mimo jiné řízení úsilí (effort) pro každou zprávu, systémové zprávy vázané na dané kolo konverzace a čitelné zprávy o pokroku mezi voláními nástrojů, vše ve stavu beta.

Ve své vlastní příručce pro psaní promptů Anthropic přiznává, že Fable 5.1 při nízké úrovni úsilí (effort) méně často než Fable 5 volá vyhledávací nebo retrieval nástroj a častěji odpovídá z paměti. Jako protiopatření společnost uvádí vyšší úroveň úsilí pro jednotlivá kola konverzace nebo speciální systémový prompt, který model instruuje, aby před odpovědí vyhledal neznámé nebo rychle se měnící názvy. Podle poskytovatele byly také méně citlivě nastaveny bezpečnostní klasifikátory: o 60 procent méně falešných poplachů u kybernetických témat, o 85 procent méně zásahů biologických mantinelů u neškodných dotazů. Fable 5.1 má být schopen nacházet bezpečnostní zranitelnosti, ale ne vyvíjet pro ně exploity. S Enterprise Frontier Safeguards společnost navíc oznamuje architekturu, ve které monitorovací data zůstávají v infrastruktuře kontrolované zákazníkem; má být spuštěna později v tomto roce. Mythos 5.1 nabízí stejné schopnosti, ale zůstává vyhrazen účastníkům programu Glasswing z oblasti kybernetické bezpečnosti a life sciences. → Claude, The New Stack, PCWorld, ITPro, TechRadar, startup, The Neuron

Synthszr Take: Důkaz o původu, který se projeví v komentářích, ale v logice funkce mlčí, má v repozitáři malou hodnotu. Statistický signál potřebuje svobodu volby mezi tokeny, a tu kód téměř nemá: tam, kde je název proměnné nebo operátor pevně daný, systém na označení vědomě rezignuje. Pro týmy to znamená, že negativní nález nic nedokazuje, u krátkých odpovědí už vůbec ne. Spolehlivý původ v kódu se i nadále zajišťuje prostřednictvím metadat commitů, protokolovaných promptů a podepsaných pipelines, tedy prostřednictvím toho, co si sami kontrolujete. Kodex transparentnosti EU je tímto označením uspokojen, ale otázka, kdo napsal těch 300 řádků v platebním modulu, zůstává otevřená.

Mentioned in this article

Vyhledávání je o pozicích, AI ne.

RAIDAR (may update)

Vyhledávání je o pozicích, AI ne.

Z pozice ve výsledcích nezjistíte, které publikum vidí jakou odpověď, kterým zdrojům modely věří ani která území ještě nikdo nezabral. RAIDAR to celé zmapuje – přes každý model, každý zákaznický segment a každý trh, až po zdroje, které odpovědi pohánějí. Žádné pořadí. Mapa, která vám ukáže, kam se vydat. Pro značky, které chtějí vědět.

Více o RAIDAR →

Subscribe free. Unsubscribe the second it sucks.

High-signal news across AI, business, UX, and tech. Every morning.