5 tipů od Petra, vydání #238
Dnešní menu: Chat GPT 5.6. je venku, A nový GPT Live také. Alibaba zakázala Claude Code. Který LLM model posílá nejvíc návštěvnosti na weby? Runable - další agent, co umí "vše v jednom"?
Krásný pátek,
dneska se v úvodníku pozastavím nad tématem, které možná není tak do očí bijící, dokud se na to člověk nezačne soustředit.
Možná to znáš. To je 20 USD měsíčně tam, 20 USD támhle, někde jen 6 USD… Ano, mluvím o předplatných za AI služby.
Jeden tomu nevěnuje moc pozornost. Přeci jen těch 20 USD zas není úplně brutální částka.
Ale, když pak dojde tomu, že by si ty měsíční drobné sečetl, tak se nestačí divit. A začne reduktovat předplatné a odhlašovat se :-)
Asi tušíš, kam bude mířit moje anketní otázka…
GPT‑5.6 je venku
OpenAI včera vypustila GPT‑5.6, a jak jsem psal před týdnem, tentokrát to není jeden model, ale rodina tří: Sol (vlajková loď), Terra (střední váha) a Luna (levná a rychlá). Číslo generace zůstává společné, ale jednotlivé úrovně prý budou dál žít vlastním životem. Takže příště možná dostaneme jen novou Lunu, aniž by se měnilo cokoliv jiného.
Modely nejsou jen “chytřejší”, ale i dělají víc práce za míň tokenů a za míň peněz. Sol prý zvládá kódovací úlohy za zlomek ceny a času oproti konkurenci, u složitějších úloh navíc přibyl režim ultra, který si na pozadí pustí několik agentů najednou a pracuje paralelně.
V praxi to znamená, že pokud používáš GPT na cokoliv agentního (automatizace, delší úlohy, generování prezentací a dokumentů) měl bys časem vidět rychlejší odpovědi za nižší cenu, aniž bys musel cokoliv nastavovat. Model si navíc umí sám kontrolovat vlastní výstup (weby, hry, prezentace) a doladit vizuální chyby, což je fajn hlavně pro lidi, co dělají rychlé prototypy.
Na druhou stranu - všechny ty benchmarky (Agents’ Last Exam, BrowseComp, SWE-Bench) jsou skvělé na porovnávání mezi sebou, ale málo řeknou o tom, jak se model bude chovat na tvém konkrétním use-case. A jak to někdy bývá, výkon “na papíře” a výkon/kvalita “v tvém Make scénáři” bývají dvě různé věci. Takže co budeme o víkendu dělat? Ano, testovat :-)
GPT-Live: konečně hlas, který tě nepřerušuje uprostřed věty (a naopak)
Druhá novinka od OpenAI ten samý týden je GPT‑Live, nová generace hlasových modelů, která teď pohání ChatGPT Voice. Zásadní rozdíl oproti dosavadnímu hlasovému režimu: model poslouchá a mluví zároveň, ne postupně po jednotlivých replikách.
Dosavadní hlasové AI fungovaly na principu “počkej, až domluvím, pak odpověz”. Proto to vždycky trochu znělo jako vysílačka. Nešlo udělat pauzu na rozmyšlenou, kdy se tichá odmlka občas vyhodnotila jako konec věty, takže model skočil do řeči úplně mimo kontext. Čímž mě teda neskutečně štval. GPT‑Live tohle řeší tím, že rozhoduje o tom, jestli mluvit, poslouchat nebo počkat, mnohokrát za sekundu.
Druhá věc, která mě zaujala: GPT‑Live umí za běhu delegovat těžší dotazy (vyhledávání, uvažování) na jiný model na pozadí a mezitím s tebou dál plynule mluví. Tenhle princip ve stylu rychlá “sociální” vrstva plus pomalejší “mozek” na pozadí mi přijde jako fakt chytré řešení problému, který má skoro každý hlasový asistent: buď je rychlý a hloupý, nebo chytrý a pomalý.
Pokud používáš hlasový režim ChatGPT na cokoliv víc než “kolik bude venku”, tohle je citelný skok dopředu. Třeba pro učení jazyků by to mohlo být příjemnější, protože konverzace konečně nebude působit jako výslech přes vysílačku.
Zatím to není v API, takže do vlastních aplikací to hned nezapojíš, existuje jen registrace na čekací listinu. A jazyková kvalita je zatím optimalizovaná primárně na nejpoužívanější jazyky, takže u češtiny bych čekal drobné mezery.
Alibaba zakázala Claude Code a důvod stojí za přečtení
Tohle je nejšťavnatější story týdne a týká se přímo nástroje, který spousta z nás denně používá. Alibaba zakázala svým zaměstnancům Claude Code poté, co bezpečnostní výzkumníci našli v kódu skrytý mechanismus, který identifikoval uživatele podle časového pásma (Asia/Shanghai, Asia/Urumqi) a porovnával jejich proxy adresy s čínskými doménami.
Nešlo o obyčejné logování. Signál se schovával steganograficky přímo do systémového promptu. Třeba se měnil formát data z pomlček na lomítka, nebo se apostrof ve větě “Today’s date is” nahradil vizuálně identickým, ale technicky odlišným unicode znakem. Pro člověka neviditelné, pro servery Anthropicu čitelné.
Anthropic se hájí tím, že šlo o experiment z března, který měl bránit zneužívání účtů a takzvané distilaci (tj. tréninku levnějších modelů na výstupech Claude). To souvisí i s širším sporem - Anthropic v dopise americkému Senátu obvinil provozovatele napojené na čínský Qwen z toho, že přes 25 tisíc podvodných účtů vytáhli z Claude 28,8 milionu konverzací.
Jestli používáš Claude Code (a spousta z nás ho používá denně), tak technicky se tě to asi bezprostředně nedotkne, kód byl už 1. července odstraněn. Ale je to dobrá připomínka, že i nástroje, kterým důvěřujeme s přístupem k souborovému systému, mají neprůhlednou vrstvu telemetrie, o které se dozvíme až od uživatele Redditu, který si to reverzoval…
Můj pohled je, že ať už měl Anthropic dobrý úmysl nebo ne, skrytá identifikace uživatelů podle časového pásma je přesně to, co fakt nepřidává důvěru ve službu, kterou denně používáme...
Kdo ti vlastně posílá návštěvníky z AI: 92 % je ChatGPT, ale Claude tiše roste
Search Engine Land zveřejnil docela zajímavá data z 6,77 milionu relací napříč 166 weby: ChatGPT ovládá 92,4 % veškeré návštěvnosti, které na weby přivádí AI nástroje. Loni v prosinci to bylo 84 %, takže se trh spíš konsoliduje kolem jednoho hráče, než že by si to platformy dělily rovným dílem.
Zajímavější je, že Claude vyrostl 64násobně (ze 133 relací v listopadu 2024 na 8 528 letos v květnu) a v březnu poprvé předběhl Perplexity. Od té doby si tu pozici drží. Naopak Copilot propadl o 96 % ze svého vrcholu a Perplexity ztratila přes 60 %.
Praktické zjištění, které by mělo zajímat každého, kdo dělá SEO nebo obsah pro klienty: skoro čtvrtina návštěv z AI nástrojů končí na interní vyhledávací stránce webu, ne na konkrétním článku nebo produktu. Model si tedy vybere tvou doménu jako důvěryhodnou, ale neumí vybrat správnou podstránku, takže hodí uživatele do vyhledávání a nechá ho, ať si to najde sám. U e-shopů to číslo vylétne až na 34,6 %.
Takže, pokud máš vlastní web nebo pro klienty řešíš SEO či obsahovou strategii, tohle je konkrétní úkol navíc: zkontrolovat, jestli interní vyhledávání na webu vůbec funguje pořádně, protože teď je to skutečný akviziční kanál, ne jen doplněk navigace.
Malý háček je v tom, že vzorek 166 webů není zrovna reprezentativní vzorek celého internetu, takže bych čísla bral jako trend, ne jako přesnou statistiku. Ale i tak se hodí vědět.
Runable: další “jeden prompt a mám hotovo” agent, tentokrát s čísly na benchmarcích
Runable je AI agent, který slibuje, že mu zadáš úkol v běžné řeči a on ho sám naplánuje, provede a doručí hotový výsledek – weby, prezentace, reporty, videa. Runable se přitom chlubí konkrétními čísly: 92,1 % na benchmarku GAIA (obecné AI asistenty), což je víc než konkurenční služby Genspark i Manus.
Co mě ale zaujalo a bude stát za bližší prozkoumání, pokud s podobnými nástroji pracuješ je to, že recenze, které jsem dohledal, jsou vesměs opatrné. Jedna nezávislejší recenze popisuje Runable jako nástroj, který “zvládne prvních 30 % práce dobře” a zbytek stejně doděláš ve specializovaném nástroji. Někdo taky upozornil na chybějící evropskou compliance dokumentaci (DPA, SOC 2, ISO 27001), což by mělo zajímat každého, kdo by tam nahrával data klientů.
Pro rychlý první draft webu, prezentace nebo reportu je to asi Runable fajn. Podobně jako spousta “all-in-one” agentů posledního roku. Pro produkční nasazení s citlivými daty bych zatím počkal.
To je pro tento týden všechno. Pokud sis z toho měl/a vzít jen jednu věc, tak tuhle: zkontroluj si interní vyhledávání na webu, dřív než ho za tebe zkontroluje AI model, který tam pošle klienta. Za týden zase naviděnou!
A uděláš mi radost, pokud 5 tipů od Petra doporučíš přátelům:

