Hezké odpoledne,
to to uteklo… Prázdniny jsou fuč. Dětem začne škola a to mě přivádí na to, že bych se tě mohl zeptat, jak jsi na tom s učením se práce s AI.
ChatGPT Work se ti přihlásí do účtu a odbaví otravnou administrativu
OpenAI rozšířil agentní režim ChatGPT Work tak, že jeho prohlížeč na webu i mobilu zvládne úkoly i na stránkách, které vyžadují přihlášení. Do teď agent uměl hlavně hledat a shrnovat na veřejném webu - to všichni víme a používáme ho tak.
Teď, když stránka přihlášení dovolí, ti ChatGPT nabídne přihlašovací obrazovku, ty zadáš údaje (klidně přes správce hesel), případně bezpečnostní kód, a agent pokračuje v práci, i když od počítače odejdeš.
Je to další fajn usnadnění práce a rozdíl mezi “vyhledej mi termíny” a “objednej mě”. OpenAI udává jako příklady využití například zařídit energie pro nový byt a přihlásit správný tarif, objednat termín na úřadě nebo vyplnit formuláře, ověřit ceny výkonů přes portál pojišťovny, nebo najít profily lidí, co sedí na tvůj popis pozice.
Ty ale přitom stále rozhoduješ, ke kterým webům má agent přístup, a před nevratnými kroky (jako je např. dokončení rezervace nebo platby) si vždy vyžádá potvrzení.
Tahle funkce je zatím jen pro plány Plus a Pro.
Vzhledem k tomu, že session může zůstat přihlášená pro příští úkoly, je zde zároveň i riziko, protože pouštíš autonomního agenta do svých ostrých účtů. Takže je dobré to mít na paměti a z účtů, do kterých si taky agenta pustíš, se po dokončení úkolu odhlásit.
Určitě bych u toho první dva tři úkoly seděl a díval se, co agent klika, než mu začnu věřit naslepo. Delegace bez dohledu je u tvých účtů zatím stále ještě předčasná.
MiniMax H3 (Hailuo 3) - další generátor videí s nativním zvukem
MiniMax H3, známý taky jako Hailuo 3, je multimodální video model. Párkrát už jsem ho zmiňoval. Verze H3 umí text na video, obrázek na video i reference na video, generuje nativní stereo zvuk se synchronizací rtů, dělá klipy 4 až 15 sekund v 768p a 2K a zvládne až dvanáct referenčních souborů (obrázky, videa, zvuk) najednou.
Jak je u nejnovějších modelů dobrým zvykem, zvuk vzniká rovnou s obrazem - dialog, ruchy, hudba, časované efekty. To ušetří to věčné dolepování zvuku po renderu.
Takže máme další videogenerátor na víkendové hraní :-) A k dispozici je například na Higgsfieldu.
A výsledek? Třeba takovýto souboj superhrdinů:
GLM-5.3-Flash: skoro špičkový výkon za zlomek ceny
Čínská Z.ai (Zhipu) vydala model GLM-5.3-Flash. Je to MoE model s 320 miliardami parametrů a 18 miliardami aktivních, nativně multimodální, s milionovým kontextem a otevřenými váhami pod licencí MIT na Hugging Face. Předtím kroužil inkognito jako “Ox Alpha” na OpenRouteru a OpenCode.
Hlavní věc je ale cena. Protože tohle potěší kasičku každého, kdo s AI intenzivněji pracuje. API stojí 0,15 / 0,50 dolaru za milion tokenů a Z.ai tvrdí, že model překonává předchozí GLM-5.2 napříč evaluacemi zhruba za desetinu ceny. V kódování a agentních úlohách se prý blíží drahým špičkovým modelům - na DeepSWE dosáhl 63,4 proti 46,2 u GLM-5.2 a na Terminal-Bench 84,3, tedy blízko Opusu 4.8.
Pokud tedy stavíš automatizace nebo agenty, co spálí hodně tokenů, patří tenhle model na tvůj shortlist - hlavně tam, kde rozhoduje cena za token nebo možnost self-hostingu. Dostupný je přes API i v placeném GLM Coding Planu.
Hmmm, a kde je ten pověstný háček?
No, je dokonce hned trojitý. Většina výkonnových srovnání je od výrobce, takže než na tom postavíš produkci, chce to vlastní test na tvých datech.
Self-hosting reálně potřebuje kolem 306 GiB vah, takže drtivá většina lidí stejně půjde přes API.
A je to čínský model běžící na čínských čipech… Pokud řešíš, kde a jak se zpracovávají tvá data, myslí na tohle dřív, než ho pustíš na cokoli citlivého.
*** Automatizační scénář z promptu? Ano, Maia to zařídí! ***
Pokud pracuješ už nějakou dobu s automatizačními platformami jako je třeba Make, které ti umožňuji automatizovat nějaký postup nebo proces (zpracování přihlášek, sledování konkurence, zpracování obsahu atd.), tak čas od času zápasíš s tím, jak ten automatizační postup vlastně postavit.
Ano, existuje možnost zadat to ChatGPT nebo Claude, ať ti scénář pro Make přímo vygeneruje, ale pokud jsi to zkoušel(a), tak moc dobře víš, že to ani náhodou není bez chyb a pokud se v Make moc neorientuješ, tak to moc práci neušetří.
Ale Make má nyní pár dní novou funkci. Maia je takový AI pomocník, kterému zadáš textově co má tvoje automatizace dělat a ona ti ho za pár minut postaví.
Jak to přesně funguje a konkrétní ukázku stavby automatizace ukazuji v návodu pro předplatitele, který najdeš zde - Postav si automatizaci obyčejnou větou. Ukážu ti novou Maiu v Make.
Higgsfield Relight: přesvítíš hotovou fotku, jako bys stále stál ve studiu
Higgsfield vydal nástroj Relight, který umí dodatečně přesvítit už hotovou fotku. Nefunguje jako obyčejné “přidat jas”, ale přes hloubkovou mapu pochopí 3D geometrii scény a přemístí zdroj světla, u kterého nastavíš úhel, intenzitu i teplotu.
Máš k dispozici šest rychlých presetů (Top, Front, Right, Left, Back, Bottom) a k tomu interaktivní směrový pad, kde světlo taháš myší a vidíš změnu v reálném čase. Přepínáš mezi měkkým světlem (jako softbox) a tvrdým (ostré stíny, vysoký kontrast), doladíš jas a barvu světla přes hex kód.
V praxi to řeší tři obvyklé situace: zachránit portrét vyfocený proti světlu, dodat placaté produktovce hloubku, nebo naopak nasadit stylizaci (neonovou, noirovou…). Prostě záchrana tam, kde jsi si pořídil(a) světelně ne úplně dobré fotky nebo video.
Stále jde o generativní nástroj, takže když přepisuješ světlo, může se jemně změnit i to, co bys měnit nechtěl. U produktových fotke a věrných barev výsledek opravdu kontroluj, ne slepě odešli.
Z toho plyne asi i klasické použití: nejvíc tam, kde světlo rozhoduje o dojmu (reality, produkt, nálada), a naopak bych byl opatrný tam, kde jde o věrnost a přesnost. Není to náhrada za dobré focení, ale záchrana, když už dobré focení nemáš.
WebMCP: weby se učí mluvit s agenty čistě, ne přes klikání naslepo
Zajímají tě agenti? Podívej se na webmcp.com. Je to živý adresář webů, které agentům nabízejí strukturované nástroje místo toho, aby se přes ně asistent musel prokousávat jako přes obyčejnou stránku. Aktuálně je tam přes tři stovky webů.
WebMCP je přitom návrh nového standardu, který funguje tak, že web sám řekne “tady máš funkce, které umím” - třeba search_catalog, add_to_cart nebo book_appointment - a agent je zavolá napřímo a spolehlivě. Nástroje se v adresáři dělí do tří košů podle rizika: Answer (jen čtení, žádný následek), Action (řídí stránku, třeba košík nebo formulář) a Sensitive Action (peníze a závazky, tedy checkout, rezervace, předplatné).
V katalogu najdeš e-shopy jako Allbirds nebo Reebok, nástroje typu monday.com i pracovní portály jako ZipRecruiter.
A pokud jsi majitel webu a e-shopu, tak by se měl zamyslet nad otázkou, zda je tvůj web čitelný nejen pro Google, ale i pro asistenta, který za zákazníka nakupuje?
Jak jsem psal výše, jde o rané stádium a adopce je na začátku. Takže to zatím můžeš brát jako experiment pro early adopters, ale směr mi přijde dost jasný na to, aby ses o tom aspoň orientačně věděl.
Užij fajn poslední prázdninový víkend! A díky za případné sdílení 5 tipů od Petra dál:



