Nano Banana 2 je venku! Co nového umí?
Nano Banana 2 je čerstvě nová generace googlího modelu na generování a úpravy obrázků. Google ji popisuje jako spojení schopností Pro varianty s rychlostí první verze Nano Banany. To znamená rychlejší iterace při úpravách, lepší držení zadání a víc “světové/všeobecné znalosti“ (test na konci podčlánku), takže model umí věrněji vykreslit konkrétní věci a opřít se i o aktuální informace a obrázky z webového vyhledávání.
Co je nové oproti předchozím Nano Banana modelům rodiny je hlavně použitelnost pro věci, které dřív bolely. Typicky text v obrázcích. A zvlášť, pokud to byl text český… Cedule, popisky, infografiky nebo přáníčka konečně nevypadají jako kód z Enigmy kombinovaný z neznámými znaky (jasně, trochu přeháním, ale občas ta čeština prostě haprovala a ani v Nano Banana 2 není vždy bezchybná). K tomu přibyla lokalizace a překlad textu přímo v obrázku, takže místo přegenerování celé scény jen řekneš, co má být česky a hotovo. Plus by měla být zase o něco lepší konzistence postav napříč více snímky, což oceníš ve chvíli, kdy chceš sérii vizuálů a ne pokaždé jiného člověka s jiným obličejem.
A jak se k Nano Banana 2 dostaneš? Nano Banana 2 se postupně roluje do aplikace Gemini, do Google vyhledávání konkrétně do AI režimu a také do Google Lens. Je i ve Flow, kde funguje jako výchozí generátor obrázků. A pokud používáš nástroje typu Higgsfield, tak tam už tenhle model taky najdeš.
A pokud jsi vývojář, tak by tě mohlo zajímat, že Nano Banana 2 je dostupná přes Gemini API v Google AI Studio, pro nasazení ve firmách i přes Vertex AI.
Neodpustil jsem si můj oblíbený test generátorů obrázků - šachovnici :-) A stále to není ono, i když Google tvrdí, jak model má lepší všeobecné znalosti. Jako, šachovnice je v pořádku, ale figurek je v šachové partii nějak hodně (zaměř se třeba na jezdce na obou stranách). Tak snad se šachisté dočkají příště :-)
Nový návod pro předplatitele: Automatizace, která hlídá emaily a připravuje koncepty odpovědí
Možná to taky znáš - otevřeš ráno inbox a čeká tě hromada zpráv, na které musíš nějak reagovat. Přemýšlíš, co napsat, formuluješ, přepisuješ... a najednou je pryč hodina času, aniž bys stihl cokoliv jiného.
V novém návodu pro předplatitele 5 tipů od Petra “Automatizace, která hlídá emaily a připravuje koncepty odpovědí” ti ukážu, jak si nastavit automatizaci, která tvůj inbox sleduje za tebe a rovnou připravuje koncepty odpovědí. Ty pak jen zkontroluješ, případně doladíš a odešleš. Žádné programování, žádná složitá nastavení.
Tento podrobný návod najdeš v placené sekci 5 tipů od Petra, kde se společně noříme hlouběji do světa automatizací a digitální efektivity. Pokud tě nebaví ztrácet čas rutinními úkoly a chceš si vybudovat vlastní automatizace či AI nástroje na nejrůznější činnosti, budu se na tebe těšit mezi předplatiteli, kteří mají k tomuto i všem dalším prémiovým tipům plný přístup.
Perplexity Computer: agent, který místo odpovědí dodává hotovou práci
Perplexity Computer je novinky z dílny mocného, ale možná ne tak populárního Perplexity. Je to vlastně agent, který umí poskládat celý workflow a opravdu ho odmakat. Ty mu popíšeš výsledek a on si ho rozloží na úkoly, vytvoří podagenty, hledá informace, píše, kóduje a doručí výstup. Perplexity to staví jako systém, který může běžet hodiny, a v některých scénářích i dlouhodobě, třeba s naplánovanými úlohami.
Důležitý detail je “jak“: každý úkol běží v izolovaném cloudovém prostředí se skutečným prohlížečem a souborovým systémem a může používat konektory do nástrojů, které už máš ve firmě. V nápovědě Perplexity rovnou říká, že tím pádem dokáže tahat kontext z webu i z tvých systémů a z toho skládat dokumenty, aplikace, maily nebo třeba pravidelné briefy.
Dostupnost je zatím prémiová: Computer je dostupný předplatitelům Perplexity Max (ano, to je ten tarif od 167 USD/měsíc) a Perplexity zároveň píše, že Enterprise Max má přijít „brzy“. Aktuálně je to jen na webu na desktopu. Počítej také s kreditovým režimem: Max má 10 000 kreditů měsíčně a Perplexity zmiňuje i časově omezený bonus 20 000 kreditů pro Max.
A teď to srovnání s podobnými agenty od jiných modelů. Protože jsem si jistý, že ti to trochu vrtá hlavou, proč bys měl(a) zkoušet Perplexity Computer, když máš k dispozici například agentský mód v ChatGPT.
Ano, OpenAI má podobnou kategorii v podobě ChatGPT agent režimu, který navazuje na Operator a je integrovaný přímo do ChatGPT jako „agent mode“, plus je dostupný napříč placenými plány. Další konkurent Anthropic má zase „computer use“ jako nástroj pro vývojáře v API, kde Claude umí pracovat se screenshoty a ovládáním kurzoru a klávesnice. Perplexity se od nich liší tím, že to prezentuje víc jako hotový produktový systém nad více modely a konektory, tedy jako něco, co máš otevřít a rovnou zadat práci, ne primárně stavět si kolem toho vlastní integraci.
Což zní fajn, ale pro většinu lidí asi bude hlavní překážkou cena…
OpenAI si skládá tým na vlastní AI zařízení a první má být…
OpenAI staví dohromady víc než dvousetčlenný tým, který pracuje na rodině spotřebních zařízení. První na řadě má být chytrý reproduktor s kamerou, cenově někde mezi 200 až 300 dolary, a na trhu se prý neobjeví dřív než v únoru 2027.
Nemělo by jít o další krabičku na hlasové povely. Vestavěná kamera má zařízení pomoci k tomu, aby “chápalo” uživatele a okolí. Mluví se i o rozpoznávání obličeje a o tom, že by to mohlo sloužit třeba k potvrzování nákupů. V interních prototypech se údajně objevují i chytré brýle a chytrá lampa, ale ty mají být později a masová výroba se zmiňuje až kolem roku 2028.
Pokud se OpenAI podaří udělat zařízení, které si samo řekne o kontext a pomůže ve správný moment, může z ChatGPT vzniknout něco víc než aplikace v mobilu. A ono to tam logicky směřuje.
Zároveň to přináší staré známé téma v novém kabátě: soukromí. Kamera v obýváku je něco, co mnoha lidem úplně nevoní a může se to stát věcí, kterou budou přelepovat izolepou. A nebo si kvůli tomu toto zařízení nekoupí.
Jak bys to měl(a) ty?
FDM 1: agent, který se učí koukáním na video a kliká jako člověk
Standard Intelligence je výzkumná firma zaměřená na foundation modely pro ovládání počítače a obecně na agentní systémy. A nyní vyšli ven s novinkou - modelem FDM 1.
Ten popisují svůj nový model FDM 1 jako základní stavebnici pro „computer use“, tedy AI, která umí přímo ovládat počítač. Klíč je v tom, že model netrénují na jednotlivých snímcích obrazovky, ale přímo na videu ve 30 snímcích za vteřinu a ve velmi dlouhém kontextu. Tvrdí, že jejich video encoder dokáže vměstnat skoro dvě hodiny takového videa do milionu tokenů, což má agentům konečně dát paměť na workflow, které trvá desítky minut, ne pár vteřin.
Zajímavá je nejen funkčnost toho modelu, ale i to, jak se přesně trénuje - přes škálování dat. Postup je tříkrokový: nejdřív natrénují “inverse dynamics“ model na 40 000 hodinách ručně anotovaných záznamů obrazovky, pak tímto modelem naštítkují 11 milionů hodin videí, a nakonec učí FDM 1 předpovídat další akci, tedy stisky kláves a pohyby myši. To je novinkou proti dnešní praxi, kdy jsou datasety pro akce na počítači směšně malé a agenti často neumí dlouhé úkoly.
A jak to použít v praxi? V demu zvládá model vícekrokové CAD úlohy v Blenderu a autoři mluví o ambici stát se “kolega“ pro CAD, finance a engineering.
Jakmile máš model, který udrží kontext a umí plynule myší, tak se z automatizace jednotlivých kliků stává automatizace celých postupů. Tedy méně maker a více delegování práce typu “udělej to stejně jako já včera, jen na těchto datech“.
A teď ta střízlivější část :-) Autoři se chlubí, že FDM 1 je “unikátně dobrý“ na fuzzing GUI, v ukázce našel chybu v bankovní aplikaci tak, že prozkoumával stavový prostor a došel až k zápornému zůstatku. To je skvělé pro QA a bezpečnostní testy, ale zároveň je to hezká připomínka dvojího použití: agent, který umí hledat divné stavy v aplikacích, může pomáhat bránit i útočit.
Takže, i když se stále rychleji posouváme z datově omezeného světa do světa omezeného výpočtem, tak je před “aligned“ obecnými učícími se systémy je ještě hodně práce. Přeloženo do češtiny: firmám to časem přinese obří produktivitu, ale bude potřeba hodně přísných mantinelů, logování a oprávnění, aby ten nový “kolega“ neudělal i něco, co jsi mu neřekl.
Gucci narazil s AI kampaní
Diskuze o neoblíbenosti AI slopu (laciný, generický, AI generovaný balast) v online prostředí nabírají čím dál víc na intenzitě a tentokrát to odnesla ikonická módní značka.
Gucci před milánskou přehlídkou Primavera nasadil na sociálních sítích teaser vizuály vytvořené pomocí generativní AI. Byly viditelně označené jako “Created with AI“ a míchaly syntetické obrázky s klasickými fotkami. V sadě se objevily noční městské scény, žena v kožichu v restauraci nebo auto a postavy, které část publika přirovnala k videoherní estetice. Cíl akce byl jasný, udělat rozruch před první přehlídkou Demny Gvasalii pro Gucci na Milan Fashion Week.
Jenže se rozjel i druhý typ rozruchu. V komentářích se objevilo “AI slop“, “levné“ a “tacky“, padaly výzvy k bojkotu a virálně se šířila poznámka ve stylu, že “Gucci už ani nenajde skutečnou milánskou babičku“.
Jak asi tušíš, u luxusního zboží je tohle citlivé téma. Zákazník neplatí jen za produkt, ale za příběh lidské práce, rukopisu, kulturního kontextu a (hlavně) pocit luxusní značky. Když vizuál působí jako brutální zkratka, mozek si to přeloží jako šetření na nesprávném místě.
Co si z toho vzít, i když neprodáváš kabelky za desítky tisíc? Pokud tvoje značka stojí na craftu, expertíze, péči a lidském přístupu, AI používej spíš jako backstage nástroj: na nápady, storyboardy, varianty, testování konceptů. Finální výstup by měl držet laťku tvého světa a ideálně ukázat, kde je člověk nenahraditelný.
Děkuji ti za přečtení 5 tipů od Petra!
Pokud se ti novinky ze světa AI líbily, prosím, doporuč 5 tipů od Petra svým kamarádům přes toto tlačítko:




