transformio
← AI novinky

9 AI noviniek uplynulých dní: Opus 5.5, GPT-6 Sol a Luna, Gemini 3.8 Live a ďalšie

Druhá polovica septembra priniesla viacero veľkých AI noviniek. Anthropic predstavil Claude Opus 5.5, OpenAI rozšírilo rodinu GPT-6 o modely Sol a Luna, xAI uviedlo Grok 4.7 a Google nové Gemini 3.8 Live modely.

AI novinky transformio

Pozreli sme sa aj na nové multimodálne a hlasové modely od Alibaby a DeepSeeku a na Sponsored Agents, ktoré OpenAI začína testovať priamo v reklamách v ChatGPT.

1. Claude Opus 5.5

Anthropic predstavil Claude Opus 5.5 22. septembra 2026. Firma uvádza, že na väčšine úloh dosahuje výkon na úrovni Claude Fable 5.1, pričom jeho prevádzka je o 40 % lacnejšia než pri Opus 5.

Anthropic ho označuje za nový leading model a uvádza výrazné zlepšenie najmä pri komplexnom codingu a dlhých pracovných úlohách. Jeden z early testerov podľa firmy dokončil migráciu codebase s 680 000 riadkami za menej než deň. To je však firemný príklad, nie nezávislý benchmark.

Zaujímavá je aj bezpečnostná stránka. Opus 5.5 prešiel externým testovaním vrátane METR a Frontier Design a podľa Anthropicu dosiahol najlepší výsledok spomedzi ich modelov v internom automated behavioral audit.

2. GPT-6 Sol a GPT-6 Luna

OpenAI 22. septembra vydalo aj GPT-6 Sol a GPT-6 Luna. Oba modely nadväzujú na GPT-6 Astra, ale sú navrhnuté ako lacnejšie a efektívnejšie modely pre každodennejšie nasadenie.

GPT-6 Sol je určený najmä na komplexný coding a agentické workflowy. Má kontextové okno 1,05 milióna tokenov a podporuje web search, file search, function calling aj computer use. Cena je 2 doláre za milión vstupných tokenov a 10 dolárov za milión výstupných tokenov.

GPT-6 Luna je výrazne lacnejší model pre vysoký objem kratších a presnejšie definovaných úloh. Má rovnaké kontextové okno 1,05 milióna tokenov, ale cena je iba 10 centov za milión vstupných tokenov a 50 centov za milión výstupných tokenov.

OpenAI uvádza, že Sol aj Luna sú približne o 50 % lacnejšie než ich GPT-5.6 ekvivalenty pri pôvodnom promo cenníku. Dostupné sú cez API, v ChatGPT Work a Codex pre platené plány. GPT-6 Luna si môžu v desktopovej aplikácii vyskúšať aj používatelia Free a Go. 

3. Grok 4.7 sa zameriava na coding a dlhšie pracovné úlohy

SpaceXAI predstavilo 21. septembra Grok 4.7, nový model určený najmä na programovanie a knowledge work.

Oproti Grok 4.6 používa väčší základný model a prešiel dlhším reinforcement learning tréningom na náročnejších úlohách, ktoré môžu trvať niekoľko hodín. Má lepšie kontrolovať vlastnú prácu, zvládať dlhší kontext a spoľahlivejšie pokračovať v rozsiahlejších coding zadaniach.

SpaceXAI uvádza zlepšenie napríklad v CursorBench 4.0, kde Grok 4.7 dosiahol 46,3 % oproti 40,4 % pri Grok 4.6. V DeepSWE v1.1 dosiahol pri high effort nastavení 71 %. Tieto čísla pochádzajú z benchmarkov publikovaných samotnou firmou, preto ich treba vnímať najmä ako orientačné porovnanie.

Cena zostáva rovnaká ako pri predchádzajúcej verzii:

  • 2 doláre za milión vstupných tokenov
  • 6 dolárov za milión výstupných tokenov

Model je dostupný v Cursor, Grok Build, cez Grok API a ďalšie coding platformy a model routery.

Pre freelancerov, vývojárov a menšie tímy môže byť zaujímavý najmä pomer ceny a výkonu. Fable 5.1 je pri bežnom API používaní výrazne drahší, hoci pri najnáročnejších úlohách môže stále dosahovať lepšie výsledky.

4. Gemini 3.8 Live prináša reasoning do hlasových agentov

Google predstavil Gemini 3.8 Live a Gemini 3.8 Live Extended Thinking, nové modely pre hlasové aplikácie a voice agentov.

Gemini 3.8 Live je optimalizovaný na rýchle, prirodzené konverzácie a vysoký počet požiadaviek. Extended Thinking je určený na zložitejšie úlohy, pri ktorých musí model počas rozhovoru plánovať viac krokov a používať nástroje.

Model dokáže:

  • pracovať s hlasom a obrazom takmer v reálnom čase
  • automaticky prepínať medzi 97 jazykmi
  • vykonávať API a tool calls na pozadí bez prerušenia rozhovoru
  • pokračovať v konverzácii počas vykonávania dlhšej úlohy
  • využívať visual grounding pri práci s obrazom alebo kamerou

Google ukazuje napríklad hlasové zadanie, pri ktorom model priebežne vytvorí React komponent podľa náčrtu a spätnej väzby používateľa, alebo viacstupňovú rezerváciu vykonávanú počas prirodzeného rozhovoru.

Oba modely sú dostupné cez Gemini API a Google AI Studio. Pre firmy sú zatiaľ v Gemini Enterprise v private preview. Extended Thinking sa objavuje aj v Gemini Live a vo vybraných funkciách Gmailu, Docs a Keep.

5. Qwen3.8-Omni-Flash pracuje naraz s textom, obrazom, zvukom aj videom

Alibaba predstavila Qwen3.8-Omni-Flash, nový omnimodálny model z rodiny Qwen.

Ako vstup dokáže spracovať text, obrázky, audio aj video. Má kontextové okno s veľkosťou jeden milión tokenov a podporuje reasoning, function calling, web search aj context caching.

Alibaba ho zameriava najmä na dlhšie audio-vizuálne úlohy a agentické workflowy. Model môže napríklad analyzovať niekoľkohodinové video, vyhľadať relevantné segmenty, pracovať s nimi pomocou nástrojov a následne pripraviť výsledok.

V teste OmniVideoBench podľa Alibaby agentický spôsob analýzy znížil spotrebu tokenov približne o 46 % a zároveň zvýšil presnosť oproti spracovaniu celého videa bez selekcie relevantných častí.

Qwen3.8-Omni-Flash je dostupný cez Alibaba Cloud Model Studio aj v regióne Frankfurt. To je podstatné pre európske projekty, pri ktorých môže byť región spracovania dát súčasťou technických alebo bezpečnostných požiadaviek.

6. DeepSeek V4.1 Flash je rýchlejší, multimodálny a výrazne lacnejší

DeepSeek vydal DeepSeek-V4.1-Flash, prvý menší model novej architektúry V4.1.

Ide o Mixture of Experts model s celkovo 552 miliardami parametrov. Pri spracovaní vstupu aktivuje približne 8 miliárd parametrov a pri výstupe 16 miliárd. Nová architektúra má znižovať pamäťové nároky a zrýchľovať inference pri dlhom kontexte.

Model podporuje:

  • text aj obraz
  • thinking a non-thinking režim
  • tool calling
  • Responses API
  • Anthropic API formát
  • kontextové okno jeden milión tokenov
  • maximálny výstup až 384-tisíc tokenov

DeepSeek uvádza, že V4.1 Flash v niektorých benchmarkoch prekonáva starší V4 Pro, pričom jeho prevádzka je podstatne lacnejšia.

Pri štandardnej špičkovej sadzbe stojí milión vstupných tokenov pri cache miss 30 centov a milión výstupných tokenov 1,20 dolára. Mimo špičky sú ceny polovičné.

DeepSeek zverejnil model aj cez Hugging Face a V4.1 Flash je dostupný cez DeepSeek API pod označením deepseek-flash.

Pre vývojárov a menšie tímy je zaujímavý najmä kombináciou veľmi nízkej ceny, dlhého kontextu a multimodality. Pri firemnom nasadení však stále treba samostatne posúdiť bezpečnosť, spracovanie dát a požiadavky konkrétnej organizácie.

7. Grok Voice Transcribe 2.0 cieli na reálne telefonáty a hlučné prostredie

SpaceXAI predstavilo aj Grok Voice Transcribe 2.0, nový speech-to-text model.

Firma ho netrénovala iba na čistom štúdiovom audiu, ale aj na telefonátoch, rozhovoroch s viacerými hovoriacimi, rôznych prízvukoch a krátkych hlasových poveloch. Model automaticky rozpoznáva jazyk a zvláda aj jeho zmenu počas jednej nahrávky.

Podporuje:

  • batch aj streaming transcription
  • časové značky na úrovni jednotlivých slov
  • automatické rozlíšenie hovoriacich
  • až osem samostatných audio kanálov
  • zvýhodnenie vybraných odborných výrazov
  • automatické formátovanie čísel, dátumov či e-mailových adries
  • detekciu konca repliky pre voice agentov

Na verejnom rebríčku Artificial Analysis sa podľa SpaceXAI umiestnil na prvom mieste v presnosti medzi 32 streaming transcription modelmi.

Cena zostáva nízka: 10 centov za hodinu pri batch prepise a 20 centov za hodinu pri streamingu. Diarizácia, timestamps aj key term biasing sú zahrnuté v cene.

8. Alibaba má nový real-time voice model Qwen Audio 3.1

Alibaba vydala aj Qwen Audio 3.1 Realtime Plus, model pre obojsmernú hlasovú komunikáciu v reálnom čase.

Podporuje textový aj audio vstup a výstup, function calling, web search a voice cloning. Kontextové okno má veľkosť 262 144 tokenov.

Alibaba pridala osem nových systémových hlasov a zachovala rovnaký integračný protokol ako pri predchádzajúcej verzii 3.0 Plus.

V singapurskom regióne stojí milión audio vstupných tokenov 6,40 dolára a milión audio výstupných tokenov 24 dolárov. Textový vstup stojí 80 centov za milión tokenov.

Model je relevantný najmä pre call centrá, hlasových asistentov a aplikácie, ktoré potrebujú kombinovať prirodzený rozhovor s vyhľadávaním alebo volaním externých nástrojov.

9. OpenAI testuje Sponsored Agents priamo v reklamách v ChatGPT

OpenAI rozširuje reklamné možnosti v ChatGPT a začalo testovať Sponsored Agents.

Po kliknutí na reklamu môže používateľ otvoriť samostatnú, jasne označenú konverzáciu s agentom konkrétnej firmy. Namiesto prechodu priamo na web sa tak môže najskôr pýtať na produkt, dostupnosť, vlastnosti alebo vhodnosť pre konkrétnu situáciu.

OpenAI zároveň pridáva tvorbu a správu reklám pomocou prirodzeného jazyka a integrácie s HubSpotom a Shopify. Firmy môžu cez ChatGPT vytvárať kampane, analyzovať ich výkon alebo generovať texty a vizuály pre reklamy.

ChatGPT Ads sú na Slovensku dostupné od druhej polovice augusta 2026 a od 31. augusta môžu slovenskí inzerenti využívať aj samoobslužný Ads Manager.

Sponsored Agents však zatiaľ OpenAI testuje iba s vybranými inzerentmi a nejde o formát, ktorý by si mohla bežne spustiť každá firma cez Ads Manager.

Pre marketing je zaujímavé najmä to, že reklama nemusí končiť kliknutím na landing page. Potenciálny zákazník môže pokračovať v konverzácii s agentom značky a až následne prejsť na web alebo ďalší krok v nákupnom procese.

Chcete AI využívať vo svojej firme?

Od prvého školenia po vlastné riešenia – začnite krokom, ktorý sedí vašej situácii.