Google DeepMind udostępniło dwa nowe modele audio: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Rozwiązania te są dostępne dla programistów za pośrednictwem Gemini API i Google AI Studio od 15 września 2026 roku.
Szczegóły premiery modeli
Google DeepMind udostępniło dwa warianty modelu audio przeznaczone dla programistów. Gemini 3.8 Live umożliwia agentom głosowym wykonywanie zapytań do API w tle, przetwarzanie obrazu oraz jednoczesne prowadzenie rozmowy. Model obsługuje ponad 97 języków. Wersja Extended Thinking dodatkowo poprawia wyniki w zadaniach wymagających złożonego wnioskowania. Przykładowe aplikacje zostały opublikowane w serwisie GitHub.
Nowa wersja jest dostępna bezpośrednio w Gemini API oraz Google AI Studio. Deweloperzy mogą testować funkcje w czasie rzeczywistym bez konieczności dodatkowej konfiguracji. Informacje o parametrach technicznych ograniczają się do danych zawartych w oficjalnym komunikacie.
Porównanie cen z OpenAI
Google stosuje stawkę 0,005 USD za minutę audio wejściowego i 0,018 USD za minutę wyjściowego. Godzina rozmowy kosztuje około 1,38 USD. OpenAI GPT-Live-1 wyceniono na 0,05 USD za minutę, co przekłada się na minimum 3 USD za godzinę. Różnica cenowa wynosi 55% na korzyść Google.
Niższe koszty mogą przyspieszyć wdrożenia w aplikacjach komercyjnych o wysokiej intensywności użytkowania. Analitycy wskazują, że różnica ta jest szczególnie istotna dla firm obsługujących dużą liczbę równoległych sesji głosowych. Jednocześnie OpenAI utrzymuje wyższą cenę za funkcję pełnego dupleksu.
Wyniki w rankingach wydajności
Wersja Extended Thinking zajęła pierwsze miejsce w zestawieniu Artificial Analysis Speech-to-Speech Leaderboard z wynikiem 82,6%. Wyprzedza tym samym najnowsze modele GPT-Live-1 od OpenAI. Ranking uwzględnia zarówno jakość, jak i koszt przetwarzania. Wynik 82,6% jest obecnie najwyższym w kategorii rozwiązań agentowych.
Dane z zestawienia pokazują, że Google optymalizuje przede wszystkim stosunek ceny do wydajności. OpenAI nadal dominuje w metrykach naturalności dialogu i pełnego dupleksu, co potwierdzają niezależne testy. Różnice w jakości dźwięku są zauważalne w materiałach demonstracyjnych.
Możliwości techniczne i ograniczenia
Modele pozwalają na równoczesne przetwarzanie obrazu i dźwięku oraz wykonywanie wywołań API bez przerywania rozmowy. Funkcja Extended Thinking zwiększa zdolność do rozwiązywania złożonych zadań logicznych. Obsługa 97 języków obejmuje wiele wariantów regionalnych. Ograniczeniem pozostaje brak pełnego dupleksu, co wpływa na płynność interakcji.
W materiałach wideo Google prezentuje integrację z zewnętrznymi systemami, jednak jakość syntezy mowy jest oceniana niżej niż w przypadku rozwiązań OpenAI. Programiści muszą samodzielnie weryfikować opóźnienia i stabilność połączenia w warunkach produkcyjnych.
Kontekst rynkowy i konkurencja
Premiera wpisuje się w serię działań Google mających na celu zmniejszenie dystansu do OpenAI w segmencie modeli konwersacyjnych. Anthropic również obniżyło ceny swojego najnowszego modelu, co wskazuje na szerszy trend rynkowy. Sektor modeli audio staje się coraz bardziej konkurencyjny pod względem kosztów.
OpenAI nadal utrzymuje pozycję lidera w zakresie postrzeganej naturalności rozmowy. Analitycy podkreślają, że wybór dostawcy będzie zależał od priorytetów biznesowych: optymalizacji kosztów lub najwyższej jakości głosu. Kolejne aktualizacje obu firm mogą zmienić obecną równowagę sił w nadchodzących miesiącach.
Znaczenie dla rynku i dalszy rozwój
Niższe ceny oferowane przez Google mogą skłonić więcej firm do wdrażania agentów głosowych w środowiskach produkcyjnych. OpenAI pracuje równolegle nad nowymi wariantami, co zapowiada dalszą rywalizację cenową. Branża zyskuje więcej opcji, choć wciąż brakuje niezależnych, długoterminowych testów w rzeczywistych scenariuszach biznesowych.
Kwestią otwartą pozostaje, czy niższa cena przełoży się na szerszą adopcję w sektorach regulowanych. Ryzyka związane z prywatnością danych i zgodnością z przepisami (compliance) pozostają zbliżone dla wszystkich dostawców modeli audio. Nadchodzące kwartały pokażą, który model zyska dominującą pozycję w segmencie agentów głosowych.
| Model | Cena wejście/min | Cena wyjście/min | Godzina rozmowy | Wynik leaderboard |
|---|---|---|---|---|
| Gemini 3.8 Live | 0,005 USD | 0,018 USD | 1,38 USD | 82,6% |
| GPT-Live-1 | 0,05 USD | 0,05 USD | 3,00 USD | niższy |
Źródła:
The Decoder, Artificial Analysis, Google AI Studio, GitHub Google Gemini, OpenAI announcements