Głosowe interakcje z wideo w Google Gemini 2.0

Google pokazał dziś nowe możliwości swojego flagowego modelu konwersacyjnego Gemini 2.0. Najnowsza aktualizacja pozwala na prowadzenie głosowych interakcji z obrazem wideo lub zawartością ekranu komputera w czasie rzeczywistym. Oznacza to, że asystent Gemini potrafi „zobaczyć” i zrozumieć to, co jest mu pokazywane, a następnie prowadzić na ten temat naturalną rozmowę głosową z użytkownikiem.

Jest to ogromny przełom w dziedzinie asystentów konwersacyjnych, łączący przetwarzanie języka naturalnego z rozumieniem obrazu w czasie rzeczywistym. Gemini 2.0 przynosi nas o krok bliżej do wizji inteligentnych, wszechstronnych asystentów AI, potrafiących wchodzić w złożone interakcje ze światem na podstawie wielu modalności – wzroku, słuchu i mowy. Oczekuje się, że inne firmy, takie jak OpenAI czy Anthropic, niedługo zaprezentują podobne rozszerzenia swoich chatbotów.

Komentarze

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *

RubiMax Emil Kozłowski — remonty i wykończenia
NIP 8393206492, REGON 380579356
Adres do doręczeń: Lubuczewo 49, 76-200 • E-mail: emage@int.pl