Loading...
Google: గూగుల్‌ Gemini 3.8 Live విడుదల.. మాట్లాడుతూనే పనులు చేసే AI 
గూగుల్‌ Gemini 3.8 Live విడుదల.. మాట్లాడుతూనే పనులు చేసే AI

Google: గూగుల్‌ Gemini 3.8 Live విడుదల.. మాట్లాడుతూనే పనులు చేసే AI 

వ్రాసిన వారు Sirish Praharaju
Sep 16, 2026
09:50 am

ఈ వార్తాకథనం ఏంటి

వాయిస్‌ ఆధారిత కృత్రిమ మేధ (AI) ఏజెంట్లలో ఎదురవుతున్న ఆలస్యాన్ని తగ్గించేందుకు గూగుల్‌ తన తాజా స్పీచ్‌ మోడళ్లను విడుదల చేసింది. Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking పేరుతో తీసుకొచ్చిన ఈ మోడళ్లు.. దాదాపు రియల్‌టైమ్‌లో స్పందించడంతోపాటు, మాట్లాడుతూనే ఆలోచించగలవని గూగుల్‌ తెలిపింది. ఒకేసారి మాటలను ప్రాసెస్‌ చేస్తూ, వాటి వెనుక జరిగే ఆలోచనా ప్రక్రియను కూడా కొనసాగించే సామర్థ్యం వీటికి ఉందని పేర్కొంది. అంతేకాదు.. థర్డ్‌ పార్టీ సాఫ్ట్‌వేర్‌ టూల్స్‌ను బ్యాక్‌గ్రౌండ్‌లో ఉపయోగించగలవని వెల్లడించింది.

వివరాలు 

బెంచ్‌మార్క్‌ పరీక్షల్లో మెరుగైన ఫలితాలు

కొత్త మోడళ్లు పలు బెంచ్‌మార్క్‌ పరీక్షల్లో మంచి ఫలితాలు సాధించాయి.

Artificial Analysis Speech to Speech Quality Indexలో Gemini 3.8 Live Extended Thinking మోడల్‌ 82.6 స్కోర్‌ సాధించినట్లు గూగుల్‌ తెలిపింది.

ఈ ఫలితంతో GPT-Live-1-Astra, Grok Voice Think Fast 2.0 మోడళ్లను అధిగమించినట్లు పేర్కొంది.

మరోవైపు.. ప్రత్యామ్నాయమైన Speech Agent Arena బెంచ్‌మార్క్‌లో Gemini 3.8 Live రెండో స్థానంలో నిలిచింది.

అలాగే ServiceNow Inc. నిర్వహించిన EVA-Bench ర్యాంకింగ్స్‌లోనూ అగ్రస్థానాన్ని సాధించినట్లు కంపెనీ వెల్లడించింది.

వివరాలు 

మాట్లాడుతూనే పనులు పూర్తి చేసే AI ఏజెంట్లు

కొత్త మోడళ్లలో ప్రత్యేకంగా చెప్పుకోదగ్గ అంశం.. వినియోగదారులతో సంభాషణ కొనసాగిస్తూనే టూల్స్‌, APIలను బ్యాక్‌గ్రౌండ్‌లో ఉపయోగించగలగడం.

అంటే.. AI ఏజెంట్‌కు ఒక పని అప్పగించినప్పుడు, దాన్ని పూర్తి చేసే క్రమంలో సంభాషణను ఆపేయాల్సిన అవసరం ఉండదు. ఉదాహరణకు.. ఇంటర్నెట్‌లో సమాధానం వెతుకుతున్నప్పటికీ, వినియోగదారుడితో సహజమైన వేగంతో మాట్లాడటం కొనసాగిస్తుంది.

దీనివల్ల తరచూ విరామాలు లేకుండా మరింత సహజమైన, మనిషితో మాట్లాడుతున్న అనుభూతిని కలిగించే కాలింగ్‌ అనుభవం అందుతుందని గూగుల్‌ తెలిపింది.

ADVERTISEMENT

వివరాలు 

97 భాషల్లో మాటలను అర్థం చేసుకుని.. మాట్లాడగలవు

ఈ మోడళ్లలో ఆటోమేటిక్‌ లాంగ్వేజ్‌ డిటెక్షన్‌, సంభాషణ మధ్యలోనే భాషను మార్చుకునే సదుపాయం కూడా ఉంది.

మొత్తం 97 భాషల్లో మాటలను అర్థం చేసుకోవడంతోపాటు, అదే భాషల్లో వాయిస్‌ను రూపొందించగలవని గూగుల్‌ పేర్కొంది.

దృశ్య సమాచారాన్ని దాదాపు రియల్‌టైమ్‌లో అర్థం చేసుకునే సామర్థ్యం కూడా వీటికి ఉంది.

అంతేకాదు.. వినియోగదారు అడిగిన ప్రశ్నకు సమాధానం వెతికే ముందు "ఒక్కసారి పరిశీలిస్తాను" వంటి మాటలతో స్పందించడం ద్వారా సంభాషణను మరింత సహజంగా మార్చగలవని తెలిపింది.

ఈ ఫీచర్లతో AI ఏజెంట్లతో మాట్లాడుతున్న అనుభవం మరింత వాస్తవికంగా ఉంటుందని గూగుల్‌ అభిప్రాయపడింది.

ADVERTISEMENT

వివరాలు 

Gemini API ద్వారా అందుబాటులోకి

Gemini 3.8 Live మోడల్‌ ప్రస్తుతం Gemini API, Google AI Studio ద్వారా అందుబాటులో ఉంది.

Gemini Enterprise, Search Liveలో ఎంటర్‌ప్రైజ్‌ ప్రైవేట్‌ ప్రివ్యూ రూపంలోనూ దీనిని ఉపయోగించుకోవచ్చని గూగుల్‌ తెలిపింది.

Gemini 3.8 Live Extended Thinking మోడల్‌ కూడా ఇదే మార్గాల్లో లభిస్తుంది. అదనంగా.. సబ్‌స్క్రైబర్ల కోసం Docs, Gmail, Keep వంటి Google Workspace సేవల్లో, Gemini Live అప్లికేషన్లలోనూ దీన్ని ఉపయోగించవచ్చని పేర్కొంది.

డెవలపర్లు Vercel, Agora, LiveKit, Pipecat, Fishjam, Vision Agents వంటి భాగస్వామ్య ప్లాట్‌ఫామ్‌ల ద్వారా తమ యాప్‌లలో ఈ మోడళ్లను అనుసంధానించుకోవచ్చు.

వివరాలు 

ఆడియోకు SynthID వాటర్‌మార్క్‌.. ధరలు ఇలా

కొత్త మోడళ్లతో రూపొందించే ఆడియో ఫైళ్లలో కనిపించని SynthID వాటర్‌మార్క్‌ ఉంటుందని గూగుల్‌ తెలిపింది.

తప్పుడు సమాచారాన్ని గుర్తించేందుకు ఇది ఉపయోగపడుతుందని పేర్కొంది.

సాధారణ Gemini 3.8 Live మోడల్‌లో ఆడియో ఇన్‌పుట్‌కు నిమిషానికి 0.005 డాలర్లు, ఆడియో అవుట్‌పుట్‌కు నిమిషానికి 0.018 డాలర్లు చార్జ్‌ చేస్తారు.

Extended Thinking మోడల్‌కు రీజనింగ్‌ టోకెన్లతోపాటు, వీడియోలు, డాక్యుమెంట్ల వంటి అదనపు ఇన్‌పుట్‌లకూ ప్రత్యేకంగా ఛార్జీలు ఉంటాయని గూగుల్‌ వెల్లడించింది.

ADVERTISEMENT