
Google เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking สองโมเดลใหม่สำหรับการสนทนาแบบสด ที่ยกระดับความสามารถด้านการใช้เหตุผลและการทำงานแบบ Agentic ให้ AI สามารถ ฟัง พูด คิด และจัดการงานที่ซับซ้อนไปพร้อมกัน ทำให้การคุยกับ AI เป็นธรรมชาติและต่อเนื่องมากขึ้น
Gemini 3.8 Live ถูกออกแบบมาสำหรับการใช้งานในวงกว้าง เน้นการสนทนาที่รวดเร็ว เข้าใจบริบทจากภาพ และสามารถเรียกใช้เครื่องมือหรือ API อยู่เบื้องหลังระหว่างที่กำลังพูดคุยกับผู้ใช้ อีกจุดเด่นคือสามารถ ตรวจจับและสลับระหว่างภาษาที่รองรับ 97 ภาษาได้โดยอัตโนมัติ ทำให้การสนทนาหลายภาษาทำได้ต่อเนื่องมากขึ้น
Google ระบุว่าโมเดลสามารถประมวลผลข้อมูลภาพแบบเกือบเรียลไทม์ เพื่อเพิ่มบริบทให้กับคำตอบ และยังได้รับการออกแบบให้มีต้นทุนที่เหมาะกับการนำไปสร้าง Voice Agent

ส่วน Gemini 3.8 Live Extended Thinking เพิ่มความสามารถด้านการคิดวิเคราะห์หลายขั้นตอน เหมาะกับงานที่มีความซับซ้อนมากขึ้น
ความน่าสนใจคือ AI สามารถ คิดและพูดโต้ตอบไปพร้อมกัน แทนที่จะเงียบไปในระหว่างประมวลผล เช่น อาจตอบกลับว่า “ขอฉันตรวจสอบข้อมูลสักครู่นะคะ…” พร้อมแสดงความคืบหน้าของงานที่กำลังดำเนินการอยู่เบื้องหลัง แนวทางนี้ทำให้ผู้ใช้รู้ว่า AI กำลังทำอะไรอยู่ และลดความรู้สึกว่าระบบหยุดทำงานระหว่างรอคำตอบ
Google มองว่า Gemini 3.8 Live ทั้งสองรุ่นจะเป็นพื้นฐานสำคัญสำหรับการสร้าง Voice Agent ที่สามารถรับคำสั่งด้วยเสียงและจัดการงานหลายขั้นตอนได้
ผ่าน Gemini Live API นักพัฒนาสามารถนำโมเดลไปใช้งานร่วมกับแพลตฟอร์มอย่าง Agora, LangChain, LiveKit, Pipecat และ Vercel เพื่อสร้างประสบการณ์สั่งงานด้วยเสียง โดยไม่ต้องจัดการโครงสร้างพื้นฐานสำหรับการสตรีมเสียงแบบเรียลไทม์ทั้งหมดด้วยตัวเอง
ขณะเดียวกัน Google ยังร่วมมือกับบริษัทอย่าง Salesforce, Genspark และ Lumeris เพื่อนำความสามารถด้านเสียง การตอบสนองที่มีความหน่วงต่ำ และการเรียกใช้เครื่องมือไปต่อยอดกับงานจริง
เพื่อเพิ่มความโปร่งใส Google ระบุว่า ไฟล์เสียงที่สร้างโดยผลิตภัณฑ์ AI จะฝังลายน้ำ SynthID ลงในไฟล์โดยตรงในรูปแบบที่มนุษย์ไม่สามารถได้ยินหรือสังเกตได้ ช่วยให้สามารถตรวจสอบที่มาของเสียงที่สร้างโดย AI ได้
Gemini 3.8 Live เริ่มเปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio สำหรับนักพัฒนา ส่วนองค์กรสามารถทดลองใช้ใน Private Preview บน Gemini Enterprise และผู้ใช้ทั่วไปสามารถใช้งานผ่าน Search Live
ส่วน Gemini 3.8 Live Extended Thinking เปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio เช่นกัน พร้อม Private Preview สำหรับลูกค้าองค์กร และเริ่มนำมาใช้ใน Gemini Live รวมถึงบริการ Google Workspace บางส่วนสำหรับสมาชิกแพ็กเกจที่รองรับ
ที่มา blog.google






