Google เปิดตัว Gemini 3.8 Live และ Extended Thinking ยกระดับ AI ฟัง พูด คิด ทำงานไปพร้อมกัน

THE SUMMARY:

Google เปิดตัว Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking สองโมเดลใหม่สำหรับการสนทนาแบบสด ที่ยกระดับความสามารถด้านการใช้เหตุผลและการทำงานแบบ Agentic ให้ AI สามารถ ฟัง พูด คิด และจัดการงานที่ซับซ้อนไปพร้อมกัน ทำให้การคุยกับ AI เป็นธรรมชาติและต่อเนื่องมากขึ้น

Gemini 3.8 Live เน้นเร็ว ลื่นไหล และเข้าใจบริบท

Gemini 3.8 Live ถูกออกแบบมาสำหรับการใช้งานในวงกว้าง เน้นการสนทนาที่รวดเร็ว เข้าใจบริบทจากภาพ และสามารถเรียกใช้เครื่องมือหรือ API อยู่เบื้องหลังระหว่างที่กำลังพูดคุยกับผู้ใช้ อีกจุดเด่นคือสามารถ ตรวจจับและสลับระหว่างภาษาที่รองรับ 97 ภาษาได้โดยอัตโนมัติ ทำให้การสนทนาหลายภาษาทำได้ต่อเนื่องมากขึ้น

Google ระบุว่าโมเดลสามารถประมวลผลข้อมูลภาพแบบเกือบเรียลไทม์ เพื่อเพิ่มบริบทให้กับคำตอบ และยังได้รับการออกแบบให้มีต้นทุนที่เหมาะกับการนำไปสร้าง Voice Agent

Extended Thinking คิดลึก แต่ไม่ทำให้บทสนทนาหยุดชะงัก

ส่วน Gemini 3.8 Live Extended Thinking เพิ่มความสามารถด้านการคิดวิเคราะห์หลายขั้นตอน เหมาะกับงานที่มีความซับซ้อนมากขึ้น

ความน่าสนใจคือ AI สามารถ คิดและพูดโต้ตอบไปพร้อมกัน แทนที่จะเงียบไปในระหว่างประมวลผล เช่น อาจตอบกลับว่า “ขอฉันตรวจสอบข้อมูลสักครู่นะคะ…” พร้อมแสดงความคืบหน้าของงานที่กำลังดำเนินการอยู่เบื้องหลัง แนวทางนี้ทำให้ผู้ใช้รู้ว่า AI กำลังทำอะไรอยู่ และลดความรู้สึกว่าระบบหยุดทำงานระหว่างรอคำตอบ

จาก AI ตอบคำถาม สู่ Voice Agent ที่ลงมือทำงาน

Google มองว่า Gemini 3.8 Live ทั้งสองรุ่นจะเป็นพื้นฐานสำคัญสำหรับการสร้าง Voice Agent ที่สามารถรับคำสั่งด้วยเสียงและจัดการงานหลายขั้นตอนได้

ผ่าน Gemini Live API นักพัฒนาสามารถนำโมเดลไปใช้งานร่วมกับแพลตฟอร์มอย่าง Agora, LangChain, LiveKit, Pipecat และ Vercel เพื่อสร้างประสบการณ์สั่งงานด้วยเสียง โดยไม่ต้องจัดการโครงสร้างพื้นฐานสำหรับการสตรีมเสียงแบบเรียลไทม์ทั้งหมดด้วยตัวเอง

ขณะเดียวกัน Google ยังร่วมมือกับบริษัทอย่าง Salesforce, Genspark และ Lumeris เพื่อนำความสามารถด้านเสียง การตอบสนองที่มีความหน่วงต่ำ และการเรียกใช้เครื่องมือไปต่อยอดกับงานจริง

เสียงที่สร้างโดย AI ฝังลายน้ำ SynthID

เพื่อเพิ่มความโปร่งใส Google ระบุว่า ไฟล์เสียงที่สร้างโดยผลิตภัณฑ์ AI จะฝังลายน้ำ SynthID ลงในไฟล์โดยตรงในรูปแบบที่มนุษย์ไม่สามารถได้ยินหรือสังเกตได้ ช่วยให้สามารถตรวจสอบที่มาของเสียงที่สร้างโดย AI ได้

Gemini 3.8 Live เริ่มเปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio สำหรับนักพัฒนา ส่วนองค์กรสามารถทดลองใช้ใน Private Preview บน Gemini Enterprise และผู้ใช้ทั่วไปสามารถใช้งานผ่าน Search Live

ส่วน Gemini 3.8 Live Extended Thinking เปิดให้ใช้งานผ่าน Gemini API และ Google AI Studio เช่นกัน พร้อม Private Preview สำหรับลูกค้าองค์กร และเริ่มนำมาใช้ใน Gemini Live รวมถึงบริการ Google Workspace บางส่วนสำหรับสมาชิกแพ็กเกจที่รองรับ

ที่มา blog.google

นักเขียนสาย Introvert ที่ชื่นชอบเรื่องนวัตกรรมและความคิดสร้างสรรค์ ใช้เวลาว่างกับ มังงะ, เสียงเพลงและ idol

Sidebar Search
Popular Now
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...