Google เปิดตัว Gemini 3.5 Transcribe ถอดเสียงพูดเป็นข้อความแม่นยำขึ้น รองรับกว่า 85 ภาษา

THE SUMMARY:

Google เปิดตัว Gemini 3.5 Transcribe โมเดล AI แปลงเสียงเป็นข้อความรุ่นใหม่ ที่ไม่ได้แค่ ฟังแล้วพิมพ์ แต่ยังเข้าใจบริบท จัดระเบียบประโยค แก้คำพูดที่เปลี่ยนกลางประโยค และรองรับการใช้งานแบบเรียลไทม์ด้วยความหน่วงต่ำกว่า 1 วินาที

Gemini 3.5 Transcribe ออกแบบมาเพื่อแก้ข้อจำกัดของระบบรู้จำเสียงแบบเดิม โดยสามารถรับมือกับเสียงรบกวน คำศัพท์เฉพาะทาง สำเนียงหลากหลาย รวมถึงลักษณะการพูดที่เป็นธรรมชาติของมนุษย์ได้ดีขึ้น เปลี่ยนเสียงดิบให้กลายเป็นข้อความที่อ่านง่ายและจัดรูปแบบให้โดยอัตโนมัติ

มีทั้งแบบเรียลไทม์และไฟล์เสียงย้อนหลัง

Google เปิดให้ใช้งานผ่าน API สำหรับนักพัฒนา 2 รูปแบบ ได้แก่

  • gemini-3.5-transcribe-live สำหรับการสตรีมเสียงแบบเรียลไทม์ ผ่าน Live API รองรับการสื่อสารแบบสองทาง และมีความหน่วงต่ำกว่า 1 วินาที
  • gemini-3.5-transcribe สำหรับไฟล์เสียงที่บันทึกไว้ เช่น การประชุมหรือบันทึกการโทร พร้อมระบุผู้พูดและประทับเวลาระดับคำ

จุดเด่นคือ AI สามารถจัดการกับการพูดที่เปลี่ยนใจกลางประโยค เช่น “เจอกันวันอังคาร… ไม่ใช่ วันพุธ” รวมถึงตัดคำฟุ่มเฟือยอย่าง “อืม” หรือ “เอ่อ” และจัดข้อความให้อ่านง่ายขึ้นโดยอัตโนมัติ

Google ระบุว่า Gemini 3.5 Transcribe มีอัตราความผิดพลาดของคำ หรือ WER เฉลี่ย 4.0% สำหรับการใช้งานแบบสตรีมมิง และ 2.6% สำหรับการประมวลผลเสียงที่บันทึกไว้ล่วงหน้า พร้อมรองรับคำศัพท์เฉพาะและรูปแบบการสะกดที่กำหนดเองได้

โมเดลยังรองรับการตรวจจับและถอดเสียงอัตโนมัติมากกว่า 85 ภาษา สามารถรับมือกับสำเนียงและภาษาถิ่นหลากหลาย รวมถึงระบุผู้พูดได้สูงสุด 3 คนสำหรับไฟล์เสียงที่บันทึกไว้

เมื่อเทียบกับ Chirp 3 ซึ่งเป็นโมเดลรุ่นก่อนหน้า Google ระบุว่า Gemini 3.5 Transcribe มีทั้งความแม่นยำที่ดีขึ้นและความเร็วในการประมวลผลสูงขึ้น โดยเวลาในการได้ผลลัพธ์ถอดเสียงขั้นสุดท้ายสามารถดีขึ้นได้สูงสุด 70% ในบางชุดทดสอบ

ไม่ได้อยู่แค่ใน API แต่กำลังเข้ามาอยู่ในทุกอุปกรณ์

ความสามารถของ Gemini 3.5 Transcribe ถูกนำไปใช้ในผลิตภัณฑ์ต่าง ๆ ของ Google เพื่อทำให้การสั่งงานด้วยเสียงเป็นธรรมชาติมากขึ้น บน Gboard สำหรับ Android ฟีเจอร์ Rambler สามารถเปลี่ยนความคิดที่พูดออกมาให้เป็นข้อความที่เรียบร้อย พร้อมตัดคำฟุ่มเฟือย แก้ไขคำสะกด หรือปรับรูปแบบการเขียนด้วยเสียง

ส่วนใน แอป Gemini บน macOS ผู้ใช้สามารถใช้เสียงสั่งงานที่เชื่อมโยงกับบริบทบนหน้าจอ ไม่ว่าจะเป็นการสรุปไฟล์ นำข้อความไปใช้ในแอปอื่น หรือสั่งให้ AI ทำงานร่วมกับโมเดล Gemini ตัวอื่น ๆ

Google เตรียมนำความสามารถนี้เข้าสู่ Chrome เพื่อให้ผู้ใช้สามารถพูดแทนการพิมพ์ในช่องข้อความบนเว็บไซต์ ช่วยให้การตอบข้อความ เขียนโพสต์ หรือสั่งงาน Gemini ทำได้สะดวกขึ้น

Gemini 3.5 Transcribe เปิดให้ทดลองใช้งานแบบ Public Preview ผ่าน Gemini API, Google AI Studio และ Google Antigravity ขณะที่ฝั่งองค์กรสามารถใช้งานผ่าน Gemini Enterprise Agent Platform

ที่มา blog.google

นักเขียนสาย Introvert ที่ชื่นชอบเรื่องนวัตกรรมและความคิดสร้างสรรค์ ใช้เวลาว่างกับ มังงะ, เสียงเพลงและ idol

Sidebar Search
Popular Now
Loading

Signing-in 3 seconds...

Signing-up 3 seconds...