Google ปล่อย Gemini 3.5 Transcribe ถอดเสียงเป๊ะ!


Google ปล่อย Gemini 3.5 Transcribe ถอดเสียงเป๊ะ!


Google เปิดตัว Gemini 3.5 Transcribe โมเดลแปลงเสียงเป็นข้อความที่เคลมว่าแม่นยำที่สุดเท่าที่เคยทำมา

ความเก่งของตัวนี้คือแก้ปัญหาเดิมๆ ที่โมเดลรุ่นก่อนทำไม่ได้ โดยเฉพาะเรื่องเสียงรบกวนรอบข้าง ศัพท์เทคนิคยากๆ รวมถึงการตัดคำฟุ่มเฟือยอย่าง "เอ่อ" หรือ "อ่า" ออกให้อัตโนมัติ เปลี่ยนไฟล์เสียงดิบให้กลายเป็นข้อความเรียบหรูอ่านง่ายได้ทันที

นักพัฒนาสามารถนำไปต่อยอดทำระบบแกะเทป Voice Agent ระบบซับไตเติลเรียลไทม์ หรือระบบวิเคราะห์ข้อมูลหลังจบสายโทรศัพท์ได้สะดวก โดยรองรับทั้งการถอดเสียงแบบ Live สดผ่าน Live API และไฟล์บันทึกเสียงผ่าน Interactions API

จุดเด่นสำคัญ

Smart Transcriptions:
คลีนข้อความให้อัตโนมัติ ตัดคำอ้ำอึ้งออกทันที

Custom Vocabulary:
จดจำคำศัพท์เฉพาะทางได้แม่นยำ

Language Support:
รองรับมากกว่า 85 ภาษา ซึ่งแน่นอนว่ารวมถึงภาษาไทยด้วย ตอบโจทย์ทั้งสายเรียน สายทำงาน และคอนเทนต์ครีเอเตอร์ไทยที่ต้องทำซับไตเติล

Speaker Diarization:
แยกแยะเสียงคนพูดได้สูงสุดถึง 3 คนในเวลาเดียวกัน

เรื่องความแม่นยำ อัตราความผิดพลาด (Error Rate) อยู่ที่ 4% สำหรับงาน Live สด และเหลือเพียง 2.6% สำหรับไฟล์บันทึกเสียง เมื่อนำไปวัดผลบน FLEURS Benchmark ในการถอดเสียงแบบ Live สด Gemini 3.5 Transcribe มีอัตราคำผิดเพียง 5.5% ในขณะที่คู่แข่งอย่าง GPT Live Transcribe ของ OpenAI อยู่ที่ 8.9%

ตอนนี้เปิดให้ฝั่งนักพัฒนาและองค์กรทดลองใช้งานเวอร์ชัน Public Preview เรียบร้อยแล้ว ส่วนผู้ใช้ทั่วไปเริ่มใช้งานได้บนแอป Gemini ใน macOS (เวอร์ชันภาษาอังกฤษ) และแอป Rambler บน Android ในบางประเทศ ส่วนผู้ใช้ในไทยเตรียมตัวได้เลย เพราะมีแผนจะอัปเดตลง Chrome ในเร็วๆ นี้

ย้อนกลับไปช่วงต้นเดือน Google เพิ่งเปิดตัว Gemini 3.7 Flash ไป แถมยอดผู้ใช้งานแอป Gemini ยังทะลุ 1,000 ล้านคนทั่วโลก อย่างไรก็ตาม โมเดลเรือธงที่หลายคนรอคอยอย่าง Gemini 3.5 Pro ซึ่งเดิมมีกำหนดเปิดตัวตั้งแต่เดือนมิถุนายนที่ผ่านมา ยังคงต้องร้องเพลงรอต่อไป



Google ปล่อย Gemini 3.5 Transcribe ถอดเสียงเป๊ะ!

ข่าวดารา ข่าวในกระแส บน Facebook อัพเดตไว เร็วทันใจ คลิกที่นี่!!
กระทู้เด็ดน่าแชร์