متا از مدل تازه تبدیل صوت به متن با نام Muse پردهبرداری کرد
بر اساس گزارش خبرگزاری خبرآنلاین و اطلاعات منتشرشده توسط دیجیاتو، شرکت متا یک مدل جدید با نام Muse Voice Transcribe را برای رونویسی لحظهای صدا معرفی کرده است. این مدل به گفته این شرکت قادر است گفتار بیش از ۲۰ گوینده را تشخیص دهد و بهطور همزمان با چند زبان کار کند. جالب اینکه این مدل میتواند وسط جمله و در صورت تغییر زبان، زبانهای مختلف را شناسایی کرده و متن را بر اساس آن رونویسی کند.
Muse Voice Transcribe نخستین مدل پردازش صوتی بلادرنگ متا به شمار میرود که طراحی آن با هدف تبدیل گفتار به متن در حالت استریم انجام شده است. این مدل قابلیتهایی مانند تفکیک گویندگان و شناسایی زمان پایان گفتار را در یک سیستم واحد ارائه میدهد.
مدل تبدیل گفتار به متن متا: Muse Voice Transcribe
مدیرعامل متا، «مارک زاکربرگ»، نمونهای از عملکرد این مدل را در شبکه اجتماعی ایکس به اشتراک گذاشته است. در این ویدیو، سیستم قادر است چند گوینده را از هم تشخیص دهد و در زمان صحبتکردن افراد به زبانهای مختلف، بهطور اتوماتیک زبان گفتار را تغییر دهد.
این مدل همچنین دارای قابلیت تغییر زبان است؛ به این معنی که اگر یک فرد در یک جمله از واژههای متنوعی استفاده کند، سیستم توانایی شناسایی این تغییر را دارد و رونویسی را بر همین اساس انجام میدهد.
زاکربرگ در توضیح نحوه کارکرد این مدل گفت: «مدل تعیین میکند که چه زمانی باید به صحبت گوش دهد. برای واژههای دشوار کمی بیشتر صبر میکند و برای واژههای ساده، سریعتر به ثبت نتیجه میپردازد.» او افزود که این فرایند با استفاده از تأخیر تطبیقی انجام میشود تا مدل بتواند توکن بعدی را پیشبینی کند و دقت رونویسی را بهبود بخشد.
زاکربرگ همچنین بیان کرده است که این مدل با هدف کار در محیطهای واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان تربیت شده است. به گفته او، Muse Voice Transcribe قادر است جلسات صوتی حداکثر یک ساعته را با بیش از ۲۰ گوینده مدیریت کند.

مجموعه متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از رونمایی مدل صوتی Gemini 3.5 Transcribe از سوی گوگل انجام داده است. گوگل در نظر دارد مدل صوتیاش را در سیستمهای اندروید و بهزودی در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامهای برای بهکارگیری Muse Voice Transcribe در سرویسهای اصلیاش دارد.
در حال حاضر، کاربران قادرند قابلیتهای این مدل را در اپلیکیشن دسکتاپ Meta AI برای سیستمعامل مک تجربه کنند. همچنین این مدل برای توسعهدهندگان از طریق Muse Code و Model API متا قابل دسترسی است. هزینه استفاده از API به ازای هر هزار دقیقه صوت برابر با ۳ دلار تعیین شده است.
۲۲۷۲۲۷