کد خبر 688363
۱۴۰۵/۰۶/۱۱ ۱۵:۰۱

متا از مدل تازه تبدیل صوت به متن با نام Muse پرده‌برداری کرد

ساعت 24 - مدل نوین Muse Voice Transcribe توانایی رونویسی گفتار بیش از ۲۰ نفر به طور هم‌زمان و در بیش از ۲۰ زبان مختلف را دارد.
متا از مدل تبدیل صوت به متن Muse رونمایی کرد

بر اساس گزارش خبرگزاری خبرآنلاین و اطلاعات منتشرشده توسط دیجیاتو، شرکت متا یک مدل جدید با نام Muse Voice Transcribe را برای رونویسی لحظه‌ای صدا معرفی کرده است. این مدل به گفته این شرکت قادر است گفتار بیش از ۲۰ گوینده را تشخیص دهد و به‌طور هم‌زمان با چند زبان کار کند. جالب اینکه این مدل می‌تواند وسط جمله و در صورت تغییر زبان، زبان‌های مختلف را شناسایی کرده و متن را بر اساس آن رونویسی کند.

Muse Voice Transcribe نخستین مدل پردازش صوتی بلادرنگ متا به شمار می‌رود که طراحی آن با هدف تبدیل گفتار به متن در حالت استریم انجام شده است. این مدل قابلیت‌هایی مانند تفکیک گویندگان و شناسایی زمان پایان گفتار را در یک سیستم واحد ارائه می‌دهد.

مدل تبدیل گفتار به متن متا: Muse Voice Transcribe

مدیرعامل متا، «مارک زاکربرگ»، نمونه‌ای از عملکرد این مدل را در شبکه اجتماعی ایکس به اشتراک گذاشته است. در این ویدیو، سیستم قادر است چند گوینده را از هم تشخیص دهد و در زمان صحبت‌کردن افراد به زبان‌های مختلف، به‌طور اتوماتیک زبان گفتار را تغییر دهد.

این مدل همچنین دارای قابلیت تغییر زبان است؛ به این معنی که اگر یک فرد در یک جمله از واژه‌های متنوعی استفاده کند، سیستم توانایی شناسایی این تغییر را دارد و رونویسی را بر همین اساس انجام می‌دهد.

زاکربرگ در توضیح نحوه کارکرد این مدل گفت: «مدل تعیین می‌کند که چه زمانی باید به صحبت گوش دهد. برای واژه‌های دشوار کمی بیشتر صبر می‌کند و برای واژه‌های ساده، سریع‌تر به ثبت نتیجه می‌پردازد.» او افزود که این فرایند با استفاده از تأخیر تطبیقی انجام می‌شود تا مدل بتواند توکن بعدی را پیش‌بینی کند و دقت رونویسی را بهبود بخشد.

زاکربرگ همچنین بیان کرده است که این مدل با هدف کار در محیط‌های واقعی و نامنظم آموزش دیده و با بیش از ۷۰ زبان تربیت شده است. به گفته او، Muse Voice Transcribe قادر است جلسات صوتی حداکثر یک ساعته را با بیش از ۲۰ گوینده مدیریت کند.

متا از مدل تبدیل صوت به متن Muse رونمایی کرد

مجموعه متا معرفی Muse Voice Transcribe را کمتر از یک هفته پس از رونمایی مدل صوتی Gemini 3.5 Transcribe از سوی گوگل انجام داده است. گوگل در نظر دارد مدل صوتی‌اش را در سیستم‌های اندروید و به‌زودی در مرورگر کروم ادغام کند، اما هنوز مشخص نیست متا چه برنامه‌ای برای به‌کارگیری Muse Voice Transcribe در سرویس‌های اصلی‌اش دارد.

در حال حاضر، کاربران قادرند قابلیت‌های این مدل را در اپلیکیشن دسکتاپ Meta AI برای سیستم‌عامل مک تجربه کنند. همچنین این مدل برای توسعه‌دهندگان از طریق Muse Code و Model API متا قابل دسترسی است. هزینه استفاده از API به ازای هر هزار دقیقه صوت برابر با ۳ دلار تعیین شده است.

۲۲۷۲۲۷

نظرات کاربران

نظر شما

ساعت 24 از انتشار نظرات حاوی توهین، افترا، لینک، تبلیغات و نوشته‌شده با حروف لاتین معذور است.

هنوز نظری برای این خبر تایید نشده است.