فیلم بیشتر »»
کد خبر ۱۱۹۵۸۶۳
تاریخ انتشار: ۰۹:۳۶ - ۱۱-۰۷-۱۴۰۵
کد ۱۱۹۵۸۶۳
انتشار: ۰۹:۳۶ - ۱۱-۰۷-۱۴۰۵

مدل جدید مایکروسافت برای تبدیل لحظه‌ای صدا به متن با پشتیبانی از ۶۰ زبان معرفی شد

مایکروسافت
مدل‌های هوش مصنوعی جدید مایکروسافت برای رونویسی بلادرنگ از صحبت‌های گوینده طراحی شده‌اند.

مایکروسافت ماه گذشته MAI-Transcribe-2 را معرفی کرد که در آزمایش‌های این شرکت توانست عملکرد بهتری از مدل‌های رقیب OpenAI و گوگل در زمینه رونویسی ارائه دهد و هزینه استفاده از آن تنها ۰.۱۰ دلار به ازای هر ساعت بود. 

به گزارش دیجیاتو، این غول فناوری حالا مدل هوش مصنوعی صوتی MAI-Transcribe-2-Streaming را معرفی کرد؛ در کنار آن دو مدل جدید دیگر نیز معرفی شدند: MAI-Voice-2.1 و MAI-Voice-2.1-Flash. این مدل‌های جدید برای همکاری با یکدیگر و کارکرد به‌عنوان دستیارهای صوتی مکالمه‌ای با تأخیر بسیار کم طراحی شده‌اند.

مدل جدید صوتی مایکروسافت برای تبدیل صدا به متن

برخلاف MAI-Transcribe-2 که فقط فایل‌های صوتی ضبط‌شده را پردازش می‌کند، مدل MAI-Transcribe-2-Streaming برای کاربردهای بلادرنگ طراحی شده است. این مدل به‌جای اینکه تا پایان صحبت گوینده منتظر بماند و سپس متن را ارائه کند، کمی بیش از ۱۰۰ میلی‌ثانیه پس از دریافت صدا شروع به تولید بخش‌های اولیه متن می‌کند. مدل با دریافت اطلاعات بیشتر، این نتایج را به‌طور مداوم اصلاح می‌کند تا در نهایت متن نهایی را ثبت کند.

مدل جدید مایکروسافت برای تبدیل لحظه‌ای صدا به متن با پشتیبانی از ۶۰ زبان معرفی شد

MAI-Transcribe-2-Streaming از ۶۰ زبان و تشخیص خودکار و مداوم زبان پشتیبانی می‌کند. مایکروسافت می‌گوید این مدل از نظر دقت متن‌های اولیه و نهایی، در رتبه اول Artificial Analysis قرار گرفته است. در آزمایش‌های داخلی مایکروسافت برای دیکته و زیرنویس، کلمات با این مدل دو برابر سریع‌تر از نزدیک‌ترین رقیب در متن ظاهر شدند.

قیمت استفاده از این مدل تا پایان سال ۲۰۲۶، حدود ۰.۵۴ دلار به ازای هر ساعت فایل صوتی است. این رقم به‌مراتب بیشتر از قیمت ۰.۱۰ دلار به ازای هر ساعت برای نسخه غیر Streaming یعنی MAI-Transcribe-2 است.

مایکروسافت همچنین مدل MAI-Voice-2.1 را معرفی کرد که جدیدترین مدل چندزبانه تبدیل متن به گفتار این شرکت محسوب می‌شود. مایکروسافت اوایل امسال MAI-Voice-2 و نسخه سریع‌تر آن، یعنی MAI-Voice-2-Flash، را معرفی کرده بود که در Dynamics 365 Contact Center و Azure Voice Live استفاده می‌شوند.MAI-Voice-2.1 از ۲۳ زبان در ۲۶ منطقه زبانی پشتیبانی می‌کند و هزینه آن ۲۲ دلار به ازای هر یک میلیون کاراکتر است.

برای کاربردهایی که به تأخیر کم و حجم بالای پردازش نیاز دارند، مایکروسافت MAI-Voice-2.1-Flash را نیز معرفی کرده است. این مدل می‌تواند ۴۵ ثانیه فایل صوتی را با حدود ۱۵۰ میلی‌ثانیه تأخیر از ابتدا تا انتها تولید کند. مایکروسافت ادعا می‌کند این مدل ۵۵ درصد استنتاج سریع‌تری دارد و حدود ۶۰ درصد ارزان‌تر از مدل‌های مشابه است. همچنین هزینه استفاده از آن ۱۵ دلار به ازای هر یک میلیون کاراکتر خواهد بود. هر دو مدل جدید صوتی همچنین امکان کلون‌کردن صدا را در زبان‌های تحت پشتیبانی خود، تنها با استفاده از چند ثانیه صدای مرجع، دارند. 

برچسب ها: مایکروسافت ، صدا ، زبان
ارسال به دوستان
captcha
وقتی یک سفیر با موسیقی از ایران خداحافظی می‌کند برای سلامت روده چه بخوریم؟ ۱۵ انتخاب مفید و ساده گزارش ۳ جنایت هولناک در کشور؛ از قتل‌عام خانوادگی در اصفهان تا انتقام خونین در گلستان دیدنی های امروز؛ از اعتراضات دانش آموزی فرانسه تا فیلم جدید تام کروز تاب‌آوری هیجانی: چطور در دل عدم‌قطعیت، به قدرت درونی برسیم؟ پژو ۲۰۷ جدید لو رفت؟ / اولین تصویر از چهره احتمالی فیس‌لیفت ایران‌خودرو منتشر شد (عکس) عبور از دیوار بتنی ۲ متری با قدرتمندترین لیزر جهان واژگونی وانت در بزرگراه شهید بابایی/ راننده پیکان‌وانت در صحنه جان باخت نیمی از اختلالات روانی قبل از ۱۴ سالگی شروع می‌شود / چه بخوریم که سالم بمانیم؟ حادثه در مقابل دادگستری مهاباد آذربایجان غربی؛ تیراندازی در پی درگیری لفظی دریافت حضوری کارت سوخت در کما آمریکا به خلبان‌های حمله به ایران مدال داد نفرات برتر آزمون سراسری «شاهزاده فرمانفرما» در جوانی با همراهانش در مسیر بازگشت به تهران (عکس) هک پنتاگون اطلاعات ۲.۷۶ میلیون نیروی نظامی و کارکنان آمریکا را افشا کرد