مایکروسافت از سه مدل هوش مصنوعی جدید برای مکالمات صوتی رونمایی کرد

مایکروسافت از سه مدل هوش مصنوعی جدید برای مکالمات صوتی رونمایی کرد
فهرست مطالب

مایکروسافت با معرفی سه مدل جدید MAI-Transcribe-2-Streaming، MAI-Voice-2.1 و MAI-Voice-2.1-Flash، قابلیت‌های هوش مصنوعی صوتی خود را گسترش داد؛ مدل‌هایی که برای مکالمات صوتی سریع و بلادرنگ طراحی شده‌اند.

مدل MAI-Transcribe-2-Streaming می‌تواند تنها کمی بیش از ۱۰۰ میلی‌ثانیه پس از دریافت صدا، متن اولیه را تولید کند و با دریافت اطلاعات بیشتر آن را اصلاح کند. این مدل از ۶۰ زبان پشتیبانی می‌کند و مایکروسافت مدعی است در ارزیابی Artificial Analysis، در دقت رونویسی اولیه و نهایی در رتبه نخست قرار گرفته است.

مدل‌های MAI-Voice-2.1 و نسخه سریع‌تر Flash نیز برای تبدیل متن به گفتار ساخته شده‌اند. نسخه Flash می‌تواند حدود ۴۵ ثانیه صدا را با تأخیر تقریبی ۱۵۰ میلی‌ثانیه تولید کند و از ۲۳ زبان در ۲۶ منطقه پشتیبانی می‌شود. هر دو مدل همچنین قابلیت شبیه‌سازی صدا با تنها چند ثانیه نمونه صوتی را دارند.

کد خبر ۲۱۲۰۵۰۷۱۱.۶۷۱

منبع: نئووین

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *