مایکروسافت با معرفی سه مدل جدید MAI-Transcribe-2-Streaming، MAI-Voice-2.1 و MAI-Voice-2.1-Flash، قابلیتهای هوش مصنوعی صوتی خود را گسترش داد؛ مدلهایی که برای مکالمات صوتی سریع و بلادرنگ طراحی شدهاند.
مدل MAI-Transcribe-2-Streaming میتواند تنها کمی بیش از ۱۰۰ میلیثانیه پس از دریافت صدا، متن اولیه را تولید کند و با دریافت اطلاعات بیشتر آن را اصلاح کند. این مدل از ۶۰ زبان پشتیبانی میکند و مایکروسافت مدعی است در ارزیابی Artificial Analysis، در دقت رونویسی اولیه و نهایی در رتبه نخست قرار گرفته است.
مدلهای MAI-Voice-2.1 و نسخه سریعتر Flash نیز برای تبدیل متن به گفتار ساخته شدهاند. نسخه Flash میتواند حدود ۴۵ ثانیه صدا را با تأخیر تقریبی ۱۵۰ میلیثانیه تولید کند و از ۲۳ زبان در ۲۶ منطقه پشتیبانی میشود. هر دو مدل همچنین قابلیت شبیهسازی صدا با تنها چند ثانیه نمونه صوتی را دارند.
کد خبر ۲۱۲۰۵۰۷۱۱.۶۷۱
منبع: نئووین