گوگل از EmbeddingGemma 2 رونمایی کرد؛ تحول در هوش مصنوعی چندوجهی آفلاین

گوگل از EmbeddingGemma 2 رونمایی کرد؛ تحول در هوش مصنوعی چندوجهی آفلاین
فهرست مطالب

گوگل نسل جدید مدل تعبیه‌ساز خود با نام EmbeddingGemma 2 را معرفی کرد؛ مدلی متن‌باز با ۷۴۰ میلیون پارامتر که می‌تواند متن، کد، تصویر، ویدیو و صوت را در یک فضای مشترک پردازش کند و بدون نیاز به اتصال به فضای ابری، قابلیت جست‌وجوی معنایی را روی دستگاه ارائه دهد.

EmbeddingGemma 2 بر پایه معماری Gemma 4 و با مجوز Apache 2.0 عرضه شده است. ساختار ماژولار آن به توسعه‌دهندگان اجازه می‌دهد بسته به نیاز، از مدل متنی ۲۷۰ میلیون پارامتری یا رمزگذارهای تصویری و صوتی استفاده کنند.

این مدل می‌تواند محتوای چندرسانه‌ای را به بردارهای قابل جست‌وجو تبدیل کند؛ بنابراین برای مثال، کاربر می‌تواند با یک عبارت متنی، محتوای مرتبط را در میان فایل‌های صوتی و ویدیویی ذخیره‌شده روی دستگاه پیدا کند؛ بدون اینکه داده‌ها به سرورهای ابری ارسال شوند.

EmbeddingGemma 2 از فناوری Matryoshka Representation Learning (MRL) نیز پشتیبانی می‌کند. به کمک این قابلیت، ابعاد بردارهای خروجی می‌تواند از ۷۶۸ به ۵۱۲، ۲۵۶ یا حتی ۱۲۸ کاهش پیدا کند؛ موضوعی که می‌تواند حجم موردنیاز برای پایگاه‌های داده برداری را تا حدود ۶ برابر کاهش دهد.

پنجره زمینه این مدل نیز به ۸ هزار توکن رسیده است؛ چهار برابر نسل قبلی. EmbeddingGemma 2 می‌تواند به‌صورت محلی تا ۵٫۵ دقیقه صوت، ۲۹ تصویر یا ۵۸ فریم ویدیو را پردازش کند.

گوگل می‌گوید EmbeddingGemma 2 در بنچمارک MTEB Code امتیاز خود را از ۶۸٫۷۶ به ۷۸٫۶۸ رسانده و در آزمون صوتی MAEB نیز در میان مدل‌های زیر یک میلیارد پارامتر، رتبه بالایی به دست آورده است.

وزن‌های این مدل از Hugging Face و Kaggle در دسترس توسعه‌دهندگان قرار گرفته و ابزارهایی مانند MediaPipe، LiteRT، transformers.js، MLX، vLLM، llama.cpp، SGLang، Ollama و Qdrant نیز برای استفاده از آن آماده هستند.

کد خبر ۲۱۲۰۵۰۷۱۵.۷۱۸

منبع: گوگل بلاگ

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *