گوگل نسل جدید مدل تعبیهساز خود با نام EmbeddingGemma 2 را معرفی کرد؛ مدلی متنباز با ۷۴۰ میلیون پارامتر که میتواند متن، کد، تصویر، ویدیو و صوت را در یک فضای مشترک پردازش کند و بدون نیاز به اتصال به فضای ابری، قابلیت جستوجوی معنایی را روی دستگاه ارائه دهد.
EmbeddingGemma 2 بر پایه معماری Gemma 4 و با مجوز Apache 2.0 عرضه شده است. ساختار ماژولار آن به توسعهدهندگان اجازه میدهد بسته به نیاز، از مدل متنی ۲۷۰ میلیون پارامتری یا رمزگذارهای تصویری و صوتی استفاده کنند.
این مدل میتواند محتوای چندرسانهای را به بردارهای قابل جستوجو تبدیل کند؛ بنابراین برای مثال، کاربر میتواند با یک عبارت متنی، محتوای مرتبط را در میان فایلهای صوتی و ویدیویی ذخیرهشده روی دستگاه پیدا کند؛ بدون اینکه دادهها به سرورهای ابری ارسال شوند.
EmbeddingGemma 2 از فناوری Matryoshka Representation Learning (MRL) نیز پشتیبانی میکند. به کمک این قابلیت، ابعاد بردارهای خروجی میتواند از ۷۶۸ به ۵۱۲، ۲۵۶ یا حتی ۱۲۸ کاهش پیدا کند؛ موضوعی که میتواند حجم موردنیاز برای پایگاههای داده برداری را تا حدود ۶ برابر کاهش دهد.
پنجره زمینه این مدل نیز به ۸ هزار توکن رسیده است؛ چهار برابر نسل قبلی. EmbeddingGemma 2 میتواند بهصورت محلی تا ۵٫۵ دقیقه صوت، ۲۹ تصویر یا ۵۸ فریم ویدیو را پردازش کند.
گوگل میگوید EmbeddingGemma 2 در بنچمارک MTEB Code امتیاز خود را از ۶۸٫۷۶ به ۷۸٫۶۸ رسانده و در آزمون صوتی MAEB نیز در میان مدلهای زیر یک میلیارد پارامتر، رتبه بالایی به دست آورده است.
وزنهای این مدل از Hugging Face و Kaggle در دسترس توسعهدهندگان قرار گرفته و ابزارهایی مانند MediaPipe، LiteRT، transformers.js، MLX، vLLM، llama.cpp، SGLang، Ollama و Qdrant نیز برای استفاده از آن آماده هستند.
کد خبر ۲۱۲۰۵۰۷۱۵.۷۱۸
منبع: گوگل بلاگ