一個模型搞定所有媒體:Google EmbeddingGemma 2 把多模態搜尋裝進你的口袋
Google DeepMind 的 EmbeddingGemma 2 是一個 7.4 億參數的開源模型,將文字、程式碼、圖片、影片與音訊映射到同一個 768 維向量空間,文字模式僅需 191MB 記憶體。
多年來,多模態搜尋一直有個不太光彩的秘密:所謂的「多模態」,通常是把兩個以上的單一模態嵌入模型用投影層和祈禱黏在一起。2026 年 10 月 6 日,Google DeepMind 走了一條不同的路。該公司新的開放權重嵌入模型 EmbeddingGemma 2,並不是把視覺編碼器硬接在文字編碼器上——它從訓練之初,就將文字、程式碼、圖片、影片與音訊映射到單一共用的 768 維向量空間。而且這一切在 7.4 億參數的規模下完成,採用寬鬆的 Apache 2.0 授權,純文字工作負載僅需約 191MB 記憶體。
最後那個數字才是重點。這是一個為手機——而不是資料中心——設計的前沿實驗室模型。
EmbeddingGemma 2 到底是什麼
EmbeddingGemma 2 是 Google DeepMind 基於 Gemma 4 解碼器架構打造的開放多模態嵌入模型。2025 年 9 月發布的原版 EmbeddingGemma 是從 Gemini Embedding 蒸餾而來的純文字嵌入器,續作則走向原生多模態:一個主幹網路、一個嵌入空間、五種輸入類型——文字、原始程式碼、圖片、影片與音訊。
它的設計目標簡直像一份本地優先(local-first)應用的檢查清單:
- 統一向量空間。 一張吉他的照片、「吉他」這個詞、一段有人彈吉他的錄音、一場演奏的影片,全都會落在同一個向量空間中彼此相近的位置。跨模態檢索——「找出這支影片中有人說 X 的那一刻」——不需要任何橋接機制就能運作。
- 真正的小。 以 2026 年的標準,7.4 億參數非常小。Google 報告稱,量化後的純文字權重約佔 191MB 主動記憶體,在 Pixel 11 Pro 上完整多模態模型約 567MB。
- 快到能進 UI。 低延遲的嵌入生成,意味著在消費級硬體(包括 EdgeTPU 級加速器)上可以做到邊打字邊搜尋與即時檢索。
- 完全開放。 權重以 Apache 2.0 授權上架 Hugging Face,發布當天就有 Ollama 支援。沒有使用限制、沒有申請門檻、沒有 API 依賴。
至於它在 Google 產品線中的位置:原始能力低於託管的 Gemini Embedding 2 API,但當資料不能離開裝置——或者你不想為了索引整個相簿而按 token 付費時,它就是你要的模型。
數據表現
原版 EmbeddingGemma 的名聲,來自在 MTEB(Massive Text Embedding Benchmark)基準上,稱霸 5 億參數以下模型的美國英語、多語言與程式碼排行榜。EmbeddingGemma 2 保留了多語言文字的強度並進一步延伸——最值得注意的是,Google 稱其在 MTEB(Multilingual) 的程式碼檢索表現上,較前代有顯著的 9.92 分提升。
Google 描繪的更大圖景是:在文字、程式碼與多模態檢索基準上,於同級模型中取得頂尖成果——而這個參數量在一年前根本不會被認真考慮用於跨模態工作。一年前,有競爭力的多模態嵌入意味著十億參數以上的模型或託管 API。把這一切壓到 10 億以下——事實上是 8 億以下——而且採用原生(而非投影式)模態對齊,才是真正的新聞重點。
為什麼重要:端上 RAG 技術棧補齊了
每個檢索增強(RAG)管線都有兩半:負責組合答案的生成器,以及負責找到相關素材的檢索器。生成器那一半在 2025 到 2026 年間已經本地化——小型語言模型好到可以在手機和筆電上運行。檢索器那一半卻落後了。這個尺寸的純文字嵌入器早就存在,但如果你的素材是截圖、語音備忘錄或影片,你要麼塞一個重量級多模態編碼器,要麼呼叫雲端 API——後者直接違背本地優先 AI 的初衷。
Google 明確把 EmbeddingGemma 2 定位為缺失的那塊拼圖:與 Gemma 4 這樣的生成模型搭配,它可以建構完整理解複雜多模態資料的端上 RAG 管線。用文字描述索引你的相機膠卷。用打字的查詢搜尋兩小時的演講錄音。根據錯誤訊息截圖自動分派客服工單。全部離線、全部隱私、全部在人們已有的硬體上完成。
隱私這一點不是附註。歐盟資料落地規範、企業保密政策,以及消費者日益高漰的期待,讓「把每個像素都送到雲端嵌入 API」越來越行不通。一個能在 600MB 記憶體內運行的 Apache 2.0 模型,徹底改變了合規的算術——多模態搜尋變成受監管產業不需要曠日廢時法務審核就能部署的東西。
競爭格局
開放嵌入模型的版圖一直圍繞文字整併。Qwen 的嵌入模型家族與一長串 BERT 級檢索器主宰了本地 RAG 技術棧,但它們共享同一天花板:單一模態。與此同時,多模態嵌入市場實際上已經被託管 API——OpenAI、Cohere,以及 Google 自家的 Gemini Embedding——所壟斷,因為做好模態對齊需要規模。
EmbeddingGemma 2 同時攻擊這兩個陣營。對開放純文字嵌入器,它以相近的成本提供嚴格更多的能力。對託管多模態 API,它提供零邊際成本、零通往資料中心的延遲、零資料外流。代價是絕對品質——前沿託管嵌入器在原始基準上仍得分更高——但對長尾應用而言,「夠好而且在裝置上」勝過「最好而且在別人的雲裡」。
這對 Gemma 生態系也是一步戰略棋。每個用 EmbeddingGemma 2 建構檢索的開發者,都有一條通往 Gemma 4(生成)的自然升級路徑,並在超出本地硬體負荷時升級到 Google 的託管技術棧。這裡的開放權重與其說是慷慨,不如說是漏斗——但確實是開發者能真正受益的漏斗。
值得知道的但書
基準數據來自 Google 自家的報告;獨立的 MTEB 類排行榜需要數週才能消化新參賽者,在第三方評測出爐前,「同級最佳」的說法應保持一貫的審慎。191MB 是量化後純文字權重的數字——Pixel 11 Pro 上的完整多模態推理為 567MB,這仍然出色,但不是頭條數字。而且 7.4 億參數設下了真實的天花板:對單語英語文字檢索而言,相近或更小的專用文字嵌入器在純品質上可能仍有競爭力。
結論
EmbeddingGemma 2 不是本週最大的模型,也不會稱霸任何絕對排行榜。但它可能是 Google DeepMind 本季發給開發者最有用的東西。它補齊了本地優先 AI 技術棧——生成器加檢索器——合計記憶體不到 1.5GB,授權條款允許任何人在任何地方部署。多模態搜尋作為雲端專屬奢侈品的時代,即將大幅縮短。
Sources
- [1] https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
- [2] https://developers.googleblog.com/embeddinggemma-2-the-developer-guide/
- [3] https://huggingface.co/google/embeddinggemma-2
- [4] https://www.marktechpost.com/2026/10/06/google-deepmind-releases-embeddinggemma-2-a-740m-open-multimodal-embedding-model-built-on-gemma-4/
- [5] https://thenextweb.com/news/embeddinggemma-2-on-device-europe
- [6] https://superpowerdaily.com/posts/google-releases-embeddinggemma-2-for-offline-search-across-photos-audio-and-video