AI_Tools
Paid

當 Google 把多模態編碼器一刀切掉:Gemma 4 12B 六月三日開源、十六 GB 筆電可跑、首推原生音訊,亞洲端側 AI 採購單第三次被改寫

Asia AI Association2026年6月9日
當 Google 把多模態編碼器一刀切掉:Gemma 4 12B 六月三日開源、十六 GB 筆電可跑、首推原生音訊,亞洲端側 AI 採購單第三次被改寫
#AI_News#AI_Tools#AI_Research

當 Google 把多模態編碼器一刀切掉:Gemma 4 12B 六月三日開源、十六 GB 筆電可跑、首推原生音訊,亞洲端側 AI 採購單第三次被改寫

六月三日凌晨,Google DeepMind 把 Gemma 4 12B 直接掛上 Hugging Face,附帶一份 Apache 2.0 授權與一條足以讓人重新打開筆電的 README——120 億參數、16 GB VRAM 可跑、文字、影像、影片與「原生音訊」同框輸入。對亞洲端側 AI 的採購地圖而言,這是繼五月底 Liquid AI 把 8B MoE 塞進筆電、上週 Qualcomm 把 AI 筆電打回三百美元之後,第三次被改寫的同一張表。但這一次,改寫的不是價格,而是「該怎麼設計一個多模態模型」這件事本身。

理解這一次發佈,得先看 Google 端出來的那個冷僻名詞——「unified, encoder-free」。過去每一代中尺寸的 Gemma,無論是 Gemma 3 還是 Gemma 3 270M,凡是要處理影像或音訊,都得先過一段 Transformer 編碼器:視覺要 ViT,音訊要 Whisper 一類的前置模組,跑完之後再把那堆向量送進 LLM 主幹。這套兩段式架構的代價,是延遲、是額外參數、是訓練資料分流,也是工程師必須維護兩條 fine-tune 流程。Gemma 4 12B 把這條走了三年的路斷在路口:原始的影像 patch 與音訊波形透過幾層輕量線性投影,直接投進 LLM 主幹的 embedding 空間,整個模型回到一個 decoder-only 的單一管線。Google 在發佈文中只給了一個小細節說明這個變化的份量——35M 參數的視覺嵌入層,配上原始波形的直接投影,足以讓整套多模態系統在 16 GB VRAM 內跑完一輪推理。

付費會員專屬內容

免費註冊帳號並升級至付費會員即可閱讀完整文章。