← All posts

打字机和印刷机:Google 新模型快 4 倍的秘密

现在所有主流大语言模型,工作方式都一样:预测下一个词。你输入一句话,模型算出最可能跟在后面的词,输出,再算下一个,再输出。Gemini、GPT、Claude,全是这套。一个词一个词往后推,不能跳,不能回头。就像打字机,每次只能按一个键。这套方法够用,但有人开始想另一个问题。AI 生成图片,不是一个像素一个像素画出来的。图像扩散模型(Diffusion Model)的做法是:先铺一张随机噪声图,然后一遍遍迭代,逐步把正确的内容"显影"出来。Midjourney、Stable Diffusion 都是这个原理。那文字能不能也这样做?不是从左到右一个词一个词预测,而是先铺出一段乱的占位词,然后多轮迭代,把整段文字同时修正出来?有人做了。谷歌刚发布了 Diffusion Gemma。DiffusionGemma 的做法和图像扩散模型一样:先铺一块乱的占位词,然后多轮迭代,把正确的词一个个锁定,用锁定的词作为上下文再修正其他词,直到整段文字收敛出来。一次处理 256 个 token,全部同时生成,同时互相参考。

01

模型优势

这给了它一个传统模型没有的能力:双向注意力。生成时每个词都能看见其他所有词,不像自回归模型只能看左边。这让它在"需要先知道结尾才能写好开头"的任务上有天然优势,比如代码填空、补全中间缺失的逻辑。还有一个工程效率上的好处。传统模型在云端跑,服务器可以把几千个用户请求打包成一批一起算,GPU 跑满没问题。但本地单用户场景,GPU 大部分时间在等,就等下一个 token 算完。并行度跑不起来,算力白白浪费。DiffusionGemma 一次算 256 个 token,一口气给 GPU 足够多的计算量,让硬件真正跑满。结果是在 NVIDIA H100 上跑出 1000+ tokens/秒,RTX 5090 上 700+ tokens/秒,是同规模自回归模型的 4 倍。模型本身是 26B 参数的混合专家架构(MoE),但推理时只激活 3.8B,量化之后放进 18GB 显存,高端消费级显卡能跑起来。

02

存在局限

Google 自己承认,DiffusionGemma 的输出质量低于标准 Gemma 4。这是实验性模型,不是生产级产品。另外这 4 倍速度优势,只在本地单用户场景有意义。云端大规模并发时,传统模型因为能批量处理,反而更省成本。还有一点:Apple Silicon Mac 因为是统一内存架构,不一定能享受到同样的加速。

03

适用场景

什么场景真正适合它?Google 给的答案是:行内编辑、实时代码生成、快速迭代,以及一些"需要全局视野才能做好"的任务,比如自动补全中间缺失的代码,或者生成格式一致的结构化文本。因为它双向注意力,所有 token 在生成时互相可见,不像自回归模型只能看左边。这让它在"先知道结尾才能写好开头"的任务上有天然优势。数独解题、代码填空,都是例子。

04

开放状态与探索意义

模型已经在 Hugging Face 上开放下载,Apache 2.0 许可证,可以商用。这还是一个实验,距离取代 Gemma 4 很远。但它探索的这条路值得留意:不是更大、更贵,而是换一种生成方式,把硬件利用率提上去,把本地推理的延迟打下来。

Follow my WeChatWeChat 公众号 QR codeScan to follow