Transformer突然有了对手 - SubQ
什么是SubQ?
这是首个采用sub-quadratic sparse-attention architecture (SSA)的前沿大语言模型,拥有 1200 万 token 的上下文窗口。据称在 100 万 token 时,预填充(prefill)速度比 FlashAttention 快 52 倍,成本不到 Claude Opus 的 5%。
技术核心:SSA 通过内容依赖的选择机制,仅关注相关的 token 关系,从而实现计算量和内存的线性扩展,而非传统稠密注意力的二次复杂度。该模型采用分阶段训练,能够在保持长上下文可靠推理能力的同时,避免常见的稀疏注意力缺陷。
基准测试与访问:在评测中表现出色,包括 RULER 128K 达到 95%,SWE-Bench Verified 达到 81.8%。目前可在 subq.ai 申请 SubQ 模型及编码 Agent 的早期访问,技术博客和模型卡也已同步发布。
这个新闻在X上炸了。为什么?先说说Transformer2017年,谷歌的研究员发表了一篇论文,题目叫《Attention Is All You Need》。
这篇论文定义了此后十年 AI 的基础架构,Transformer。ChatGPT 里的那个 T,就是它。
论文里有一个设计,当时没人太在意,因为在小规模实验里根本不是问题。
这个设计是:每个词,都要跟所有其他词比较一遍。
听起来没什么。但数学上有一个无法回避的后果。
你输入的内容越长,计算量不是线性增长,是平方增长。内容翻一倍,算力翻四倍。翻两倍,算力翻十六倍。
你想让 AI 一次性读完一个完整的代码库,一份几百页的合同,或者半年的项目记录,然后给你一个连贯的分析,这件事现有的 Transformer 架构做不到。不是不会,是代价高到不现实。
整个行业心知肚明,于是大家开始造补丁。
第一种叫 RAG,检索增强生成。既然全部塞进去太贵,那就先用搜索引擎找出最相关的几段,只把那几段喂给模型。便宜,快,能跑。
代价是你丢掉了上下文。合同第三页的一个定义,决定了第七十页一个条款的效力。RAG 找到了第七十页,但不知道去找第三页,因为关键词不匹配。
第二种是分块处理。把长文档切成小段,分批喂给模型,最后汇总。错误会叠加。每一步的小偏差,汇总时都被放大。你拿到的不是一个连贯的判断,是几十个局部判断拼出来的马赛克。
第三种是多 Agent 协作。把大任务拆成小任务,分配给不同的 AI 实例,主控 Agent 最后整合。任务拆分本身就是一门学问,拆错了,再好的 Agent 也救不了你。更荒唐的版本我们见过,那些 Agent 根本没有独立运行,只是同一个 AI 在换马甲演独角戏。
行业用十年时间,把这些补丁打得越来越精巧。RAG 有了更好的向量数据库,分块有了更聪明的切割策略,多 Agent 有了更复杂的调度框架。整个产业链,向量数据库、编排框架、上下文管理工具,都是围绕这个根本限制建立起来的。
但没有人动过那把刀子本身。
这个问题一直都存在。
开头说到,SubQ 的核心是一个叫 SSA 的注意力机制,Subquadratic Sparse Attention。标准 Transformer 假设每个词都可能跟所有其他词相关,所以全部比较一遍。但在实际训练好的模型里,绝大多数词对之间的关联权重都接近于零,这些计算是在做无用功。
SSA 不提前假设,根据内容本身判断哪些词对真的重要,只计算那些,跳过其他的。计算量从平方增长变成线性增长。上下文翻一倍,算力翻一倍,不再是四倍。
在一百万 token 的上下文长度下,SubQ 的注意力计算速度比标准架构快 52 倍。第三方验证的基准测试 RULER 得分 95%,和 Claude Opus 4.6 的 94.8% 基本持平。成本的差距更离谱:同等测试,SubQ 花 8 美元,Claude Opus 花约 2600 美元。
研究结果已经跑到了 1200 万 token。
AI 厂商宣传的上下文窗口,是模型能接受多少 token 输入。但这个数字不告诉你模型能在多长的输入里可靠地找到并整合分散的信息。这两件事,往往差得很远。
Subquadratic 用来测试的基准叫 MRCR v2,专门测后者:在极长的上下文里,找到多个分散的线索,把它们整合成一个连贯的答案。SubQ 的得分是 65.9%,Claude Opus 4.6 是 78.3%,GPT-5.5 是 74%,Gemini 3.1 Pro 是 26.3%,Claude Opus 4.7 是 32.2%。
SubQ 还没有赢过最好的对手。但它用新架构、低成本跑进了前三。
研究团队来自 Meta、Google、Oxford、Cambridge、ByteDance、Adobe、Microsoft,11 个博士研究员。种子轮融资 2900 万美元,估值 5 亿美元。目前开放两个产品:面向开发者和企业的 API,可以在单次调用里处理整个代码库;命令行工具 SubQ Code,可以接入 Claude Code、Codex、Cursor,声称降低约 25% 的费用,代码库探索速度快十倍。还有一个搜索工具 SubQ Search,初期免费。
可以在 demo-098xs.subq.ai 申请试用。
技术报告说即将发布,目前公开的是第三方验证的基准数字,不是完整论文。
研究界不是没有人尝试过次二次方的架构。线性注意力、状态空间模型、Mamba、各种稀疏注意力变体,做了很多年。结论几乎一致:降低计算量不难,难的是同时不牺牲准确率。之前所有的尝试都在某个地方妥协了,要么检索能力变差,要么只能处理近距离的依赖关系,要么精度掉到不可用的程度。
LessWrong 上有人分析说,大多数所谓次二次方注意力机制,本质上只是常数倍的改进,不是架构层面的突破。SubQ 是不是例外,要等完整论文出来才能验证。
这就是为什么补丁一直在打,刀子一直没人动。不是懒,是真的难。Magic 提醒我们,宣布做到和真的做到,是两件事。
ChatGPT 的名字里有个 T,代表 Transformer,代表 2017 年那篇论文。那篇论文的作者们,现在散落在谷歌、OpenAI、Anthropic、各大高校,继续在 Transformer 的框架里工作。
没有人会轻易放弃一个已经证明有效的东西。
但如果 SubQ 的架构是真的,那些围绕根本限制建立起来的产业链,价值会重新被定价。不是立刻,不是全部,但方向是清楚的。
如果不是,那些补丁还会继续打下去,越来越精巧,越来越昂贵。
数据来源:Subquadratic 官网(subq.ai)、技术文章《How SSA Makes Long Context Practical》、SiliconANGLE、The New Stack,2026年5月5日发布。
Follow my WeChat
Scan to follow