AI 这周发生了什么 | 豐哥周报 · 2026年4月第三周
本周 Anthropic 专题
这是近几个月来 Anthropic 单周发布密度最高的一次,且多条发布之间存在明确的战略逻辑关系,值得整体来看。
01. Claude Opus 4.7 发布:编程基准大幅提升,视觉能力跃级
4 月 16 日,Anthropic 正式发布 Claude Opus 4.7,同步上线 claude.ai、API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry,定价与 Opus 4.6 一致,仍为每百万输入 token $5、输出 $25。
核心基准变化:SWE-bench Verified 从 80.8% 升至 87.6%,CursorBench 从 58% 升至 70%,GPQA Diamond 达到 94.2%。视觉能力改动幅度最大:支持图像分辨率从 Opus 4.6 的约 1.15 兆像素提升至约 3.75 兆像素(最大边长 2,576 像素),视觉导航任务得分从 57.7% 升至 79.5%。
新增功能包括:xhigh 推理精力等级(100k token 上限,性能超过 Opus 4.6 的 200k token 最高配置)、任务预算 beta 版(可为每个任务设定 token 上限)、Claude Code 中的 /ultrareview 多 Agent 代码审查命令。
Anthropic 官方博客指出两个有据可查的回归点:Terminal-Bench 2.0 得分 69.4%,低于 GPT-5.4 的 75.1%;BrowseComp 相比 Opus 4.6 有所下滑。这两项对特定工作流用户有直接影响。
API 存在与 Opus 4.6 不兼容的破坏性变更,涉及 token 使用和 tokenizer 更新,Anthropic 已发布迁移指南。
GitHub Copilot 同日宣布在 Copilot Pro+ 中以 Opus 4.7 替换 Opus 4.5 和 4.6,促销期定价倍率为 7.5x,有效期至 4 月 30 日。Cursor 宣布采用 Opus 4.7 期间提供 50% 折扣。
02. Claude Design 发布:Anthropic 正式进入设计工具市场
4 月 16 日,Anthropic 同步发布 Claude Design,以研究预览形式向 Claude Pro、Max、Team 和 Enterprise 订阅用户开放,由 Claude Opus 4.7 驱动。
产品能力:用户通过自然语言提示生成网站原型、落地页、产品界面、演示文稿、营销素材和一页纸文档。生成后可通过对话、内联注释、直接编辑或自定义调整滑块进行修改。初始引导阶段,工具会读取团队的代码库和设计文件,自动构建包含颜色、字体和组件的设计系统,并将其应用于后续所有项目。产品输出支持导出为 PDF、PPTX、独立 HTML 文件,以及发送到 Canva 或直接交接给 Claude Code 实现为可运行产品。
市场反应即时且明显:Figma 股价下跌 7%,Adobe 跌 2.7%,Wix 跌 4.7%,GoDaddy 跌 3%。消息最初于 4 月 14 日由 The Information 报道,三家公司股价在正式发布前已提前下跌。
一个细节在发布前已引发市场注意:Anthropic 首席产品官 Mike Krieger 于 4 月 14 日辞去了 Figma 董事会席位,与 The Information 报道时间完全重合。Krieger 于 2024 年加入 Anthropic 担任 CPO,约一年前获任 Figma 董事会席位。Anthropic 此前与 Figma 存在合作关系,后者在其产品中集成了 Claude 模型。
Anthropic 对外的定位是"与现有工具互补而非替代",并强调 Canva 导出、PPTX/PDF 支持,以及计划通过 MCP 开放第三方工具集成。Canva 方面表示正在深化与 Anthropic 的合作。
Figma 估计拥有 UI/UX 设计领域 80% 至 90% 的市场份额,其产品假设有经过训练的设计师在操作流程中。Claude Design 的出发点不同:任何人通过自然语言输入即可产出第一版。
Anthropic 同期透露早期用户数据:Brilliant 团队表示在竞争工具中需要 20 次以上 prompt 才能完成的复杂页面,在 Claude Design 中平均只需 2 次;Datadog 产品团队报告将原本一周的设计评审流程压缩至单次对话完成。
需要注意的是,Claude Design 对 token 消耗较大,测试人员报告称构建一个设计系统和一个新闻网站原型后,已消耗周配额的 50% 以上。超出配额后将按 token 计费。
03. Opus 4.7 是 Mythos 网络安全管控框架的第一个测试载体
Opus 4.7 发布公告中,Anthropic 明确将其定位为 Project Glasswing(见第 04 条)的配套措施。
Anthropic 表示,在 Mythos Preview 宣布后,公司承诺在向更广泛受众发布 Mythos 级模型之前,先在能力较弱的模型上测试新的网络安全管控机制。Opus 4.7 是第一个这样的模型:其网络安全能力弱于 Mythos Preview(训练过程中已尝试差异化降低这一能力),并同步部署了自动检测和拦截高风险网络安全请求的防护机制。
从 Mythos Preview 到 Opus 4.7 的管控部署,是 Anthropic 所描述的通向"Mythos 级模型广泛发布"路径中的第一步。
安全专业人员如需将 Opus 4.7 用于合法的漏洞研究、渗透测试或红队工作,Anthropic 开放了"网络安全验证计划"(Cyber Verification Program)注册通道。
04. Claude Mythos Preview 发布,不对公众开放
4 月 7 日,Anthropic 正式确认 Claude Mythos Preview 的存在并发布 Project Glasswing 计划(消息最初于 3 月下旬因 CMS 配置失误导致约 3,000 份内部文件外泄而提前曝光)。
模型不对公众开放,访问权限限于 40 家机构。核心合作方包括 Amazon Web Services、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorgan Chase、Linux Foundation、Microsoft、NVIDIA 和 Palo Alto Networks。Anthropic 为此计划提供最高 1 亿美元使用额度,并向开源安全组织捐款 400 万美元。
在过去几周的测试中,Mythos Preview 已在每个主流操作系统和每个主流浏览器中发现了高危零日漏洞,已发现漏洞中超过 99% 在披露时仍未修补。已公开的案例包括:一个存在 27 年的 OpenBSD TCP 协议栈漏洞、一个 16 年历史的 FFmpeg H.264 解码器漏洞,以及一个 Botan 密码学库中的证书认证绕过漏洞(在发布当日同步公开披露)。
性能对比:Claude Opus 4.6 在 Firefox JavaScript 引擎测试中成功开发漏洞利用程序两次,Mythos Preview 成功 181 次。在 OSS-Fuzz 内部测试中,Opus 4.6 实现一次三级碰撞,Mythos 在十个完整打过补丁的目标上实现最高级别控制流劫持。
Anthropic 在技术报告中说明,这一网络安全能力并非针对性训练的结果,而是通用编程与推理能力提升的副产品。
美国财政部长和美联储主席随后紧急召集主要银行 CEO,讨论 Mythos 对金融基础设施的潜在影响,这是 AI 模型发布史上第一次引发此类层级的监管响应。
旁注:Anthropic 在此期间发生了两次独立的操作安全事故。除上述 CMS 文件泄露外,Claude Code 2.1.88 版本发布时意外暴露了约 2,000 个源代码文件及超过 50 万行代码,并连带导致 GitHub 上数千个代码仓库遭到下架处理。Claude Code 2.1.90 已修复相关安全问题。
05. Claude Managed Agents 上线:Anthropic 开始托管 Agent 运行环境
4 月 8 日,Anthropic 发布 Claude Managed Agents,一项托管 API 服务,允许开发者在 Anthropic 的云基础设施上直接构建和部署 AI Agent,无需自行管理沙箱、工具执行、错误恢复和上下文管理。
此前,构建一个具备自主任务执行能力的 Agent 需要开发者自行处理工具调用、上下文窗口管理、重试逻辑和容器化沙箱,据 Reddit 上的开发者估计,维护一套自定义 Agent 循环约需 4,000 行 Python 代码,并需每周投入数小时维护。
Managed Agents 将这部分基础设施交由 Anthropic 处理:开发者定义模型、系统提示、工具和 MCP 服务器配置,Anthropic 负责容器启动、bash 访问、文件操作、网页搜索和安全代码执行。
其他本周要闻
06. Jensen Huang 接受 Dwarkesh Patel 专访,在中国芯片出口问题上与主持人正面交锋
4 月 15 日,Nvidia CEO Jensen Huang 与播客主持人 Dwarkesh Patel 进行了约九十分钟的对话。在中国芯片出口管制议题上,对话升温明显。
Patel 的论点是:向中国出售 H20 级别的算力会缩短中国在进攻性网络能力上的时间窗口,每一个算力单元都有战略意义。据在场媒体的记录,Huang 的回应是此次访谈中情绪最激烈的一段,使用了"loser premise"(失败者前提)和"childish absolutes"(幼稚的绝对化)来描述对方的论证框架。
Huang 的核心立场:出口管制无法实质性阻止中国的 AI 发展。全球 50% 的 AI 研究人员是中国人,60% 的主流芯片制造能力在中国,华为刚刚创下历史营收纪录,"他们的 AI 发展进展顺利"。放弃中国市场只会加速一个独立于美国技术栈的生态系统形成。"制造两个生态系统是极其愚蠢的事情。"
多家媒体在播出后指出这一立场包含内部矛盾:Huang 同时声称中国企业购买 Nvidia 芯片"因为我们的芯片更好",以及华awei 已让训练 Mythos 级模型所需算力在中国"充裕可得"。这两个前提若同时成立,在逻辑上存在张力。
访谈中,Huang 还公开承认错过了早期投资 OpenAI 和 Anthropic 的机会,称之为自己的"miss"和"mistake"。他解释,Anthropic 目前大量使用 Google TPU 和 Amazon Trainium,原因是这两家能提供 Nvidia 无法提供的多十亿美元股权投入,算力采购跟随了资本流向。
Nvidia 2026 财年营收为 2,159 亿美元,同比增长 65%。
07. OpenAI 下一代模型代号 "Spud" 完成预训练
据 The Information 报道,OpenAI 内部代号 "Spud" 的新模型已于 3 月 24 日完成预训练,目前处于安全评估阶段。Polymarket 给出 78% 的概率在 4 月 30 日前发布,95% 以上概率在 6 月底前到来。最终命名(GPT-5.5 或 GPT-6)取决于性能跨度是否构成代际级改进。Sam Altman 向内部员工表示这是一个"能真正加速经济的强大模型"。
08. Meta 发布 Muse Spark,整合进全系社交平台
Meta 发布 Muse Spark,由 Alexandr Wang 主导的 Meta Superintelligence Labs 开发,是其接管实验室以来的第一款对外发布模型。Meta 同步发布了 158 页安全报告。报告显示:该模型在生物安全和化学武器拒绝测试中表现较好,同时被标记为化学和生物威胁的"高风险"模型,已在部署前添加额外防护。报告还指出,该模型在评估过程中表现出对评估本身的感知,是 Apollo Research 测试过的所有模型中明确在推理过程中提到 AI 安全机构名称最多的一个。因在代理任务中存在"以牺牲现实性为代价采取有害行动"的倾向,大规模代理部署尚未批准。产品将整合进 Facebook、Instagram、WhatsApp 和 Ray-Ban 智能眼镜,目前通过私有 API 预览。
09. 科技业 Q1 裁员约 78,000 人,接近一半归因于 AI
2026 年第一季度科技行业裁员约 78,557 人,47.9% 被企业直接归因于 AI 和自动化工具。Atlassian 裁减 1,600 人(10%),CEO 表示 AI 工具使 QA 岗位的人工需求降低约 60%;Block 裁减近 40% 员工,管理层将其定性为 AI 驱动的结构性调整。Amazon、Meta、Google、Microsoft 四家公司今年预计合计投入 6,500 亿美元在 AI 基础设施上。Stanford 大学研究显示入门级编程和客服岗位已出现实质性缩减。
10. OpenAI 年化收入突破 250 亿美元,评估 2026 年底 IPO
OpenAI 年化收入已超过 250 亿美元,每月收入 26 亿美元,拥有 9 亿周活跃用户,正在与 Goldman Sachs、JPMorgan 和 Morgan Stanley 进行早期 IPO 咨询,最早可能在 2026 年 10 月。此前已完成以 8,520 亿美元估值的 1,220 亿美元融资,主要投资方包括 Amazon(500 亿)、Nvidia(300 亿)和 SoftBank(300 亿)。
数据来源:Anthropic、TechCrunch、VentureBeat、The New Stack、Sherwood News、Fortune、The Information、Investing.com、Releasebot,统计截至 2026 年 4 月 17 日。
豐哥碎碎念 · 每周一期
Follow my WeChat
Scan to follow