← All posts

各家AI在OpenClaw🦞上的能力榜单

有人做了一个专门测试AI Agent在OpenClaw小龙虾🦞上的能力排行榜,叫 PinchBench。

PinchBench测的是标准化的OpenClaw任务,有固定的验收标准,评分一部分靠自动化检测,一部分靠LLM裁判。这已经是目前业界做得比较严谨的评测方式了。

截至2月底最新数据,33个模型上榜,看几个关键数字:

第一梯队(90%以上) GPT-5.3 Codex 97.8% / Gemini 3 Flash 95.1% / Claude Sonnet 4.5 92.7%

第二梯队(80-90%) GPT-4o 85.2% / DeepSeek V3.2 82.1%

掉队区(40%左右) Qwen3-max-thinking、Step-3.5-flash 均约40%

有趣的是,同一家出的模型,分数可以差很远。OpenAI的GPT-5.3 Codex拿了97.8%,自家另一个GPT-5.2却只有65.6%。"同门师兄弟"差距这么大,说明Agent能力跟模型整体智力不完全是一回事。

榜单是开源的,任务和评分标准都在GitHub上公开,自己也可以跑测试。

榜单地址:pinchbench.com

Follow my WeChatWeChat 公众号 QR codeScan to follow