← All posts
各家AI在OpenClaw🦞上的能力榜单
有人做了一个专门测试AI Agent在OpenClaw小龙虾🦞上的能力排行榜,叫 PinchBench。
PinchBench测的是标准化的OpenClaw任务,有固定的验收标准,评分一部分靠自动化检测,一部分靠LLM裁判。这已经是目前业界做得比较严谨的评测方式了。
截至2月底最新数据,33个模型上榜,看几个关键数字:
第一梯队(90%以上) GPT-5.3 Codex 97.8% / Gemini 3 Flash 95.1% / Claude Sonnet 4.5 92.7%
第二梯队(80-90%) GPT-4o 85.2% / DeepSeek V3.2 82.1%
掉队区(40%左右) Qwen3-max-thinking、Step-3.5-flash 均约40%
有趣的是,同一家出的模型,分数可以差很远。OpenAI的GPT-5.3 Codex拿了97.8%,自家另一个GPT-5.2却只有65.6%。"同门师兄弟"差距这么大,说明Agent能力跟模型整体智力不完全是一回事。
榜单是开源的,任务和评分标准都在GitHub上公开,自己也可以跑测试。
榜单地址:pinchbench.com
Follow my WeChat
Scan to follow