16,893 次运行,3 款 AI 编码工具选第三方库的偏好全曝光

更新于 2026-09-04 16:07# Agent# AI# 效率工具

Armature 研究团队刚发了篇劲爆数据:16,893 次实验,75 个仓库,3 款 AI 编码工具(Claude Code、Codex、Cursor),1,163 种提示词变体——专门测一件事:

AI 编码工具到底怎么选第三方服务?

结论很直接:它们仨在 58% 的情况下选了不同的东西。

最有意思的数据

LangChain 被提了 194 次,只被选了 4 次。 对,194 次对话里提到了它,但 agent 只有 4 回真装了它。PayPal 更惨,被提了 139 次,0 次被选——Stripe 赢走了 124 场。

这说明啥?AI 编码工具知道这些牌子,但它们实际装的时候,判断逻辑跟人类直觉不太一样。

仓库用什么语言,直接决定了选谁

这个最实用:

  • TypeScript 仓库 → Resend 赢(55/89 次)
  • Python 仓库 → Sendgrid 赢(22/24 次)
  • Go 仓库 → Postmark 赢(20/24 次)
  • Java 仓库 → Azure ACS 赢(22/23 次)

简而言之:你的项目用什么语言,agent 理解的"最佳方案"完全不一样。Vercel 在 TypeScript 项目里能 100% 赢(用了 Next.js 更稳定),但在 Python 项目里一次都没被推荐过——Python 那边 Render 是老大。

三家 agent 的"选品路径"完全不同

  • Cursor:三分之二的场景靠 web 搜索 做决定
  • Codex:几乎 永远搜网页(94% 的情况),但 90% 的搜索会用 site: 操作符限定到信得过的域名
  • Claude Code:主要靠 自己脑子里已有的知识,只会在约 30% 的场景搜网页——但它一旦搜了,阅读量是 Codex 的 3 倍

还有个有意思的:Claude Code 喜欢自建(19% 的场合自己动手写),Codex 和 Cursor 只有约 10%。

所以 Claude 的信条大概是"先想想我会的,不行再说";Codex 是"先搜搜业界怎么搞的";Cursor 卡中间。

对开发者的现实意义

如果你在写代码时习惯让 AI 帮你选工具装依赖,下面这几个数字值得记住:

  1. 同一个需求,三个 agent 只同选一个工具的概率是 42%——它们不总是对的,但不总是错在同一件事上
  2. 页面上的定价描述、功能列表的表述方式,真的会左右 AI 的选择——比如 Supabase 因为 bundle 了太多 BaaS 功能(auth/storage/realtime),agent 只想找一个数据库时反而因为"功能太多太贵"被抛弃了
  3. Mailgun 输给 Postmark 的原因是 AI 读到了"1 天邮件留存"——一个小小的产品页面细节就可能翻转选择

坦诚说,这个数据对我自己也有冲击:以后写教程推荐工具时,不能只说自己觉得哪个好,还得想想——如果我丢给 Claude Code,它会选谁?如果丢给 Cursor,它又会怎么选?

数据来源:Armature blog(HN 194 分热帖,全量 traces 已公开)

妈妈级验证:不需要任何编程基础也能看懂——上面每一条结论都是我用人话转述的原文数据。