我对36个流行的MCP服务器进行了代理可用性评分。三分之一得了D或F
2026-07-21 代理 MCP 工程 你的MCP服务器可以是100%符合规范的,但仍然可能无法被代理使用。模型上下文协议规范告诉你如何传输工具:JSON-RPC框架、能力协商、模式形状。它没有说明一个模型是否能够实际使用你所提供的内容——它是否能从你的目录中选择正确的工具、正确填充参数,或者在每个请求上花8k标记解析你的模式。我以此为生,将第一方和第三方MCP连接器集成到生产AI代理中,而我不断看到同样的失败:服务器通过了每一个合规检查,但模型调用了错误的工具、产生了虚假的参数,或者完全忽视了工具。问题从来不在协议层。它们出现在没有人检查的部分:描述、命名、模式设计。因此,我写了mcpgrade——一个Lighthouse风格的MCP服务器评分卡。一个命令,无需API密钥,几秒钟内报告:npx mcpgrade --stdio "npx -y your-mcp-server" 然后我将它应用于36个流行的服务器。结果并不理想。结果 可排序的完整表格:[ https://tengli.dev/mcp-leaderboard.html] 。简短版本(静态分析,特定时间快照;标记为(归档)的服务器是未维护的参考实现,包括在内是因为它们仍然被广泛安装和复制):班级最高(A):brave-search(归档),exa,google-maps(归档),slack(归档),perplexity-ask,@shopify/dev-mcp,@apify/actors-mcp-server,airbnb,figma-developer-mcp,tavily,gitlab(归档),elastic,shrimp-task-manager,以及更多——36个中的15个。班级最低(D/F),36个中的11个——而且这些并不是业余项目:MongoDB的官方服务器(66,66个错误),Notion的官方服务器(62),Airtable(69,66个错误),todoist-mcp-server(67,110个错误),GitHub的归档参考服务器(67,44个错误),以及排在最底部的firecrawl-mcp(57,134个错误)。另外两个服务器(Stripe,Supabase)由于无法使用虚拟凭证扫描而被排除在评分之外。发现1:生态系统存在未文档参数的流行几乎每个D/F服务器的描述评分为零,而其模式、命名和标记评分都很好。有一个规则主导:D004——参数没有描述。firecrawl:134个错误中的132个是未文档参数。url,formats,jsonOptions——模型仅获得名称和类型,别无其他。todoist:110。MongoDB和Airtable:各66。根本原因几乎在所有服务器的源代码中都能看出:模式是从zod或OpenAPI定义生成的,但没有人添加.describe()。类型系统知道url:字符串。模型需要知道哪个URL,以何种格式,具有什么限制。你的模式生成器正在悄悄地剥夺你工具所拥有的最重要信号。如果你从这篇文章中能得到一件事:打开你的服务器,计算没有描述的参数,并修复它们。这是你在代理可靠性上可以花的最高杠杆时间。发现2:这是文档纪律,而不是目录大小——但大小使得纪律更难我的第一次数据分析表明“小目录胜出”:大多数得分95+的工具数量较少,而24-26个工具的服务器聚集在D/F类别。然后shrimp-task-manager以15个工具得到了A/96——文档严谨、命名紧凑、每个描述独特。因此,诚实的版本:良好文档的大目录是可能的;只是比较少见。每添加一个工具,就需写一个描述,另一个可能冲突的名称,另一个需要保持紧凑的模式。纪律不是默认的可扩展的。(无论如何,大小仍然会给你带来压力:整个目录被序列化到每个请求中。)发现3:合规性和可用性是不同的维度更新最频繁的服务器并不是最可用的。归档的Slack参考服务器——没有人维护的代码——得分A/97,因为曾经有人手动记录了每个工具和每个参数。与此同时,一些积极开发的商业服务器却毫无描述地交付参数。代理可用性更多的是一个写作问题,而不是工程问题。合规检查器无法测量它。这就是mcpgrade填补的空白。(一个值得鼓舞的反面例子:在写这篇文章时,context7发布了一个修复了所有缺失参数描述的新版本——从C提升到完美的静态分数。当需求明显时,生态系统可以快速发展。)发现4:我对静态分数检查了一个真实模型。可怕的数字是拒绝。静态检查是一个代理,因此我构建了--eval:它合成了现实的单步任务(每个任务为每个必需参数嵌入具体值),向模型展示完整目录,并测量它是否选择了正确的工具,填充了有效参数。校准细节和方法论:docs/eval-calibration.md。成本:小模型每个服务器几分钱。两个值得你关注的结果:静态发现预测实时混乱。在文档良好的服务器上,工具选择准确率为100%。在firecrawl上降至84%——而遗漏的情况
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡