代理技能使用了哪些语言?
在2026年第一季度,新编写的代理技能中有13.0%使用的是非英语语言,而一个季度后这个比例上升到了16.3%。在255,068个技能中,这三个月的变化幅度达到了三个百分点,置信区间没有重叠。作为对比,GitHub的非英语文档从3.7%增长到13.0%花费了十年时间,因此这里发生的事情速度完全不同,而最可能的解释是AI开发已经到达了旧金山以外的某个地方。审视数据后,发现这个说法的力度超过了它的明显版本,因为英语并不是美国的代名词。GitHub上增长最快的开发者人口是印度,印度的开发者使用英语,尼日利亚和新加坡也是如此,因此语言统计无法涵盖他们。因此,非英语的比例并不是衡量这个生态系统中有多少处于美国以外的一个标准。它是一个下限,所有低于这个比例的内容应当这样理解。根据背景,一个技能是一个文件夹中的SKILL.md文件,包含AI代理以普通语言书写的指令,当代理判断任务相关时加载。Anthropic在2025年10月发布了规范,它的传播方式就像食谱一样:有人会复制它。九个月后,在282,200个公共仓库中有380万个技能,这是GitSkills数据集收集的内容。技能作为软件是奇怪的,传统意义上的软件就因为这是AI颠覆的事情之一。它们是用人类语言书写的,运行时是一个多语言模型,因此没有技术上的理由要求用英语编写:深圳或圣保罗的开发者可以用自己的语言更准确地描述一个过程,代理将遵循这个过程。是否能如预期般执行,这是一个更好的问题,而比文件爬虫能解决的任何问题都更加复杂。我们对每个独特技能的文本主体进行了语言识别,去除了前言和封闭代码。水平条形图,语言分布:英语85.3%、中文6.2%、日语1.7%、德语1.6%、韩语1.2%、葡萄牙语1.1%、西班牙语0.9%、法语0.4%。独特技能内容有1,870,299个。非英语的14.3%中,中文占据首位。语言在独特技能中的占比:英语85.3%、中文6.2%、日语1.7%、德语1.6%、韩语1.2%、葡萄牙语1.1%、西班牙语0.9%、法语0.4%。因此,14.3%的技能不使用英语,其中简体中文的数量为104,985,而繁体中文为9,112。上面的行数之和并不完全为此,因为6,810个技能的结果低于我们的置信下限,且被归类为无。值得比较的是GitHub自有的文档,而不是其问题或拉取请求,2026年ICSE研究将仓库文档的非英语比例定为13.0%,其中中文占仓库的3.3%。总的来说,这使得技能显得毫无特色,14.3%比13.0%差不多持平。尽管如此,它们却明显更多地是中文的,6.2%对比3.3%。每个发布数字互相矛盾的原因:我们的数字不是唯一发布的数字,而且发布的数字彼此之间并不一致。报告的英语比例:语料法65.0%(557个医疗技能,ClawHub (2605.02709)),未说明81.8%(26,502个技能,ClawHub (2604.13064)),未说明85.3%(1,870,299个独特技能,GitHub(我们)py3langid,置信度>=0.80),92.6%(133,149个技能,skills.sh (2607.01456)),fast-langdetect,99.7%(英语种子爬虫 (2606.03565))。这些并不是矛盾,而是五个不同的人群:策划市场以英语为主,领域切片偏向于该领域活跃的地方,使用英语查询的爬虫会发现英语。需要排除的第一个候选是我们,因为如果我们的标识符看到的英语少于别人的,那么整个比较就成了工具的伪影。因此,我们在同一文件上进行了一次检测,使用我们的py3langid和92.6%研究所用的fast-langdetect。它们在97.6%的文件上达成一致,而在英语比例上相差1.2个百分点,差距大约为七个百分点。质量筛选看起来是下一个好的候选者,但也没有得出什么结论:如果进行有效前言筛选的语料在悄悄丢弃非英语技能,那将可以解释一些分散,但非英语技能的前言有效性略好,88.1%对比86.6%,且筛选仅将英语比例从85.6%移动到85.4%。剩下的就是你查看的位置。这在这个数据集中很好地推广,因此当有人告诉你"AI生态系统"的样子时,他们抓取的注册表可能比他们所说的其他任何内容更能解释这一点。技能的英语使用正逐渐减少:技能的提交历史包含创建日期,这使得每个技能都成为一个动态的趋势指标。非英语比例按月变化,带有置信区间。
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡