保护我们的自由开源软件公共资源免受大型语言模型的侵害
概述:Codeberg e. V.的成员投票通过了两项关于"人工智能"和大型语言模型(LLMs)的动议。我们承诺不会使用您的任何数据来训练LLM,并解释了计划中的使用条款变更对"气氛编码"项目意味着什么。我们相信,LLMs危及整个自由/开源软件生态系统。Codeberg e. V.的年度大会是将权力交到活跃成员手中的会议。提议将在现场讨论,然后异步投票。由于大型语言模型(LLMs)是一项新兴但具争议的技术,因此有两项投票与Codeberg对这一技术的立场相关也就不足为奇了。为期14天的投票期于昨天结束,两个提案均获得通过。第一次投票是关于Codeberg e. V.在使用您的数据训练LLMs方面的立场声明。正如我们隐私政策中所述,"我们并不想依赖您的数据",这同样适用于将我们的用户和项目数据用于使用或训练生成的"AI":Codeberg forge及其相关服务不会也不将项目和用户的代码或数据用于训练"人工智能"工具,例如大型语言模型,这些工具的目的是根据其训练输入生成输出。作为一个协会,我们认为这些技术与负责创建和维护自由和开源软件不兼容。第二次投票更具争议,但也获得通过,358票赞成,144票反对(还有14票弃权),活跃会员的投票率接近50%。这意味着我们将修改使用条款,以禁止"气氛编码项目"。我们将在文章末尾分享对实际影响的看法。我们都在为贪婪的LLMs买单。LLMs是一项非常昂贵的技术,随着提供它们的公司开始弥补各自的投资,这些成本不断上升。对于那些使用并明确订阅这些服务的人来说,费用不仅仅是可见的。这些费用并非单单隐含在"正常"的云服务订阅中,这些订阅交叉资助了您从未要求的"创新新功能"。LLMs成本高昂,以至于公司大规模地将成本外包给那些不使用它们的人和整个社会。硬件价格、能源消耗和环境损害的增加——我们都在为此买单!由于无意义的抓取而导致的服务器压力。在过去的帖子中,我们已经概述了Codeberg的基础设施如何定期受到计划抓取托管在Codeberg上的所有代码以训练其LLMs的公司的网站爬虫的重负。在Codeberg,我们很高兴提供对代码的免费和开放访问。只需运行git clone并享受即可。不幸的是,这些爬虫反而试图读取Codeberg上的每一单独页面,无论这是否有意义。这包括所有不同问题过滤器的变体、Git历史以及Git历史中任意时间点的实际文件——即使它们仍然相同。这些不必要的访问导致了昂贵的数据库查询,降低了我们所有人的服务质量,需求我们的系统管理员付出大量工作,还迫使我们花时间建立防御机制,而不是开发新功能。这些机制也影响新用户和现有用户,因为我们不得不对他们所期望的工作流程施加限制或直接阻止他们,使他们在Codeberg的体验变得更糟。没有开发团队使用LLMs与您的代码合作会给您带来一阵肾上腺素激增。您可以快速开发,像拥有一个大型团队一样构建东西。只不过您并没有这样一个团队。实际上,您(通常)是一个人,正在和一个将能量转化为代码的统计机器合作。似乎许多“气氛编码者”没有意识到他们实际上没有一个社区在他们周围。他们建立项目时仿佛拥有社区,并根据此花费资源。我们看到一些项目有大量代码活动、频繁且大型的CI/CD测试、频繁和大量的发行版。有时,感觉支持的平台数量超过了实际用户的数量。对我们来说,看到仅有一个开发者且几乎没有用户的项目消耗的资源与一些在Codeberg上节俭运营的最大社区项目相同甚至更多,是令人感到荒谬的。我们认为Codeberg不应该用我们珍贵的捐赠资金来支持大型鬼项目的托管。硬件采购正变得头痛。LLMs的训练和部署大幅提高了购买硬件的成本,尤其是固态硬盘和内存。举个例子:我们几年前以700欧元采购的驱动器,现在已经涨到3700欧元——而且通常缺货。因此,在Codeberg上托管代码的成本正在上升。虽然我们拥有自己的硬件,因此未必会受到不断上涨的云租赁成本的直接影响,但这意味着
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡