选择AI模型:一个提示,11个模型,不同的结果
我们刚刚与OpenRouter建立了合作关系,这使我们能够提供两个新功能:首先,您的项目可以通过我们的AI网关使用OpenRouter上的任何模型。这意味着,如果您的Web应用程序为最终用户提供基于AI推理的功能,那么现在您可以选择更多符合任何任务和预算的模型。其次,我们扩展了可通过Agent Runners使用的前沿编码模型的选择。Agent Runners是您在Netlify中获取的聊天提示框,它使您可以从头开始构建新项目或对现有项目进行迭代。现在可选择的模型包括备受关注的最新开放模型,如Kimi K3、GLM 5.2和DeepSeek V4,所有人均可使用。我们之所以称之为Agent Runners,是因为我们在其中运行一个完整的编码代理,而不是一个简化版。到目前为止,我们已支持Claude Agent、OpenAI Codex和Gemini CLI,这些模型经过优化,可以运行来自这些提供商的模型。我们为这些代理提供额外的技能和有关当前项目的上下文,以便代理确切知道哪些Netlify功能可用(例如,Netlify数据库、AI网关或身份验证),何时使用它们,以及如何使用它们。但为了有效地驱动各种新模型,我们新增了受欢迎的开源OpenCode作为新的代理选择。但随着选择的增加,必然会有问题:我怎么知道哪个模型适合我?我是否错过了某些实际上更好或者更具成本效益(让我可以用我的积分做更多)的东西,或者是否有会让我大开眼界的模型,就像互联网说的那样?如今,关于此的FOMO(害怕错过)非常普遍。为了给您一些见解,以下是我们在多种模型上运行相同提示时所学到的……这些模型现在都可以在Netlify上供您使用。您可以在我们创建的这个网站上看到我们测试的所有模型的结果,并查看完整报告。我们测试了什么在Netlify内部,我们使用AXIS来自动评估模型,这是我们最近开源的工具。我们为AXIS提供了多种测试案例:构建新网站的提示,然后对其进行迭代。我们指示AXIS测试这些提示的代理和模型,并定义AXIS应执行的检查,这些检查将作为分数来评估生成的网站。这些检查主要集中在生成网站的正确功能上,而不是其设计,例如:在用户需求时是否使用了数据库?在这种情况下,是否正确使用了Netlify数据库?在某些简单静态网站即可满足需求的情况下,我们还确保生成的网站不会过度设计,而不设置任何数据库。如果某个模型在测试分数上落后,我们将不在Agent Runners中提供该模型。如果模型太频繁地未能正确应用我们的某项技能,或者事物确实有效但积分成本似乎被夸大,那么问题可能出在该技能上(在这种情况下我们会优化该技能)。但是这一次,我们希望为您提供一些更立即有用的信息:当您使用不同模型构建梦想时,每个模型的积分消耗差异巨大,您会得到什么?结果是什么样的?我们测试了三个相对简单的用例:一个本地咖啡店的网站。LLMs非常喜欢为本地咖啡店制作网站!初始提示很简单,一个没有花哨数据库或类似的静态网站即可满足需求。然后我们做了一个后续提示,要求提供一个简单的预定座位选项,并检查模型如何处理这个请求。一个简单的待办事项Web应用程序,多个用户可以查看和添加任务。这要求设计简单,但从一开始就需要一个共享数据库。然后我们请求支持每个项目的可选照片上传,并检查模型是否使用了适当的Netlify原语。一个“我可以做什么”的Web应用程序,用户可以输入他们家中有哪些成分,并使用AI建议菜谱。该网站本身非常简单,但我们希望检查生成的网站是否正确使用我们的AI网关为用户生成菜谱。对于这些案例,我们将展示生成网站的外观,评论显著问题,并比较每个生成所消耗的积分数量。当然,这将是一个比我们的内部测试套件更为主观的测试,但这也将是一个非常有趣的测试。我们希望知道您对结果的看法!所有模型均在Netlify上以默认设置运行。一个值得特别提及的点是,我们目前在低努力模式下专门运行GPT 5.6 Sol,默认情况下为您提供一种比Opus更经济的替代方案,同时仍能提供相当不错的结果(如您将在下面看到的那样)。然而,努力设置现在由您控制,我们的默认设置可能会随着时间的推移而变化。此帖子将只涵盖第一个场景:咖啡店的静态页面,而后续帖子将专注于超越这一简单用例。即使对于这个简单案例,还有很多内容需要回顾,因此让我们开始吧。场景 #1:
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡