返回

文章详情

一个严肃的人工智能产品会是什么样子?

Hacker News2026年9月28日 11:02

每一个“人工智能”工具都缺少重要的功能,如果你想与它们进行真正的工作,这些功能是必不可少的。如果这些功能存在,它们会是什么样子?我对当前这一代“人工智能”产品的一个问题是,它们似乎并不认真对待自身的基本前提。我看到许多谄媚的聊天机器人声称自己是解决问题的严肃工具,我想,这并不是一个解决问题的工具的样子。即便还未谈到前沿实验室存在的巨大伦理问题,但正是对它们作为产品组成的这种印象使我在与它们互动时感觉到,它们似乎更像是一种诈骗,而不是一个软件产品,这是一种旨在让我感到自己在与一个没有真实能力的产品互动的骗局,企图让我陷入一种虚假的安全感,以致我可以相信它。前沿实验室当然是最坏的罪犯,但这里的每一条批评同样适用于Ollama(如果有什么的话,由于可用模型本身的明显较差,这种需求甚至比前沿实验室更为迫切)。在这里,我将列出一些可能说服我相信一个基于LLM的产品,尤其是一个专注于研究或软件开发的产品,实际上是认真致力于帮助我做有用的事情的功能。把“检查错误”作为一项首要功能这是最大的问题,也是我写这篇文章的主要原因。这是一个被普遍承认的事实,即人工智能无法可靠地提供信息。我可以引用大量关于这一事实的新闻文章和研究,但没有必要。每一个聊天机器人都在其用户界面的核心部分以细则声明承认这一点。Gemini说“人工智能可能会犯错误,因此请仔细检查回应”,Claude说“Claude是人工智能,可能会犯错误。请仔细检查回应。” ChatGPT说“ChatGPT可能会犯错误。检查重要信息。”每当我看到最后一个时,我就想,我怎么知道什么“信息”应该是“重要”的。所有这些警告的文字都很小且呈灰色,显然是为了推卸责任,而不是为了帮助任何人。这是所有这些产品的核心局限性。检查其输出是使用它们的工作流程中的一部分:你绝对不能跳过或有所削减,否则就会给自己和你传达其输出的任何人带来风险。并且,很容易跳过或削减这一过程,且在每一个拐角处都会鼓励你这样做,因为“只需相信输出”是节省时间的最快方式。一个认真对待这一弱点的聊天机器人产品,在使用时会将一个复选框放在其输出的每一个声明旁边。这将是一个两列的工作表,第一列是LLM的输出,第二列是人类的注释,解释验证这一声明所需的工作,以及一个大复选框,你只能在确信已充分检查其声明后勾选它。编码助手也需要有某种形式的这一功能。现在,这一过程被推迟到代码评审,这意味着它是一种黑暗模式,微妙地鼓励“作者”将这项工作转给他们的代码审阅者,而自己却从未查看过。再一次,“这可能没问题,我不需要检查”是节省时间并快速完成PR的最快方式。编码工具可能甚至应具备在运行测试之前检查代码的某种功能。正如供应商们自己承认的,烧费你的“人工智能”令牌并不只是昂贵,你还可能在人工智能上消耗更多计算资源。在将你的差异发送到完全耗尽你测试计算集群之前能够检查一下是很有用的。如果你的产品告诉我它会犯错误,而我必须检查错误,但却给我零工具来检查错误,我就无法认真对待它。更多引用以供检查,更多细节大多数聊天机器人更喜欢给出一个答案,而不是引用。在我个人的使用中,我发现当被要求提供一份带有明确来源的引用清单时,它们会在清单中途“感到无聊”,并在某个时候停止包括引用。当机器人确实包括引用时,它们以这样的方式呈现,即在搜索结果中仅显示域名的行内注释,字体小得几乎无法辨认,且图标同样无法辨认,边长还小于16个像素。这是相反的。我意识到这些引用确实来自某处,为了减少虚假信息,所有主要提供商支持某种形式的“基础”功能,而这些几乎无法读取的引用链接引用的是RAG管道中的实际结构,而不仅仅是潜在的虚构。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

☕请我喝杯咖啡