返回

文章详情

这些俄罗斯数学家教会了AI模型如何在不使用语言的情况下进行交流

Wired2026年9月2日 18:20

我最近见到了一些才华横溢的俄罗斯数学家,他们向我展示了一种人工智能模型通过类似于机器心灵感应的方式进行交流的方法。这些数学家在一家名为Mostik的初创公司工作——“Mostik”是俄语中“桥”的意思。这暗示了该团队的方法,允许不同的模型使用其权重中找到的数学值进行交互——这些数学值决定了提示如何转变为输出。在实践中,这意味着一个更大模型的能力可以更高效地输入到一个较小的模型中,以提高其智能。该初创公司利用这种方法构建了一个模型,该模型迅速崛起,成为ARC-AGI 3竞赛的顶尖选手,这是一个众所周知的针对AI模型的艰难竞赛。(他们不愿告诉我更多,因为他们想赢得比赛。)不过,为了演示这一理念,他们还在两个中国开放权重模型之间建立了一个桥梁:GLM-5.2的最大版本,拥有7530亿个参数;以及一个可以在移动设备上运行的4亿参数的Qwen-3.5版本。最终的混合系统仅花费完整GLM模型的五分之一,其性能正好介于两者之间。“在机器学习中,众所周知,模型的组合表现优于单个模型,”Mostik的首席执行官Sasha Malysheva在我喝咖啡时告诉我。Malysheva开发了这种方法,并分享了公司内的一个玩笑:AI的未来像是猜测一头猪的重量。在数学圈内,人们普遍知道一小撮随机的人可以更准确地估计一头猪的重量,当他们的猜测被结合和平均时。就像共同估计猪的重量一样,结合多个AI模型的输出往往能获得更好的结果。通常,这涉及将一个模型的输出输入到另一个模型中,这通常花费大量时间和金钱。然而,Mostik团队想出了让AI模型彼此交流的方法,无需生成文本输出。如果这种方法得以推广,可能会提升开放权重模型的价值,使其能够更好地与前沿实验室如Anthropic和OpenAI等提供的封闭专有模型竞争。Malysheva表示,结合许多不同模型可能成为推动AI进步的更好方法。“我个人认为,未来不会有单体模型,或者模型的能力不会来自于扩展,”她告诉我,指的是将模型做大并输入更多数据的策略。“如果Mostik能将前沿模型与特定领域的模型配对——想想生物学、物理学等——那么将会训练出更多专业化的模型,”来自AI软件公司Lovable的技术负责人Vladimir Arustamian说道,他了解Mostik团队。“这个团队只用了几个月的时间,就已经有了我预计需要几年才能实现的东西。”Mostik的技术意味着“你可以在不让大模型处理整个循环的情况下,接近大模型的质量,让你仅用一个较小的模型就能获得实质性的改进,”与该公司技术相关的谷歌DeepMind前科学家Karl Tuyls表示。对于任何需要以尽可能高效的方式运行模型的人来说,这种方法是显而易见的。日内瓦大学的教授、2010年菲尔兹奖获得者Stanislav Smirnov是Mostik的首席科学家。他表示,寻找两个AI模型之间的共同点出乎意料地困难。“似乎还没有合适的数学语言,”他说。在此期间,Mostik的方法是一个更字面意义上的弥合差距的方法。Smirnov表示,Mostik的工作也可能揭示有关AI模型实际功能的新事物,以及这与人脑的运作方式的比较。Smirnov说,更深层的数学分析可能会揭示AI模型和人类在处理困难问题时推理方式的共同性。在我们的咖啡会议上,Malysheva告诉我,她在哥哥告诉她她无法解决他正在学习的数学奥林匹克的问题后才发现自己对数学的天赋。几年后,她在圣彼得堡的顶尖学校之一学习。更最近一些同龄人警告她,桥接方法可能太难以实现。“他们说这对于一个年轻女孩来说可能太难了,”她说。“我决定需要证明他们错了。”这是Will Knight的AI实验室通讯的一个版本。可以在这里阅读之前的通讯。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡