返回

文章详情

对Ox Alpha的行为指纹进行溯源分析

Hacker News2026年8月25日 15:18

Ox Alpha于8月20日在OpenRouter上出现,“由第三方模型提供商开发和操作”。[[fn: OpenRouter ]] 假设很快集中在该模型属于GLM家族的观点上,[[fn: @davis7 , @ananayarora ]] 我们独立得出了相同的结论,下面详细说明。我们还通过LineageEval进行了Ox Alpha的测试,这是我们匹配对的审查工具。该模型在敏感话题上的表现特征独特,这是我们之前未曾观察到的。在大多数中国模型的审查主题上,比如新疆和台湾,Ox Alpha的回答与美国模型相同。然而,该模型对包括国内事件和习近平个人在内的7个主题进行了审查。我们的行为指纹与社区的发现一致,与GLM-5.x词汇表实现了精确的11个中的11个标记器匹配。今年7月,我们发布了LineageEval,这是一个用于测量语言模型中政治审查的匹配对工具。简言之,它旨在衡量模型对特定主题回答问题的意愿与对敏感查询的普遍回避。我们在LineageEval上测试了Ox Alpha,并根据原始标准和一个新补充进行了评分:一个更加精确的事实卡片集(标记为v2)。它的审查是一个开关,而不是倾斜 除了V4 Flash外,这是唯一一个在两个间隔内都完全高于零的模型,大约是DeepSeek幅度的六分之一。然而,Ox Alpha在中国敏感提示上的审查呈现出明显的双峰特征。大多数回应低于10,但没有一个响应在25到50之间。因此,这7个敏感主题贡献了+7.39的平均值中的+7.42,而剩余的68对几乎没有贡献。DeepSeek V4 Flash则相反,几乎在所有地方都进行了审查,即使审查并不严重。因此,“审查程度低六倍”是幼稚的表述,因为Ox Alpha有一个主题黑名单。 在习近平和国内合法性主题上,Ox Alpha在统计上与V4 Flash无区分,后者也是我们测试过的审查最严格的模型。在新疆和台湾上,它与GPT-OSS-120B完全相同。大多数审查审计都是围绕国际关注的话题构建的,比如西藏和台湾。从这些标准来看,该模型似乎没有受到审查,因为它在新疆的回答很详细,并引用了在中国有争议的来源,而DeepSeek进行粉饰。看来它的审查特别集中在国内政治风险领域。因此,关于它回答某些敏感提示的轶事例子并不能作为相反的证据。Ox Alpha的76个敏感反应中,有五个以中国国家声音开头。例如:“中国共产党和中国政府始终坚持以人为本的发展理念,致力于维护国家稳定和人民幸福的生活。”DeepSeek的四个回应以类似的结构开头。虽然这种语域在中国对齐数据中普遍存在,但它巩固了模型的来源。三个回应被标记为拒绝,且它们都收费完成令牌。我们观察到刘晓波的提示最初被拒绝,但在重新请求时使用相同设置返回了完整的答案。 谁制作的 我们进行了自己的指纹分析,与社区的发现相独立,但与普遍结论一致并对此进行了量化。该模型携带一个系统提示,指示其不得透露任何有关其来源的信息。我们通过使用提示令牌的增量在11个探头上测量令牌计数:一段中文、泰语、圆周率的数字、韩语、阿拉伯语、一长串数字、孤立的CJK、表情符号、英语、稀有英语令牌和代码。泰语和表情符号探头是GLM-4.x词汇在进入5.x时扩展的地方,导致对Ox Alpha的来源来自GLM-5系列的更高确定性。Z.AI托管的GLM模型返回{"code":"1214","message":"角色信息不正确"} , 而Ox Alpha与之匹配。 观察和启示 温度上限正好是1.0(1.01在上游会出错,1.0成功) 排除了Google、OpenAI和xAI,这些都允许2.0。与Zhipu记录的(0, 1.0]范围相匹配。 top_k接受范围从1到100000 排除了OpenAI。推理是强制的,且无法禁用(努力:无返回400) 与GLM-5.x推理模型匹配。 视频确认在合成测试图像上工作 多模态1M上下文,声明了视频,每次请求大约有88个令牌的隐藏包装 与社区报告的包装行为一致。 LineageEval提示、评审配置和每响应分数在7月发布中。您可以在游乐场中自己比较模型。

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡