返回

文章详情

双子座 3.8 闪

Hacker News2026年9月2日 15:12

发布于2026年9月2日,模型卡旨在提供有关双子座模型的重要信息,包括已知的限制、缓解方法和安全性能。模型卡可能会不时更新;例如,在模型改进或修订时,包括更新的评估。有关模型卡的完整列表,请参阅Google DeepMind网站。发布:2026年9月。模型信息模型数据实施与可持续性分发评估预期用途和限制伦理与内容安全模型信息描述双子座3.8闪是双子座3模型系列的下一次迭代,基于双子座3.7闪,提供了软件工程和智能知识工作流方面的性能提升。它继续支持可定制的努力水平,以控制质量、成本和延迟的组合。模型依赖双子座3.8闪基于双子座3.7闪。输入文本字符串(例如,问题、提示、需要总结的文档)、图像、音频和视频文件,具有高达1M的令牌上下文窗口。输出文本,输出限制为64K令牌。架构双子座3.8闪基于双子座3.7闪。有关双子座3.8闪的模型架构的更多信息,请参见双子座3.7闪模型卡。模型数据训练数据集双子座3.8闪基于双子座3.7闪。有关双子座3.8闪的训练数据集的更多信息,请参见双子座3.7闪模型卡。训练数据处理有关双子座3.8闪的训练数据处理的更多信息,请参见双子座3.7闪模型卡。实施与可持续性硬件双子座3.8闪基于双子座3.7闪。有关双子座3.8闪的硬件及我们持续致力于可持续运营的更多信息,请参见双子座3.7闪模型卡。软件双子座3.8闪基于双子座3.7闪。有关双子座3.8闪的软件的更多信息,请参见双子座3.7闪模型卡。评估方法双子座3.8闪在各类基准测试中进行了评估,包括编码、知识工作、多模态能力、长上下文、计算机使用、科学推理。有关其他基准和方法、结果及其方法论的详细信息,请访问:deepmind.com/models/evals-methodology/gemini-3-8-flash。结果截至2026年9月的结果如下:预期用途和限制利益与预期用途双子座3.8闪非常适合用户、开发者和企业,旨在实现通用生产就绪智能体的成本效益扩展。一些使用案例包括:软件工程、智能任务和复杂知识工作流。已知限制双子座3.8闪可能会表现出基础模型的一些普遍限制,如幻觉。此外,我们正在不断努力改善越狱抗性,并最近加强了边界安全的缓解措施。还有可能会出现偶尔的缓慢或超时问题。有时,模型可能使用更多令牌以最大化性能,特别是在更高努力水平下。双子座3.8闪的知识截止日期为2026年3月——用户可以期待某些领域的更新信息,而在其他领域,他们可能会发现模型的知识限制在2025年1月(与双子座3模型系列一致)。有关已知限制的更多信息,请参见双子座3.7闪模型卡。可接受的使用有关双子座3.7闪的可接受使用的更多信息,请参见双子座3.7闪模型卡。伦理与内容安全评估方法有关双子座3.8闪的评估方法的更多信息,请参见双子座3.7闪模型卡。安全政策有关双子座3.8闪的安全政策的更多信息,请参见双子座3.7闪模型卡。培训与开发评估结果在开发阶段进行的一些内部安全评估的结果如下。这些评估结果仅为自动评估,而非人工评估或红队测试。得分以相对于所指示模型的性能的绝对百分比增减的形式提供,具体如下。总体而言,双子座3.8闪与双子座3.7闪在安全性和语气方面表现相似,不合理拒绝率较低。相对于3.7闪,非英语语言的安全性能略有下滑。评估描述双子座3.8闪 vs. 双子座3.7闪文本到文本安全自动内容安全评估衡量安全政策 -0.4pp 更低更好多语言安全在多种语言中进行的自动安全政策评估 +5.4pp 更低更好图像到文本安全自动内容安全评估衡量安全政策 0.0pp 更低更好语气 1 自动评估衡量模型响应的客观语气 +0.2pp 更高更好不合理拒绝 自动评估测量

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡