返回

文章详情

DeepSeek-V4-Flash 更新

Hacker News2026年7月31日 06:08

日期:2026-07-31 DeepSeek-V4-Flash 更新 DeepSeek-V4-Flash API的官方发布现已进入公测阶段。API调用方法保持不变 —— 只需将模型名称设置为deepseek-v4-flash即可使用最新版本。代理能力显著增强,基准结果远超V4-Pro-Preview:终端基准 2.1:82.7 NL2Repo:54.2 Cybergym:76.7 DeepSWE:54.4 Toolathlon验证:70.3 代理上次考试:25.2 自动化基准(公开):25.1 DSBench-FullStack:68.7 DSBench-Hard:59.6 注意1:在公共基准集中的代码代理任务中,官方DeepSeek-V4-Flash使用DeepSeek Harness最小模式(即将发布)作为框架进行测试,最大努力水平为top=0.95,温度=1.0。注意2:DSBench-FullStack是一个内部全栈开发测试集,DSBench-Hard是一个内部编码代理难题测试集。官方的V4-Flash原生支持响应API格式,并为Codex专门进行了调整。关于具体配置,请参阅文档。DeepSeek-V4-Flash-0731与DeepSeek-V4-Flash-preview保持相同的模型架构和大小,仅进行了重新再训练。注意:此更新仅升级DeepSeek-V4-Flash API。DeepSeek-V4-Pro API和APP/WEB模型保持不变。DeepSeek-V4-Pro的官方发布将很快跟进。日期:2026-04-24 DeepSeek-V4 DeepSeek API现在支持V4-Pro和V4-Flash,通过OpenAI ChatCompletions接口和Anthropic接口提供。要访问新模型,base_url保持不变,模型参数应设置为deepseek-v4-pro或deepseek-v4-flash。两个遗留API模型名称,deepseek-chat和deepseek-reasoner,将在三个月后(2026-07-24)停用。在当前阶段,这两个模型名称分别指代deepseek-v4-flash的非思考模式和思考模式。更多详情,请参见此文档。日期:2025-12-01 DeepSeek-V3.2 deepseek-chat和deepseek-reasoner已升级为DeepSeek-V3.2。deepseek-chat对应于DeepSeek-V3.2的非思考模式,deepseek-reasoner对应于DeepSeek-V3.2的思考模式。DeepSeek-V3.2-Speciale 通过临时端点提供:base_url="https://api.deepseek.com/v3.2_speciale_expires_on_20251215"。与V3.2相同的定价,无法调用工具,直到2025年12月15日15:59(UTC时间)可用。更多详情,请参见此文档。日期:2025-09-29 DeepSeek-V3.2-Exp deepseek-chat和deepseek-reasoner已升级为DeepSeek-V3.2-Exp。deepseek-chat对应于DeepSeek-V3.2-Exp的非思考模式,deepseek-reasoner对应于DeepSeek-V3.2-Exp的思考模式。更多详情,请参见此文档。日期:2025-09-22 DeepSeek-V3.1-Terminus deepseek-chat和deepseek-reasoner已升级为DeepSeek-V3.1-Terminus。deepseek-chat对应于DeepSeek-V3.1-Terminus的非思考模式,而deepseek-reasoner对应于其思考模式。此更新保持模型的原始能力,同时解决了用户反馈的问题,包括:语言一致性:减少了中英混用和偶尔异常字符的出现;代理能力:进一步优化了代码代理和搜索代理的性能。日期:2025-08-21 DeepSeek-V3.1 deepseek-chat和deepseek-reasoner已升级为DeepSeek-V3.1。deepseek-chat对应于DeepSeek-V3.1的非思考模式,而deepseek-reasoner对应于其思考模式。DeepSeek-V3.1的关键更新:混合推理架构:单一模型支持思考模式和非思考模式;推理效率提高:与DeepSeek-R1-0528相比,DeepSeek-V3.1-Think在显著更短的时间内提供答案;增强代理能力:经过后期训练优化,新模型在工具使用和智能代理任务中取得重大改进。SWE-bench验证:66.0 SWE-bench多语言:54.5 终端基准:31.3 日期:2025-05-28 deepseek-reasoner deepseek-reasoner模型升级至DeepSeek-R1-0528:增强的推理能力,在基准测试中显著提升(Pass@1)AIME 2025:70.0 → 87.5(+17.5) GPQA:71.5 → 81.0(+9.5) LCB_v6:63.5 → 73.3(+9.8) Aider:57.0 → 71.6(+14.6)注意:复杂推理任务可能会消耗比遗留R1版本更多的标记。前端开发优化生成的网页和游戏现在具有更好的美学。减少幻觉大幅减少了遗留R1版本中存在的幻觉问题。JSON输出与函数调用支持函数调用性能:Tau-bench得分:53.5(航空公司)/63.9(零售)日期:2025-03-24 deepseek-chat deepseek-chat模型升级至DeepSeek-V3-0324:增强的推理能力,基准性能显著提升:MMLU-Pro:75.9 → 81.2(+5.3)

赞助内容

NordVPN Next-gen Antivirus

本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。

请我喝杯咖啡