DeepSeek:通过自我访谈逆向工程人工智能助手
我运行了 manish.sh。我写关于人工智能工具以及当你推动大型语言模型(LLMs)时它们的行为。这是《Inside LLMs》系列的一部分——采访一个聊天模型,询问它的思维方式,然后将细节与已发布的研究相对照。Kimi K2.6 的条目首先出现;这是 DeepSeek 的后续。我第一个问题听起来简单:你实际上知道些什么关于你自己?我预计会听到市场营销类的回复。相反,DeepSeek 将答案分为观察、推断和猜测。那时我意识到这次采访可能真的很有趣。来自 DeepSeek 采访聊天的截图,用于这个帖子。它像工程师在白板上画图。然后它称自己为不可靠的证人。听起来很诚实。在聊天结束后,我还是打开了公开论文——那就是故事分叉的地方。没有权重转储。没有提示泄露。一场长时间的采访,与 arXiv 进行了对照。当 DeepSeek 说“我在猜测”时,我保留了这个标签。滚动到最后的互动实验室。快速说明:一次聊天,导出时间为 2026 年 7 月 21 日。DeepSeek 说最新版本,知识截止于 2025 年 5 月,没有标记为 DeepSeek-R1。自我报告,而不是白皮书。60 秒的总结 主题:采访模型,然后检查谦虚的答案与公开论文的对照——没有权重转储。行为洞察:它仔细区分观察、推断和猜测——对于它如何描述自己很有用。硬限制:它无法看到自己的权重、路由或注意力图。聊天与论文:它在著名的公共规格(256 个专家,671B/37B 参数)上有所保留,而 V3 文档中清楚地列出了这些——跳到检查聊天与公共论文的对照。实用规则:查看 arXiv 获取架构数字;使用聊天获取行为和提示直觉。如何阅读这篇文章:将其视为纪录片。问题→简短回复→我的反应→图示或简短列表→要点→钩子。访谈记录不是证据。关于架构数字,请直接跳到论文检查。每一章开头都有一行概述其主要术语。章节 第1部分 — 自我知识 为什么采访 DeepSeek 内省的局限性 第2部分 — 提示与上下文 消息前的内容 它如何逐字撰写 第3部分 — 思维、工具、失败 隐藏的推理,双重含义 工具和记忆(启用时) 幻觉和错误信心 安全性与个性 第4部分 — 引擎与审计 简单术语中的 MoE 和 MLA 长上下文注意:事实与猜测 检查聊天与公开论文的对照 需要记住的内容 逐字稿、实验室、来源 1. 为什么采访 DeepSeek(自我知识,架构)大多数“这个模型是如何工作的”帖子都从论文开始。我从一次聊天开始。 我:“你是哪种模型?你实际上知道自己的架构多少——而你又在猜测什么?” DeepSeek:我在我还没要求这种框架之前,它就以三类回答了——观察、推断、猜测。这种冲突是整个前提。一个可以像工程师一样发言的助手,然后承认无法看到自己的权重,比一份白皮书摘要更有趣。当它提到 MLA、MoE、SFT 和 RLHF 时,我还没有进行详细解释。我们会讨论到这些。目前,重要的点更简单:DeepSeek 清楚地区分了它自己知道的和它正在推断的内容。它对自己的声明(以及它提供的来源): 声明 其提供的来源 它是 DeepSeek,最新版本 系统身份 知识截止:2025 年 5 月 系统/配置 变压器 + MoE(每个输入仅激活一部分参数) 公开的 DeepSeek 披露 训练:预训练 → SFT → RLHF 公开/训练知识 家谱 V2 → V3(共享 + 路由专家,MLA) 公开论文 可以读取系统提示 + 此聊天 直接观察 它还说在系统提示中没有标记为“推理模型”——与 DeepSeek-R1 不同。它推断自己是一个通用的指令/聊天模型。公共 DeepSeek 列举的创新来自于论文(不是从读取它自己的权重中): MLA — 压缩 KV 缓存以获取长上下文 DeepSeekMoE — 共享 + 路由专家 无辅助损失负载平衡(V3)——动态偏置以保持专家平衡 多标记预测 — 训练目标;聊天解码仍通常一次一个标记 FP8 混合精度训练——更便宜/更快的训练 它早期自愿提供的教育性猜测:BPE 分词器、RoPE 位置、预层归一化,以及“早期版本宣布了最多 ~1M 标记”的上下文——后来的重新标记为低置信度假设。 2. 内省的局限性(内省,权重) 我:“你自己实现的哪些部分是完全对你隐藏的?” 本章纠正了最大的神话。这有点像让你背诵你自己大脑中神经元之间的每个连接。你会不断使用它们,但你无法直接检查它们。对模型来说,永远保持隐藏的内容: 权重、层数、隐藏大小、总参数、每个标记的专家路由、抽样前的 logits 分词器词汇和确切的标记边界 特定标记之间的隐藏状态和注意力图 精确的训练文档,完整的
本站免费、广告极少。如果觉得有帮助,可以请我们喝杯咖啡 —— 任何金额都对持续运营有实际帮助。
☕请我喝杯咖啡