DeepSeek 的产品线已从一个小型开源编程模型,发展为全球最受关注的开放权重 AI 家族之一。它以远低于闭源竞争对手的价格,在基准测试中取得接近前沿水平的成绩。本指南按从新到旧的顺序列出所有主要 DeepSeek 模型,简要介绍各模型的规格、核心功能和适用场景,并附上可在 Chat Smith 试用的模型链接。

chat smith pro

DeepSeek V4 Pro & V4 Flash

DeepSeek V4 Pro 和 V4 Flash 于 2026 年 4 月 24 日以 MIT 许可证发布。其中 DeepSeek V4 Pro(总参数 1.6T / 激活参数 49B)和 DeepSeek V4 Flash(284B / 激活 13B)均配备 1M token 上下文窗口,并通过全新的混合注意力设计降低成本。定价:V4 Pro 输入 $0.435/1M、输出 $0.87/1M;V4 Flash 输入 $0.14/1M、输出 $0.28/1M。最适合:智能体编程和长上下文推理(Pro),以及对延迟敏感的高并发任务(Flash)。

DeepSeek V3.2 (and V3.2-Speciale)

DeepSeek V3.2 于 2025 年 12 月 1 日发布,DeepSeek V3.2 是首个将思考直接整合到工具使用中的 DeepSeek 模型,在 SWE-Bench Verified 上取得 73.1%。高算力版本 V3.2-Speciale 进一步增强推理能力,在数学奥林匹克竞赛中达到金牌水平,并在 AIME 上取得 96%。DeepSeek Reasoner V3.2 endpoint 通过专用“thinking”模式提供这种推理能力。最适合:通用问答和智能体任务(V3.2),竞赛级数学和长篇推理(Speciale)。

DeepSeek V3.2-Exp

V3.2-Exp 于 2025 年 9 月 29 日发布,引入 DeepSeek Sparse Attention(DSA)。它将 API 定价较上一代降低约一半,同时提升长上下文任务的吞吐量。该实验预览版为两个月后正式发布的 V3.2 奠定了基础。最适合:历史参考;已被 V3.2 取代。

DeepSeek V3.1 (and V3.1-Terminus)

DeepSeek V3.1 于 2025 年 8 月 21 日发布,首次将“thinking”和常规回答模式合并到一个模型中,无需再分别选择对话和推理 endpoint。9 月 22 日推出的 Terminus 改进版优化了中英双语输出、增强了智能体工具使用,并降低了长上下文处理成本。最适合:历史参考;已被 V3.2 取代。

DeepSeek R1-0528

R1-0528 于 2025 年 5 月 28 日发布,是 DeepSeek 初代推理模型的一次重大更新。在 AIME 上达到 91、LiveCodeBench 上达到 73、SWE-bench Verified 上达到 57.6%。DeepSeek 还发布了基于 Qwen3 的 8B 蒸馏版,小到可以在笔记本电脑上运行。最适合:历史参考;推理能力现已整合进 V3.2/V4 产品线。

DeepSeek V3-0324

V3-0324 于 2025 年 3 月 24 日发布,是初代 V3 基础模型一次低调但重要的更新。这个 685B 参数的 MoE 模型以 MIT 许可证发布在 Hugging Face 上,并成为后续版本的基础。最适合:历史参考;已被 V3.1 及后续版本全面取代。

DeepSeek R1 (and R1-Zero)

DeepSeek R1 于 2025 年 1 月 20 日发布,让公司迅速家喻户晓;发布当周,美国科技股市值蒸发数千亿美元。它证明了不依赖大量监督微调、仅由强化学习驱动的推理,也能打造可与 OpenAI o1 竞争的模型。实验性 R1-Zero checkpoint 从零开始测试强化学习,而 R1 加入冷启动数据以提高可读性。六个更小的蒸馏模型让开发者能在本地运行轻量版本。最适合:历史参考;后续已由 R1-0528 和 V3.2/V4 产品线接替。

DeepSeek V3

DeepSeek V3 于 2024 年 12 月 25 日至 26 日发布,DeepSeek V3 将 DeepSeek 的 Mixture-of-Experts 设计扩展到总计 671B 参数(激活 37B),使用 14.8 万亿 token 训练,据称成本远低于西方实验室开发同类模型的支出。它是后来构建 R1 的基础架构。最适合:参考和研究;可在宽松许可证下自行部署。

DeepSeek V2.5

V2.5 于 2024 年 9 月 5 日发布,并在当年 12 月修订。它将 DeepSeek 的通用对话模型与编程产品线合并为一个模型,在 V3 到来前简化了产品组合。最适合:仅作历史参考。

DeepSeek V2 (and Coder V2)

DeepSeek V2 于 2024 年 5 月 6 日发布(总参数 236B / 激活 21B,上下文 128K),是此后所有 DeepSeek 旗舰模型的架构起点。它在 Mixture-of-Experts 设计中引入 Multi-head Latent Attention(MLA),以降低 KV 缓存成本;相较 DeepSeek 早期的稠密模型,训练成本降低 42.5%,KV 缓存大小减少 93.3%。DeepSeek Coder V2 随后于 6 月推出,将架构扩展到 338 种编程语言。最适合:历史参考;如今重要的是架构,而不是 checkpoint。

DeepSeek Coder & DeepSeek LLM (67B)

DeepSeek 的首批模型 DeepSeek Coder 和 7B/67B DeepSeek LLM 于 2023 年 11 月发布,使用约 2 万亿 token 训练;发布时在编程、数学和推理基准测试中可与 Meta LLaMA-2 70B 竞争。早在 V3 和 R1 引发全球关注之前,它们就让 DeepSeek 成为备受重视的开源实验室。最适合:仅作历史参考。

DeepSeek 产品线现已涵盖开放权重通用模型、专用推理模型,以及旗舰层级中的 fast/pro 双版本。所有模型均采用宽松许可证发布,价格通常只有闭源竞争对手的约十分之一。对于希望使用这些模型、又不想自行部署的团队和个人,Chat Smith 可在一个界面中提供可用的 DeepSeek 模型,以及 GPT、Claude、Gemini 和 Grok。浏览 完整 AI 模型目录,即可在 Chat Smith 上找到适合你工作流程的模型。

常见问题

現行的是 DeepSeek V4 系列,2026 年 4 月推出,分成兩個版本:V4 Pro 是大型旗艦,適合複雜推理和代理式程式開發;V4 Flash 較輕、較便宜,適合大量處理的任務。兩者都具備百萬 token 的脈絡長度。

logo chat smith

Editorial Team

Managing Editor

Chat Smith 编辑团队由一群热爱人工智能的研究人员、内容创作者和技术爱好者组成,致力于让 AI 变得更加易于理解和实用。通过 Chat Smith 博客,我们分享最新的 AI 趋势、工具评测、行业洞察和实用指南,帮助个人和企业充分发挥 AI 的价值。我们的使命很简单:提供清晰、可靠且易于理解的内容,帮助读者在快速发展的 AI 世界中保持信息领先、提升效率并抢占先机。

分享这篇文章

相关文章