DeepSeek
概述
DeepSeek(深度求索)是2023年7月在中国浙江省杭州成立的人工智能研究企业,同时也是该公司发布的大语言模型(LLM)系列的名称。创始人为广东籍的梁文锋,他同时也是量化对冲基金幻方(High-Flyer)的创始人。DeepSeek在开源阵营中以极低的训练成本实现了接近商用顶级模型的性能,被视为2025年初撼动全球AI产业格局的代表性案例。
主要内容
创立背景与母公司
DeepSeek起源于幻方资本(High-Flyer Capital)的AI研究组织。梁文锋自2021年前后起便持续获取大规模GPU集群,并以在量化交易中积累的资本与基础设施为基础,于2023年将DeepSeek分拆为独立法人。与一般的风险投资融资模式不同,这是一种以自有资金和自有算力资源开展研究的独特结构。
主要模型谱系
- DeepSeek LLM(2023年11月):首个公开模型,参数规模为67B。以中英文性能的平衡为目标。
- DeepSeek-V2(2024年5月):引入MoE(Mixture of Experts,混合专家)结构与MLA(Multi-head Latent Attention,多头潜在注意力),大幅降低了推理成本。自此“高性价比”的形象得以确立。
- DeepSeek-V3(2024年12月):总参数671B、每token激活参数约37B的MoE模型。据披露,其训练耗时约278.8万GPU小时(以H800计),以约为业界普遍认知十分之一的成本而备受关注。
- DeepSeek-R1(2025年1月):基于强化学习的推理(reasoning)模型。号称在数学、编程、逻辑领域达到OpenAI o1级性能,公开后立即成为热门话题。此后陆续公开了R1-Zero、蒸馏(distill)版本等众多衍生模型。
技术特点
DeepSeek的核心技术差异化在于效率。通过MoE架构在推理时仅激活部分专家层,并以MLA减少KV缓存占用量。此外还应用FP8混合精度训练、多token预测(MTP)等,同时降低训练与推理成本。据悉R1系列采用了GRPO(Group Relative Policy Optimization,组相对策略优化)技术,无需额外的大规模监督学习数据,仅凭纯强化学习便提升推理能力。
开源战略与生态
DeepSeek以MIT许可证公开模型权重,广泛允许商业性使用。据此,全球云服务商(AWS、Azure、NVIDIA NIM等)以及海内外企业纷纷在其平台中搭载DeepSeek模型,同时也为小规模企业创造了可在自有服务器上进行微调的环境。
最新动态
2025年1月,DeepSeek应用登上美国苹果App Store免费应用榜首,引发英伟达股价单日暴跌约17%的“DeepSeek冲击”。这一事件对“开发前沿模型必须投入巨额资本”的普遍认知提出了疑问。此后DeepSeek接连公开V3与R1的后续版本(V3-0324、R1-0528等),持续改进性能。2025年,各国监管机构就数据安全与个人信息问题提出质疑,部分公共机构与企业也出现了限制使用DeepSeek的动向。与此同时,开源阵营中大量参考DeepSeek架构的衍生模型相继涌现,低成本高效率模型的竞争不断加速。在韩国国内,通信运营商、门户网站与初创企业将DeepSeek模型整合进自家服务,或推出增强韩语性能的微调模型的事例也在增多。
相关主题
- [[大语言模型]]
- [[开源AI]]
- [[强化学习]]
- [[英伟达]]
- [[AI芯片]]
- [[中国IT产业]]