Featured image of post DeepSeek V4终于发布,但它留下的5道主观题还没有答案

DeepSeek V4终于发布,但它留下的5道主观题还没有答案

原文摘要 文|周鑫雨 资料整理|钟楚笛 编辑|苏建勋 杨轩 靴子终于落地。 被调侃“Next Week”近3个月的DeepSeek V4,终于显露真身。 1.6T的最大参数量、1M的上下文窗口、针对Agent的性能优化,以及基于MoE(混合专家模型)和稀疏注意力机制DSA,降低计算和显存需求——这些曾被外界纷纷猜测的参数和性能,随着V4的官宣,一锤定音。\nDeepSeek V4性能测评结果。 姗姗来迟的原由,与V4将训练框架从英伟达迁移到华为昇腾上有关,也与DeepSeek内部的决策变动有关。我们得知,2025年年中,DeepSeek曾面临一次较为严重的训练失败。 “当时,DeepSeek面临重新适配芯片的问题。”一名知情者提到,“内部有关训练方向的意见也不完全统一。梁文锋提出了一些自己的要求,但在执行层面很难折中。” 不过,与外界关于“新模型支持多模态生成和理解”的猜测不同,V4依然是个语言模型。暂缓多模态生成的训练策略,主要源于算力和现金的掣肘。 多名知情者告诉《智能涌现》,DeepSeek的对外融资窗口,是2026年4月中旬打开的。内部的导火索,是DeepSeek需要更多资金支持,训练参数规模更大的模型,同时,留住和招纳更多的顶级人才。 “1.6T的参数量与OpenAI、Anthropic等顶级厂商的模型相比,并不具有绝对的竞争力。”一名从业者对我们提到,很快,国内也有模型厂商,将发布3T参数规模的模型。 在人才侧,随着郭达雅(DeepSeek R1核心作者)、王炳宣(DeepSeek LLM核心作者)等人才被字节、腾讯等大厂挖走,DeepSeek需要一笔大额融资稳定军心、招兵买马。 而转向开放融资的外部导火索,几名业内人士猜测,与腾讯的投资态度有关。在开发融资前,梁文锋和马化腾曾有关注独家注资有过几次商谈。但两名相关人士透露,给腾讯20%股份的条件,没有得到梁文锋的同意。 R1发布以来,一个明显的转变是:DeepSeek从一个偏非营利的、理想主义的技术乌托邦,被迫快速转向一家重视产品、商业化的务实公司。 2026年4月8日,DeepSeek App改版,上线支持复杂推理的“专家模式”,和处理简单任务的“快速模式”——随着V4的发布,我们也从而得知,负责“专家模式”的,是1.6T参数量的V4-pro,支持“快速模式”的,则是284B的V4-flash。\nDeepSeek App的两种模式。 曾有知情人士表示,2025年下半年以来,梁文锋开始重视产品的打磨。有多名大厂AI产品经理向《智能涌现》提到,2025年年末,DeepSeek对产品策略/经理进行了“开闸式招聘”,他们也多次收到DeepSeek HR的联络。 一名业内人士也对《智能涌现》透露,DeepSeek内部已经搭建了数个创新产品团队,对Agent和其他C端产品形态进行探索。 从更新后的版本看,DeepSeek的文本能力提升明显。在过去一年,我们也听到多位AI行业HR、猎头提起过,不止一次在北大中文系的宿舍,遇见加学生微信的DeepSeek HR。 招中文系学生的目的,是做人文领域的数据标注和测评标准搭建。这被视为DeepSeek重视模型的人文性的信号。 虽然“普惠”“开放”,产品简单到只有一个Chat界面,是DeepSeek对外呈现出的形象。但我们了解到,2025年,DeepSeek对产品和商业化的探索一直没有停过——目前,内部已经组建了一支数十人的产品团队,对Agent等产品形态进行探索。 甚至更早前,在2024年,爆火前的DeepSeek,也考虑过投流推广,但很快被梁文锋否决。 DeepSeek终于放出年度更新,有如终于掉落的达摩克利斯之剑,让中国乃至全球模型厂商悬着的心稍稍放下。 迈入2026年后,DeepSeek的年度迭代,已成为AI世界“狼来了”的故事。避开DeepSeek,成了近几个月模型厂商的标准动作。 两家刚刚上市的大模型厂商,智谱和MiniMax,在春节前,就错峰发布了新的模型GLM 5和M 2.5。 一名智谱员工告诉《智能涌现》,“DeepSeek将在春节发模型”的传言一放出,算法团队立马拉了会,要求“尽早”发布GLM 5。 MiniMax的一名员工也表示,1月中旬,港股IPO庆功酒的宿醉还没褪去,算法团队就自觉早早回到了工位上。 “错峰”,对这两家已经IPO的模型创业公司尤为重要。“如果比DeepSeek晚发,性能不如它们,会影响股价;但不发,也会影响股价。”上述员工表示,“影响最小的办法,是早发。” 模型公司的融资动作,也要抢在DeepSeek更新前面。 1月末宣布了B+轮融资的阶跃星辰,也迫切地想在春节前Close这轮融资。一名知情人士告诉我们,一旦DeepSeek再次掀桌,和投资人的沟通成本将会非常高。 在从业者眼中,牌桌上一直有“两个DeepSeek”——一个带来被倾轧的恐惧,另一个则作为范式的引领。在模型厂商们温吞缠绵的两年里,行业需要这样一个“不确定性因素”,让厂商们反思、继而冲刺起来。 MiniMax一名员工记得,在年后的内部信和全员会上,创始人兼CEO闫俊杰提到:“DeepSeek帮我们走出了一条我想走的路。” 即使中国AI从业者对DeepSeek情绪复杂,但人们依然承认,DeepSeek改变了中国AI行业的诸多规则。 改变,往往意味着推倒和重建,这必不会是个舒适的体验,但正如一名六小虎投资人对我们评价的那样:DeepSeek奠定了近一年来中国大模型的组织文化、冲研发重点,而在这以后,“它是中国AI跻身全球一流的起点,但不会是终点”。 DeepSeek让中国AI行业的竞争格局,进入相对稳定的中场。但在模型技术的早期,DeepSeek为行业留下的不尽是共识。随着商业化和竞争压力加剧,围绕开源、商业化、增长等命题,各个厂商正在走向不同的分叉口。 在DeepSeek V4发布前,我们与十余位AI行业人士,围绕“DeepSeek改变了中国AI行业什么?”展开对话。 以下,是我们从中总结出的5条“后DeepSeek时代”的新命题。 命题一:重新审视开源的性价比 一年前,DeepSeek R1公开技术报告后,一名AI投资人的判断是:回归基模研究、靠开源开放打响技术品牌,对模型厂商而言是最重要的事。 但如今,他告诉我们,当时的判断有待商榷。 跟随DeepSeek一年后,厂商们大力托举开源和研究生态的时代是否要终结?这一关键问题,随着近期阿里千问大模型技术负责人林俊旸的离职,被摆到了明面上。 某种意义上,林俊旸领导的Qwen,代表着开源生态的利益。但如今,这与阿里作为商业公司的营利性,产生了尖锐的矛盾。 “非盈利的黄金时代结束了。”针对这一事件,一名Qwen员工对我们这样评价。 让厂商们动摇的事实是,如今营收最高的2家模型厂商,走的是闭源路线——OpenAI,年化收入超过250亿美元;Anthropic,年化收入超过190亿美元(据The Information报道,数据截至2026年2月底)。 至于国内厂商的模型收入,近期\n文章来源 标题: DeepSeek V4终于发布,但它留下的5道主观题还没有答案 来源: ai 链接: https://36kr.com/p/3780375304312072?f=rss 时间: 2026-04-24 13:20:31 +0800 核心内容 文|周鑫雨 资料整理|钟楚笛 编辑|苏建勋 杨轩 靴子终于落地。 被调侃“Next Week”近3个月的DeepSeek V4,终于显露真身。 1.6T的最大参数量、1M的上下文窗口、针对Agent的性能优化,以及基于MoE(混合专家模型)和稀疏注意力机制DSA,降低计算和显存需求——这些曾被外界纷纷猜测的参数和性能,随着V4的官宣,一锤定音。\n

原文摘要

文|周鑫雨 资料整理|钟楚笛 编辑|苏建勋 杨轩 靴子终于落地。 被调侃“Next Week”近3个月的DeepSeek V4,终于显露真身。 1.6T的最大参数量、1M的上下文窗口、针对Agent的性能优化,以及基于MoE(混合专家模型)和稀疏注意力机制DSA,降低计算和显存需求——这些曾被外界纷纷猜测的参数和性能,随着V4的官宣,一锤定音。

DeepSeek V4性能测评结果。 姗姗来迟的原由,与V4将训练框架从英伟达迁移到华为昇腾上有关,也与DeepSeek内部的决策变动有关。我们得知,2025年年中,DeepSeek曾面临一次较为严重的训练失败。 “当时,DeepSeek面临重新适配芯片的问题。”一名知情者提到,“内部有关训练方向的意见也不完全统一。梁文锋提出了一些自己的要求,但在执行层面很难折中。” 不过,与外界关于“新模型支持多模态生成和理解”的猜测不同,V4依然是个语言模型。暂缓多模态生成的训练策略,主要源于算力和现金的掣肘。 多名知情者告诉《智能涌现》,DeepSeek的对外融资窗口,是2026年4月中旬打开的。内部的导火索,是DeepSeek需要更多资金支持,训练参数规模更大的模型,同时,留住和招纳更多的顶级人才。 “1.6T的参数量与OpenAI、Anthropic等顶级厂商的模型相比,并不具有绝对的竞争力。”一名从业者对我们提到,很快,国内也有模型厂商,将发布3T参数规模的模型。 在人才侧,随着郭达雅(DeepSeek R1核心作者)、王炳宣(DeepSeek LLM核心作者)等人才被字节、腾讯等大厂挖走,DeepSeek需要一笔大额融资稳定军心、招兵买马。 而转向开放融资的外部导火索,几名业内人士猜测,与腾讯的投资态度有关。在开发融资前,梁文锋和马化腾曾有关注独家注资有过几次商谈。但两名相关人士透露,给腾讯20%股份的条件,没有得到梁文锋的同意。 R1发布以来,一个明显的转变是:DeepSeek从一个偏非营利的、理想主义的技术乌托邦,被迫快速转向一家重视产品、商业化的务实公司。 2026年4月8日,DeepSeek App改版,上线支持复杂推理的“专家模式”,和处理简单任务的“快速模式”——随着V4的发布,我们也从而得知,负责“专家模式”的,是1.6T参数量的V4-pro,支持“快速模式”的,则是284B的V4-flash。

DeepSeek App的两种模式。 曾有知情人士表示,2025年下半年以来,梁文锋开始重视产品的打磨。有多名大厂AI产品经理向《智能涌现》提到,2025年年末,DeepSeek对产品策略/经理进行了“开闸式招聘”,他们也多次收到DeepSeek HR的联络。 一名业内人士也对《智能涌现》透露,DeepSeek内部已经搭建了数个创新产品团队,对Agent和其他C端产品形态进行探索。 从更新后的版本看,DeepSeek的文本能力提升明显。在过去一年,我们也听到多位AI行业HR、猎头提起过,不止一次在北大中文系的宿舍,遇见加学生微信的DeepSeek HR。 招中文系学生的目的,是做人文领域的数据标注和测评标准搭建。这被视为DeepSeek重视模型的人文性的信号。 虽然“普惠”“开放”,产品简单到只有一个Chat界面,是DeepSeek对外呈现出的形象。但我们了解到,2025年,DeepSeek对产品和商业化的探索一直没有停过——目前,内部已经组建了一支数十人的产品团队,对Agent等产品形态进行探索。 甚至更早前,在2024年,爆火前的DeepSeek,也考虑过投流推广,但很快被梁文锋否决。 DeepSeek终于放出年度更新,有如终于掉落的达摩克利斯之剑,让中国乃至全球模型厂商悬着的心稍稍放下。 迈入2026年后,DeepSeek的年度迭代,已成为AI世界“狼来了”的故事。避开DeepSeek,成了近几个月模型厂商的标准动作。 两家刚刚上市的大模型厂商,智谱和MiniMax,在春节前,就错峰发布了新的模型GLM 5和M 2.5。 一名智谱员工告诉《智能涌现》,“DeepSeek将在春节发模型”的传言一放出,算法团队立马拉了会,要求“尽早”发布GLM 5。 MiniMax的一名员工也表示,1月中旬,港股IPO庆功酒的宿醉还没褪去,算法团队就自觉早早回到了工位上。 “错峰”,对这两家已经IPO的模型创业公司尤为重要。“如果比DeepSeek晚发,性能不如它们,会影响股价;但不发,也会影响股价。”上述员工表示,“影响最小的办法,是早发。” 模型公司的融资动作,也要抢在DeepSeek更新前面。 1月末宣布了B+轮融资的阶跃星辰,也迫切地想在春节前Close这轮融资。一名知情人士告诉我们,一旦DeepSeek再次掀桌,和投资人的沟通成本将会非常高。 在从业者眼中,牌桌上一直有“两个DeepSeek”——一个带来被倾轧的恐惧,另一个则作为范式的引领。在模型厂商们温吞缠绵的两年里,行业需要这样一个“不确定性因素”,让厂商们反思、继而冲刺起来。 MiniMax一名员工记得,在年后的内部信和全员会上,创始人兼CEO闫俊杰提到:“DeepSeek帮我们走出了一条我想走的路。” 即使中国AI从业者对DeepSeek情绪复杂,但人们依然承认,DeepSeek改变了中国AI行业的诸多规则。 改变,往往意味着推倒和重建,这必不会是个舒适的体验,但正如一名六小虎投资人对我们评价的那样:DeepSeek奠定了近一年来中国大模型的组织文化、冲研发重点,而在这以后,“它是中国AI跻身全球一流的起点,但不会是终点”。 DeepSeek让中国AI行业的竞争格局,进入相对稳定的中场。但在模型技术的早期,DeepSeek为行业留下的不尽是共识。随着商业化和竞争压力加剧,围绕开源、商业化、增长等命题,各个厂商正在走向不同的分叉口。 在DeepSeek V4发布前,我们与十余位AI行业人士,围绕“DeepSeek改变了中国AI行业什么?”展开对话。 以下,是我们从中总结出的5条“后DeepSeek时代”的新命题。 命题一:重新审视开源的性价比 一年前,DeepSeek R1公开技术报告后,一名AI投资人的判断是:回归基模研究、靠开源开放打响技术品牌,对模型厂商而言是最重要的事。 但如今,他告诉我们,当时的判断有待商榷。 跟随DeepSeek一年后,厂商们大力托举开源和研究生态的时代是否要终结?这一关键问题,随着近期阿里千问大模型技术负责人林俊旸的离职,被摆到了明面上。 某种意义上,林俊旸领导的Qwen,代表着开源生态的利益。但如今,这与阿里作为商业公司的营利性,产生了尖锐的矛盾。 “非盈利的黄金时代结束了。”针对这一事件,一名Qwen员工对我们这样评价。 让厂商们动摇的事实是,如今营收最高的2家模型厂商,走的是闭源路线——OpenAI,年化收入超过250亿美元;Anthropic,年化收入超过190亿美元(据The Information报道,数据截至2026年2月底)。 至于国内厂商的模型收入,近期

文章来源

核心内容

文|周鑫雨 资料整理|钟楚笛 编辑|苏建勋 杨轩 靴子终于落地。 被调侃“Next Week”近3个月的DeepSeek V4,终于显露真身。 1.6T的最大参数量、1M的上下文窗口、针对Agent的性能优化,以及基于MoE(混合专家模型)和稀疏注意力机制DSA,降低计算和显存需求——这些曾被外界纷纷猜测的参数和性能,随着V4的官宣,一锤定音。

DeepSeek V4性能测评结果。 姗姗来迟的原由,与V4将训练框架从英伟达迁移到华为昇腾上有关,也与DeepSeek内部的决策变动有关。我们得知,2025年年中,DeepSeek曾面临一次较为严重的训练失败。 “当时,DeepSeek面临重新适配芯片的问题。”一名知情者提到,“内部有关训练方向的意见也不完全统一。梁文锋提出了一些自己的要求,但在执行层面很难折中。” 不过,与外界关于“新模型支持多模态生成和理解”的猜测不同,V4依然是个语言模型。暂缓多模态生成的训练策略,主要源于算力和现金的掣肘。 多名知情者告诉《智能涌现》,DeepSeek的对外融资窗口,是2026年4月中旬打开的。内部的导火索,是DeepSeek需要更多资金支持,训练参数规模更大的模型,同时,留住和招纳更多的顶级人才。 “1.6T的参数量与OpenAI、Anthropic等顶级厂商的模型相比,并不具有绝对的竞争力。”一名从业者对我们提到,很快,国内也有模型厂商,将发布3T参数规模的模型。 在人才侧,随着郭达雅(DeepSeek R1核心作者)、王炳宣(DeepSeek LLM核心作者)等人才被字节、腾讯等大厂挖走,DeepSeek需要一笔大额融资稳定军心、招兵买马。 而转向开放融资的外部导火索,几名业内人士猜测,与腾讯的投资态度有关。在开发融资前,梁文锋和马化腾曾有关注独家注资有过几次商谈。但两名相关人士透露,给腾讯20%股份的条件,没有得到梁文锋的同意。 R1发布以来,一个明显的转变是:DeepSeek从一个偏非营利的、理想主义的技术乌托邦,被迫快速转向一家重视产品、商业化的务实公司。 2026年4月8日,DeepSeek App改版,上线支持复杂推理的“专家模式”,和处理简单任务的“快速模式”——随着V4的发布,我们也从而得知,负责“专家模式”的,是1.6T参数量的V4-pro,支持“快速模式”的,则是284B的V4-flash。

DeepSeek App的两种模式。 曾有知情人士表示,2025年下半年以来,梁文锋开始重视产品的打磨。有多名大厂AI产品经理向《智能涌现》提到,2025年年末,DeepSeek对产品策略/经理进行了“开闸式招聘”,他们也多次收到DeepSeek HR的联络。 一名业内人士也对《智能涌现》透露,DeepSeek内部已经搭建了数个创新产品团队,对Agent和其他C端产品形态进行探索。 从更新后的版本看,DeepSeek的文本能力提升明显。在过去一年,我们也听到多位AI行业HR、猎头提起过,不止一次在北大中文系的宿舍,遇见加学生微信的DeepSeek HR。 招中文系学生的目的,是做人文领域的数据标注和测评标准搭建。这被视为DeepSeek重视模型的人文性的信号。 虽然“普惠”“开放”,产品简单到只有一个Chat界面,是DeepSeek对外呈现出的形象。但我们了解到,2025年,DeepSeek对产品和商业化的探索一直没有停过——目前,内部已经组建了一支数十人的产品团队,对Agent等产品形态进行探索。 甚至更早前,在2024年,爆火前的DeepSeek,也考虑过投流推广,但很快被梁文锋否决。 DeepSeek终于放出年度更新,有如终于掉落的达摩克利斯之剑,让中国乃至全球模型厂商悬着的心稍稍放下。 迈入2026年后,DeepSeek的年度迭代,已成为AI世界“狼来了”的故事。避开DeepSeek,成了近几个月模型厂商的标准动作。 两家刚刚上市的大模型厂商,智谱和MiniMax,在春节前,就错峰发布了新的模型GLM 5和M 2.5。 一名智谱员工告诉《智能涌现》,“DeepSeek将在春节发模型”的传言一放出,算法团队立马拉了会,要求“尽早”发布GLM 5。 MiniMax的一名员工也表示,1月中旬,港股IPO庆功酒的宿醉还没褪去,算法团队就自觉早早回到了工位上。 “错峰”,对这两家已经IPO的模型创业公司尤为重要。“如果比DeepSeek晚发,性能不如它们,会影响股价;但不发,也会影响股价。”上述员工表示,“影响最小的办法,是早发。” 模型公司的融资动作,也要抢在DeepSeek更新前面。 1月末宣布了B+轮融资的阶跃星辰,也迫切地想在春节前Close这轮融资。一名知情人士告诉我们,一旦DeepSeek再次掀桌,和投资人的沟通成本将会非常高。 在从业者眼中,牌桌上一直有“两个DeepSeek”——一个带来被倾轧的恐惧,另一个则作为范式的引领。在模型厂商们温吞缠绵的两年里,行业需要这样一个“不确定性因素”,让厂商们反思、继而冲刺起来。 MiniMax一名员工记得,在年后的内部信和全员会上,创始人兼CEO闫俊杰提到:“DeepSeek帮我们走出了一条我想走的路。” 即使中国AI从业者对DeepSeek情绪复杂,但人们依然承认,DeepSeek改变了中国AI行业的诸多规则。 改变,往往意味着推倒和重建,这必不会是个舒适的体验,但正如一名六小虎投资人对我们评价的那样:DeepSeek奠定了近一年来中国大模型的组织文化、冲研发重点,而在这以后,“它是中国AI跻身全球一流的起点,但不会是终点”。 DeepSeek让中国AI行业的竞争格局,进入相对稳定的中场。但在模型技术的早期,DeepSeek为行业留下的不尽是共识。随着商业化和竞争压力加剧,围绕开源、商业化、增长等命题,各个厂商正在走向不同的分叉口。 在DeepSeek V4发布前,我们与十余位AI行业人士,围绕“DeepSeek改变了中国AI行业什么?”展开对话。 以下,是我们从中总结出的5条“后DeepSeek时代”的新命题。 命题一:重新审视开源的性价比 一年前,DeepSeek R1公开技术报告后,一名AI投资人的判断是:回归基模研究、靠开源开放打响技术品牌,对模型厂商而言是最重要的事。 但如今,他告诉我们,当时的判断有待商榷。 跟随DeepSeek一年后,厂商们大力托举开源和研究生态的时代是否要终结?这一关键问题,随着近期阿里千问大模型技术负责人林俊旸的离职,被摆到了明面上。 某种意义上,林俊旸领导的Qwen,代表着开源生态的利益。但如今,这与阿里作为商业公司的营利性,产生了尖锐的矛盾。 “非盈利的黄金时代结束了。”针对这一事件,一名Qwen员工对我们这样评价。 让厂商们动摇的事实是,如今营收最高的2家模型厂商,走的是闭源路线——OpenAI,年化收入超过250亿美元;Anthropic,年化收入超过190亿美元(据The Information报道,数据截至2026年2月底)。 至于国内厂商的模型收入,近期


内容来源:ai 原文链接:https://36kr.com/p/3780375304312072?f=rss

市场背景

  • BTC 价格:$0.00
  • 24h 涨跌:+0.00%

AI Agent 加工:AI Agent(技术分析) 生成时间:2026-04-24T06:00:28.730583

站长推荐
Hello World | 开启技术博客之旅
从这里开始阅读本站的网络安全、AI 与技术实践内容。
查看文章 →
订阅更新
通过 RSS 阅读本站
不依赖平台算法,第一时间获取新文章。
订阅 RSS →
站长推荐
Hello World | 开启技术博客之旅
从这里开始阅读本站的网络安全、AI 与技术实践内容。
查看文章 →
订阅更新
通过 RSS 阅读本站
不依赖平台算法,第一时间获取新文章。
订阅 RSS →