1250亿参数只激活60亿,千问新模型如何把AI成本打下来
千问办公上线Qwen3.8-Flash,速度翻倍且Token消耗降75%。大模型竞争进入基础设施阶段,缺乏数据壁垒的套壳创业者将面临洗牌。

8月26日晚,千问办公上线Qwen3.8-Flash模型。据报道,新模型生成速度提升100%,Token消耗锐减75%。1250亿总参数仅激活60亿,支持百万级上下文。这不仅是技术迭代,更是AI成本的一次“脚踝斩”。对打工人而言,等待时间减半,企业账单缩水,AI正从“奢侈品”变成“日用品”。
算账:从“按句收费”到“白菜价”的跨越
过去用大模型处理长文档,不仅生成速度慢如蜗牛,API调用账单更是让中小企业肉疼。生成一篇长报告可能要花几毛钱,现在只需几分钱。
这意味着大模型的计费逻辑正在发生质变。对于日常依赖AI写代码、做纪要的职场人,等待时间缩短一半;对企业而言,调用成本直接砍掉四分之三。这种“加量还降价”的操作,彻底抹平了中小团队接入大模型的门槛。过去大家是“省着用”,现在终于可以“敞开用”了。

拆解:1250亿参数里的“精打细算”
这次同步开源的Qwen3.8-Flash-Next,提前预览了下一代架构。1250亿总参数的MoE(混合专家)模型,每次推理只激活60亿参数,训练成本降至前代九分之一。
这种“大总参、小激活”的设计,本质是在模型智商和运行成本间走钢丝。就像一家有1250位医生的大型综合医院,你去看感冒,系统只呼叫60位最对症的专家来会诊,既保证了专业度,又省了庞大的算力开销。
设想一个具体场景:周五临下班,法务专员小李需要审核一份长达80页的英文商业合同,并对比公司过往的合规标准。过去她需要熬夜逐条核对,现在只需将合同和合规手册(总计超30万Token)一次性拖入千问办公的标准模式。几分钟内,AI就能高亮出潜在的风险条款并给出修改建议。百万级上下文彻底解决了长文本处理时AI“读了后面忘了前面”的痛点,让大模型真正融入了打工人的日常。
演进:AI办公落地的“三步走”战略
大模型在办公场景的演进正经历清晰的三个步骤:第一步是“尝鲜玩具”阶段,大家主要用来写诗、润色邮件,图个新鲜;第二步是“单点工具”阶段,AI能处理翻译、会议纪要等特定任务;第三步则是现在的“系统级基础设施”阶段,要求它吞吐百万字长文本、精准提取全局数据并深度融入业务流。
对比海外科技巨头还在拼参数规模与通用能力,国内厂商已经开始在“极致性价比”和“长文本处理”上疯狂内卷。这种差异化的竞争路线,让国内AI应用更早地触碰到了商业化的深水区,也倒逼企业重新审视自身的数字化资产。

洗牌:套壳创业者的“生死劫”
据报道,阿里巴巴近期宣布了约800亿港元的股权融资,并推出了AI视频生成模型。在资金弹药充足的情况下,通过极具性价比的Flash模型抢占开发者生态和办公场景,是其扩大全球市场份额的关键一步。
千问此次激进的性能提升与成本压缩,不仅仅是技术迭代,更是一种明确的市场清场信号。当头部大厂把大模型的使用成本打到“白菜价”时,那些缺乏底层算力优势、仅靠套壳或微调生存的中间层AI创业公司,将面临巨大的生存风险。
对比拥有自研算力底座和海量数据的大厂,套壳公司如果缺乏独家数据壁垒和深度场景,在未来的行业洗牌中可能很难存活。AI应用的竞争核心,正彻底从“谁能调用模型”转向“谁拥有独家场景与数据”。
今日带走:千问新模型通过MoE架构实现“大参数小激活”,将AI调用成本降低75%并支持百万上下文。大模型竞争已进入“基础设施”阶段,缺乏独家数据壁垒的套壳创业者将面临严峻的生存洗牌。