Qwen3.8-Flash上线千问AI平台:新架构降低Agent与长上下文调用成本

Qwen3.8-Flash上线,以新架构降低长上下文和Agent调用成本。

冷月清谈:

千问AI平台上线多模态MoE模型Qwen3.8-Flash,模型拥有千亿级总参数,每次推理仅激活约60亿参数。文章称,其Next架构引入QSA稀疏注意力、GDN混合注意力、Gated Residual多通道通信及51B N-gram Embedding,以降低训练和推理开销;在高缓存命中的百万Token长上下文场景中,速度可提升8倍以上。国内API定价为每百万Tokens输入0.8元、输出2.7元、缓存命中0.1元,主要面向编程、Agent及高频办公任务。模型已接入千问办公标准模式,权重同步在Hugging Face和魔搭社区开源,相关架构也被视作Qwen4的技术雏形。

怜星夜思:

1、Token单价很低,但放到真实Agent项目里,整体成本真的会明显下降吗?
2、QSA、Gated Residual和N-gram Embedding这些新设计,会带来哪些潜在短板?
3、已经有低价API和开源权重,团队该怎么判断是直接调用还是自己部署?
4、“可完成95%的日常办公任务”应该怎样验证,才不只是一个宣传数字?

原文标题:极致性价比!Qwen3.8-Flash上线千问AI平台

原文作者:阿里云开发者

原文内容

刚刚,千问AI平台上线Qwen3.8-Flash

编程、Agent等真实任务中达到极致性价比

最新价格如下

👇👇👇

输入每百万Tokens 0.8元

输出每百万Tokens 2.7元

缓存命中每百万Tokens 0.1元

Qwen3.8-Flash是一个多模态混合专家(MoE)模型,采用了下一代(Next)模型架构,千亿总参数仅激活60亿(6B),创下模型效率的全球新基准。

模型采用了与此前所有千问大模型完全不同的全新架构:

在注意力方面,引入独特的QSA(Qwen Sparse Attention)机制,形成与GDN高效融合的混合注意力架构,可显著降低计算开销,在高缓存命中的1M Tokens长上下文实际场景中可提速8倍以上,又准又快;

在模型内部分层通信方面,引入自研的Gated Residual方法,将传统Transformer的1条信息主通道拆分并拓展为4条,让模型可根据需求动态决定读写信息,信息传递更高效,训练也更稳定;

在模型参数扩展方面,引入51B的N-gram Embedding参数,为模型Transformer参数提供更高效的查表寻址,在每次token计算时无需参与,以极少的资源消耗“外挂”了一个大规模的 “记忆指南手册”,模型参数扩展效率更高;

在模型调参方面,模型结构和后期优化协同进行,收敛效率和训练吞吐大幅提升。

Qwen3.8系列技术创新,直接带来了训练和推理的成本大幅下降,模型的API服务已首发上线千问AI平台,开发者可直接调用API或Token Plan,以普惠价格获取前沿性能。

推理时,Qwen3.8-Flash每百万Tokens输入低至0.8元,输出2.7元;国际站每百万Tokens输入0.15美元、输出0.47美元

在真实任务中,Agent工作需长输入(Input),缓存命中价格对综合成本影响大,Qwen3.8-Flash缓存命中价格低至每百万Tokens 0.1元、国际站0.016美元,特别适合大量、频繁的日常智能体任务,开发者可以极致性价比获取前沿性能

目前,千问办公“标准模式”也已内置Qwen3.8-Flash,可完成95%的日常办公任务。

Next新架构将是全新一代千问大模型Qwen4的雏形,Qwen3.8-Flash-Next模型权重已在Hugging Face、魔搭社区全面开源,交由全球AI开源社区检验,以更好打造Qwen4模型。截至目前,Qwen3.8已开源发布的2.4T参数量的Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三大尺寸模型,均已上线千问AI平台对外提供API服务。

Qwen3.8-Flash模型体验地址:

千问AI平台:

https://www.qianwenai.com/models/qwen3.8-flash

QwenCloud:

https://www.qwencloud.com/models/qwen3.8-flash

千问AI平台-Agent而生,驱动AI生产力
扫描下方二维码,直达千问AI平台体验


点击阅读原文即可体验!

回答办公评测:可以从公司真实流程抽取一批脱敏任务,让不同岗位盲测,再记录首次完成率、修改次数和耗时。比单纯问一句“好不好用”靠谱多了。

1 个赞

我会专门拿那些格式特别乱的Excel、领导只说半句话的需求去测。标准样例谁都能做,办公室真正的Boss是含糊需求和祖传表格。

1 个赞

我更关心Agent会不会少走弯路。便宜模型连续调用十次,未必比贵一点但一次做对更省钱,毕竟Token也讲究“少跑冤枉路”。

3 个赞

我最担心的不是名字看不懂,而是硬件和推理框架跟不上。论文里飞起,部署时算子不适配,最后显卡在那儿“我是谁,我该算什么”。

2 个赞

回答架构取舍:N-gram Embedding有点像给模型配了一本快速索引,查常见模式可能更高效,但遇到新知识、跨语言表达或非常规组合时,泛化效果还得靠公开测试验证。

2 个赞

回答部署选择:别只对比Token费和显卡租金,还要算监控、扩缩容、版本升级、故障值班这些隐性成本。我们之前一算人力,最后还是先用了API。

1 个赞

关于“真实Agent成本会不会下降”,不能只看输入单价。Agent经常反复调用工具、重试和拼接上下文,输出长度、缓存命中率、失败率都会影响最终账单。最好拿自己的调用日志回放一遍再算。

1 个赞