阿里Qwen3-Coder重磅开源:长上下文代码大模型赋能AI编程新纪元

阿里Qwen3-Coder重磅发布:1M超长上下文,卓越编程与Agent能力开源,助力开发者提效。

原文标题:阿里Qwen3-Coder携1M上下文杀来!5分钟生成网站,开发者狂欢:Claude?Code可以卸载了

原文作者:AI前线

冷月清谈:

阿里正式发布了其“迄今为止最具代理能力的代码模型”——Qwen3-Coder。该模型采用MoE架构,拥有480B参数、35B激活参数,原生支持256K token上下文并可通过YaRN扩展至1M token,支持358种编程语言。它在Agentic Coding、Agentic Browser-Use和Agentic Tool-Use等Agent能力评测中取得了开源模型SOTA效果,表现可与Claude Sonnet4媲美。

Qwen3-Coder的训练过程注重多维度扩展,包括7.5T代码数据的数据扩展、通过YaRN实现的1M上下文扩展,以及利用Qwen2.5-Coder对低质数据进行清洗与重写。后训练阶段创新性地引入了Code RL和Agent RL,特别是在Agent RL中实现了可验证环境的大规模扩展系统,使其在SWE-Bench Verified上达到了开源SOTA。

在实际应用方面,Qwen3-Coder展现出强大的效率提升能力,号称能让新程序员一天完成资深程序员一周的工作,甚至5分钟就能生成一个品牌官网,大幅降低了编程门槛。开发者们对此表现出高度热情,认为其性能超越现有竞品。Qwen3-Coder已在魔搭社区和HuggingFace等平台开源,全球开发者可免费使用,未来还将接入阿里AI编程产品通义灵码,并已上线阿里云百炼API。尽管少数开发者遇到了特定操作上的问题,但总体而言,Qwen3-Coder展现了强大的潜力和竞争力。

怜星夜思:

1、Qwen3-Coder这样的代码大模型,号称能“刚入行程序员一天完成资深程序员一周的工作”,甚至5分钟就能生成网站。大家觉得,这真能彻底改变我们的编程方式吗?未来程序员的工作重心会变成什么样?
2、文章里提到Qwen3-Coder原生支持256K上下文,还能扩展到1M。对于咱们平时写代码来说,这么长的上下文具体能派上啥用场?真的能解决以前搞不定的跨文件、大规模项目的问题吗?
3、Qwen3-Coder是开源的,但阿里的通义灵码也会接入它。这种“开源免费用”和“集成到商业产品里”的模式,对我们开发者来说究竟哪个更香?大家平时更偏爱用纯开源工具还是这种有大厂支持的集成服务?

原文内容

整理 | 褚杏娟

今天,阿里正式发布了其“迄今为止最具代理能力的代码模型” Qwen3-Coder。

Qwen3-Coder 有多个版本,其中 Qwen3-Coder-480B-A35B-Instruct 是一个有 480B 参数、35B 激活参数的 MoE 模型,原生支持 256K token 的上下文并可通过 YaRN 扩展到 1M token,拥有卓越的代码和 Agent 能力。据悉,该模型支持 358 种编程语言,在 Agentic Coding、Agentic Browser-Use 和 Agentic Tool-Use 上取得了开源模型的 SOTA 效果,可以与 Claude Sonnet4 媲美。

与此同时,阿里还推出并开源了一款用于代理式编程的命令行工具:Qwen Code。Qwen Code 是一个 CLI 工具,修改自 Gemini CLI,针对 Qwen3‑Coder 系列的模型增强了解析器和工具支持。据悉,Qwen Code 基于 Gemini Code 进行二次开发,但团队进行了 prompt 和工具调用协议适配,以最大程度激发 Qwen3-Coder 在 Agentic Coding 任务上的表现。另外,Qwen3-Coder 还可以和社区优秀的编程工具结合,如 Claude Code、Cline 等。

据介绍,借助 Qwen3-Coder,刚入行的程序员一天就能完成资深程序员一周的工作,生成一个品牌官网最快只需 5 分钟。

目前,Qwen3-Coder 已在魔搭社区、HuggingFace 等平台开源,全球开发者都可以免费下载使用。截至发稿前,该模型已在 Github 上获得 5.1k stars。此外,Qwen3-Coder 很快将接入阿里的 AI 编程产品通义灵码,API 也已上线阿里云百炼。

相关地址:

https://github.com/QwenLM/Qwen3-Coder

https://huggingface.co/Qwen/Qwen3-Coder-480B-A35B-Instruct

Qwen3-Coder 训练过程
预训练

据悉,这次团队从不同角度进行 Scaling,以提升 Qwen3-Coder 的代码能力:

  • 数据扩展:总计 7.5T(代码占比 70%),在保持通用与数学能力的同时,具备卓越的编程能力;

  • 上下文扩展:原生支持 256K 上下文,借助 YaRN 可拓展至 1M,专为仓库级和动态数据(如 Pull Request)优化;

  • 合成数据扩展:利用 Qwen2.5-Coder 对低质数据进行清洗与重写,来显著提升整体数据质量。

后训练


团队在更丰富的真实代码任务上进行了扩展 Code RL 训练。与当前社区普遍聚焦于竞赛类代码生成不同,团队认为所有的代码任务天然适合执行驱动的大规模强化学习。通过自动扩展测试样例,团队构造了大量高质量的训练实例,不仅显著提升了代码执行成功率,还对其他任务带来增益。

在真实世界的 Software Engneering Task,比如 SWE-Bench,模型需要在环境中不断交互,自主规划、选择工具调用、接受反馈不断做出新决策,这是一个典型的 Long-Horizon RL 任务。

团队在 Qwen3-Coder 的后训练阶段执行了 Agent RL,鼓励模型通过多轮交互的方式利用工具解决问题。据介绍,Agent RL 的主要挑战在于 Environment Scaling,团队实现了可验证环境的扩展系统,借助阿里云的基础设施,实现同时运行 20k 独立环境。这一套基础设施可以提供大规模的强化学习反馈和评测,最终我们在 SWE-bench Verified 上实现了开源模型 SOTA 的效果。

效果如何?

Qwen3-Coder 是社区期待已久的大模型之一。4 月底时候就有人提出,希望确保 Qwen3coder 使用最新 / 更新的高质量代码进行训练,尤其是针对系统编程语言的代码。还有开发者表示,希望 Qwen3-coder 能在 C 和 C++ 领域有更多涉猎。“现在的 AI 模型都针对 Web 和桌面开发进行了优化。但我们今天使用的很多技术仍然嵌入在智能设备中,而且由于对传统硬件组件的依赖,大多数公司无法切换到 Rust。”

Qwen3-Coder 发布后开发者们表现出了很大的热情。

SnapEdit 联合创始人兼首席执行官 Oscar Le 发推称,“Qwen 从来没有让我失望过。现在大家不用再每月花 200 美元购买 Claude Code 了。”

苹果研究员 Yufan Zhuang 也称赞Qwen 正在推动开源人工智能研究。


Qwen3-Coder 是千问系列模型中首个采用混合专家 MoE 架构的代码模型。在浏览器调用(WebArena)、工具调用(BFCL)等 Agent 能力评测中,Qwen3-Coder 刷新开源模型纪录,超越 GPT4.1;在考察模型自主规划解决编程任务的 SWE-Bench 评测中,Qwen3-Coder 取得了开源最佳效果,媲美 Claude4。

据介绍,Qwen3-Coder 具备出色的 Agent 能力,尤为擅长解决多步骤的长任务,它能通观全局自主安排工作内容,支持 Agent 调用各种工具深入钻研,最终解决复杂编程任务。官方实测数据显示,在执行任务时,Qwen3-Coder 能够调用的工具数量比 Claude 多几倍,效果非常出色。

Qwen3-Coder 能帮助程序员完成基础的编程任务,比如写代码、补全代码、修 Bug 等,编程工作效率大幅提升,代码测试、查询生成等工作从人工编写的数小时骤降至数分钟。同时,Qwen3-Coder 也极大降低了普通人入门编程的门槛,比如一句话就能生成精妙复杂的 3D 物理模拟过程:

Qwen Chat Web Dev:

用一句名言测试你的 WPM:

旋转超立方体中的弹跳球:

太阳系模拟:

DUET 游戏:

“我测试了该基准测试的几个示例。默认基准测试使用的提示只要求回答问题。这意味着推理模型凭借其较长的 COT(参见 QwQ)具有巨大的优势。但当我更改提示词,要求模型逐步推理并考虑所有细微的上下文时,更新后的 Qwen3 235B 表现明显更好。”有开发者反馈道。

还有做了测试的开发者表示“速度快得离谱”。不过,也有开发者遇到了一些问题:“我尝试让它进行一些基本操作,如用 MCP 工具读取一些文件,但即使我详细解释了如何操作,它还是失败了。”

另外,有开发者找到了阿里云百炼上的价格:

附:在 Claude Code 使用 Qwen3‑Coder 的方法

官方给出了 Qwen3‑Coder 与 Claude Code 搭配使用的具体方法,具体提供了两种接入方式。

方案 1:使用 dashscope 提供的代理  API

只需要将 Anthropic 的 base url 替换成 dashscope 上提供的 endpoint 即可。

export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/api/v2/apps/claude-code-proxy
export ANTHROPIC_AUTH_TOKEN=your-dashscope-apikey

至此,可以直接输入 claude 开始使用 Qwen3-Coder & Claude Code

方案 2:使用 claude-code-config 自定义路由

claude-code-router 是一个第三方的路由工具,用于为 Claude Code 灵活地切换不同的后端 API。dashscope 平台提供了一个简单的扩展包 claude-code-config,可为 claude-code-router 生成包含 dashscope 支持的默认配置。

npm install -g @musistudio/claude-code-router
npm install -g @dashscope-js/claude-code-config

生成配置文件和插件目录:

ccr-dashscope

该命令会自动生成 ccr 所需的配置文件和插件目录。你也可以手动调整~/.claude-code-router/config.json 和 ~/.claude-code-router/plugins/ 中的配置。最后,通过 ccr 开始使用 Claude Code:

ccr code

会议推荐

首届 AICon 全球人工智能开发与应用大会(深圳站)将于 8 月 22-23 日正式举行!本次大会以 “探索 AI 应用边界” 为主题,聚焦 Agent、多模态、AI 产品设计等热门方向,围绕企业如何通过大模型降低成本、提升经营效率的实际应用案例,邀请来自头部企业、大厂以及明星创业公司的专家,带来一线的大模型实践经验和前沿洞察。一起探索 AI 应用的更多可能,发掘 AI 驱动业务增长的新路径!


今日荐文

你也「在看」吗?👇

关于“文章里提到Qwen3-Coder原生支持256K上下文,还能扩展到1M。对于咱们平时写代码来说,这么长的上下文具体能派上啥用场?真的能解决以前搞不定的跨文件、大规模项目的问题吗?”的问题,我认为:1M上下文的意义非常重大。在实际开发中,我们经常需要同时参考多个文件,比如在一个函数中调用另一个模块的API,或者修改一个类时需要查看其父类和接口定义。传统模型的上下文窗口限制了它们理解整个项目结构的能力。1M上下文意味着模型可以“看到”一个完整的代码库、多个相关的配置文件、API文档甚至是一个完整的Bug报告和相关的Stack Overflow讨论,进行更全面的理解和推理。这对于解决跨文件依赖、重构大型模块、进行复杂的bug排查,以及理解大型开源项目代码,都将提供前所未有的帮助。

小孩子才做选择,我全都要!开个玩笑,其实得看具体场景。对于“Qwen3-Coder是开源的,但阿里的通义灵码也会接入它。这种’开源免费用’和’集成到商业产品里’的模式,对我们开发者来说究竟哪个更香?大家平时更偏爱用纯开源工具还是这种有大厂支持的集成服务?”我的想法是:如果你是个人开发者,预算有限,或者想搞搞研究,开源的肯定更香,爱怎么折腾怎么折腾。但如果你是公司项目,尤其对性能、稳定性、安全性有高要求,那接入通义灵码这种商业服务就省心多了,毕竟背靠大厂,出问题了也有人负责。纯开源就怕出问题了没人可问。所以哪个更香?看你“香”的是什么,是自由还是省心!

哇,这简直是程序员的福音啊!针对“Qwen3-Coder这样的代码大模型,号称能’刚入行程序员一天完成资深程序员一周的工作’,甚至5分钟就能生成网站。大家觉得,这真能彻底改变我们的编程方式吗?未来程序员的工作重心会变成什么样?”这个问题,我大胆猜想:以后我们不是在敲代码,而是在“指挥”AI去敲代码,把我们的想法灌输给它,然后它就唰唰唰地完成。这不就是电影里“念头一动代码就生成”的场景吗?说不定以后我们都能准时下班,还有更多时间去学习新框架、搞搞副业,甚至研究一下如何更好地“调教”AI!工作重心?当然是享受生活和偶尔给AI擦屁股咯!

1M上下文?那不就是程序员的“超能力”时间暂停器吗?!针对“文章里提到Qwen3-Coder原生支持256K上下文,还能扩展到1M。对于咱们平时写代码来说,这么长的上下文具体能派上啥用场?真的能解决以前搞不定的跨文件、大规模项目的问题吗?”我的回答是:以前我们写代码,就像闭着眼睛在森林里摸索,只能摸到眼前一棵树。现在AI有了1M上下文,就相当于给它装了个高空摄像头,能俯瞰整个森林,哪条路通向哪里,哪个地方有坑都一清二楚。以后我们提问:“帮我把这个祖传老代码库改成微服务架构。” AI可能就不会再问“你在说什么胡话?”了,而是会说“好的,给你安排上,十分钟。”当然,实际效果还得看它能消化多少有效信息,别给我来个“信息过载”就行!

关于“Qwen3-Coder这样的代码大模型,号称能’刚入行程序员一天完成资深程序员一周的工作’,甚至5分钟就能生成网站。大家觉得,这真能彻底改变我们的编程方式吗?未来程序员的工作重心会变成什么样?”我的看法是:从技术发展的角度看,这类代码大模型确实预示着软件开发范式的革新。它们极大提升了代码生成、测试和修复的效率,特别是在重复性高、模式化的任务上。未来,程序员的工作重心将从低层次的代码实现更多地转向高层次的系统设计、架构优化、复杂问题解决、创新性功能开发以及人机协作的策略制定。我们可能会成为“AI协调者”和“AI导师”,确保AI生成的代码符合业务逻辑、安全规范和性能要求。

我肯定更偏爱纯开源!针对“Qwen3-Coder是开源的,但阿里的通义灵码也会接入它。这种’开源免费用’和’集成到商业产品里’的模式,对我们开发者来说究竟哪个更香?大家平时更偏爱用纯开源工具还是这种有大厂支持的集成服务?”这个问题,我觉得:开源精神在于社区协作、自由创新和透明。虽然大厂支持的集成服务可能方便,但总感觉多了一层束缚,数据安全和隐私也是个问题。如果能自己掌握模型,根据自己的需求去微调、去部署,那才是真正的自由。而且,开源社区的力量是无穷的,大家一起贡献、一起进步,才能让技术走得更远。商业产品偶尔用用可以,但核心工具还是开源的好。

关于“Qwen3-Coder是开源的,但阿里的通义灵码也会接入它。这种’开源免费用’和’集成到商业产品里’的模式,对我们开发者来说究竟哪个更香?大家平时更偏爱用纯开源工具还是这种有大厂支持的集成服务?”我的看法是:这其实是个灵活选择的问题。纯开源版本对于研究者、个人开发者和小型团队来说,提供了极大的自由度和成本优势,可以在本地私有部署或以自己可控的方式进行二次开发和定制。但这也意味着你需要自己解决部署、维护、性能优化等问题。而接入商业产品(如通义灵码)则提供了更便捷、稳定的服务,通常会有更好的性能保障、技术支持和更完善的生态集成,尤其适合需要快速部署和稳定运行的企业级应用。对于我个人而言,我会先尝试开源版本,如果遇到性能瓶颈或者需要更专业支持,再考虑商业服务。

针对“文章里提到Qwen3-Coder原生支持256K上下文,还能扩展到1M。对于咱们平时写代码来说,这么长的上下文具体能派上啥用场?真的能解决以前搞不定的跨文件、大规模项目的问题吗?”这个问题,想象一下你正在改一个 Bug,这个 Bug 牵扯到系统好几个模块,A文件改了可能影响B文件,B文件又依赖C服务。以前我们可能得跳来跳去找半天,AI也因为上下文不够理解不了全貌。现在有了1M上下文,就像AI有了一双“透视眼”,能一眼看穿整个项目,帮你把所有相关联的代码都“抓”进来分析,然后直接告诉你哪里需要动刀,甚至给你一个完整的解决方案。跨文件、大规模项目的问题?我觉得至少能解决一大半信息缺失导致的问题。

每次看到这种宣传就有点慌。针对“Qwen3-Coder这样的代码大模型,号称能’刚入行程序员一天完成资深程序员一周的工作’,甚至5分钟就能生成网站。大家觉得,这真能彻底改变我们的编程方式吗?未来程序员的工作重心会变成什么样?”我得说:5分钟生成网站听起来很美好,但谁来保证代码质量?谁来维护?难道未来我们都是“需求翻译机”吗?我觉得编程方式确实会变,但不是彻底取代,更像是“工具升级”。可能以后初级程序员的工作会更依赖AI,但资深和架构师的角色会变得更重要,因为你需要有能力识别AI的错误,并且解决它搞不定的复杂逻辑。未来,能驾驭AI的程序员才是真大佬。