Anthropic模型“降智”引信任危机:Claude Code表现不佳遭用户吐槽

Anthropic承认模型降智,其Claude Code用户信任受损,开发者正转向GPT-5寻求替代。

原文标题:Anthropic承认模型降智后仍放任其偷懒?Claude Code用户信任崩塌中

原文作者:机器之心

冷月清谈:

近期,关于大模型“降智”的讨论甚嚣尘上。与其他厂商的模糊态度不同,Anthropic罕见公开承认其 Claude Opus 4.1 和 4.0 模型在8月25日至28日期间出现了质量下降,表现为智能水平降低、格式错误、工具调用异常等问题。官方解释是推理堆栈更新导致,并表示已回滚更新。然而,Anthropic的声明并未平息用户的不满,反而收到大量负面反馈,尤其针对其编码助手Claude Code。许多用户抱怨Claude变得“懒惰”,无法完成简单任务,且在高峰期表现更差。这一事件导致 大量用户对Claude Code失去信任,转而选择性能更优、性价比更高的GPT-5作为替代方案。 此次风波严重冲击了Anthropic的用户习惯和忠诚度,使其面临严峻的口碑危机。

怜星夜思:

1、大家都说大模型会“降智”,Anthropic也认了。你们觉得这只是技术问题,还是背后有什么商业策略或者运维的考量在里面?比如为了省资源或者推新模型什么的?
2、看到不少人因为Claude这次“偷懒”就转去用GPT-5了。除了模型能力和订阅费,大家觉得还有哪些因素会影响我们选择用哪个大模型?比如习惯、社区支持、甚至是对品牌的“感情”?
3、Anthropic说是更新搞砸了。大模型团队平时怎么做测试和部署,才能避免这种影响用户体验的“翻车”?是不是每次更新都应该更谨慎?

原文内容

机器之心报道

编辑:冷猫


还记不记得每一次 OpenAI 发布新功能或新模型的时候,总会有一些评论声称现有模型能力下降,怀疑大模型「降智」现象的声音不绝于耳。


排除掉一些有关 OpenAI 对部分地区账户的用户分级机制导致的显著降级情况,普通用户也会感觉到大模型时不时的出现问题。


机器之心编辑部在测试 GPT-5 的时候,感觉模型能力不及预期,也会怀疑是否有「降智」现象的存在。



但无论如何,此前大模型供应商似乎从来没有正面承认过模型「降智」的问题,用户的感知也朦朦胧胧的。


OpenAI 的研究科学家 Aidan McLaughlin 前两天发推聊到了这个现象。



他的意思是,大家(包括他自己)经常会错误地认为某个 AI 模型被实验室「削弱」了,而这种错误认知的发生率远高于他的预期。他甚至觉得,这是一种普遍的心理错觉,应该被定义成一种新的心理学现象。


但他很快就被库库打脸了。


几天前,Anthropic 发布了旗下模型 Claude Opus 4.1 和 Opus 4 的质量降级事件报告。很罕见地,大模型厂商公开承认模型「降智」的现象。



从 8 月 25 日 17:30 UTC 到 8 月 28 日 02:00 UTC,Claude Opus 4.1 在部分请求中出现了质量下降的问题。用户可能会遇到智能水平降低、回答格式错误或 Claude Code 工具调用异常等情况。


这一问题的原因是 Anthropic 在推理(inference)堆栈中进行了一次更新,但目前已经对 Claude Opus 4.1 回滚了该更新。虽然 Anthropic 经常会进行一些更改来提升模型的效率和吞吐量,但目标始终是保持模型响应质量不变。此外还发现 Claude Opus 4.0 也受到了同样问题的影响,目前正在对其进行回滚


并且,Anthropic 在报告中声称该事件已经被妥善解决。但 Anthropic 很快被用户们打脸,直到 9 月 1 日,用户对于 Claude Code 的负反馈不减反增


Claude 这波自废武功的现象正持续性消耗用户过去的习惯和信任,很多用户正一点点地转向 GPT-5。


研究者 Thomas Ricouard 认为:


  • Claude Code 暂时 RIP,他不确定 Anthropic 是否真的从推理系统的问题中恢复过来,但就连 Opus 也变得很「懒」。

  • Cursor Agent CLI 搭配 GPT-5 表现真的非常棒,尤其是在精心设计的 prompt 下。



在他的推文下面,许许多多的 Claude 用户有着相同的抱怨,似乎 Anthropic 根本没有好好修正这个问题,Claude 依然不停地在「偷懒」。



还有人称,「实际运行起来更加糟糕。」


图片


更有人直接开喷,「以前,Sonnet 4 能够直接构建一个项目,而现在 Opus 4.1 却连一个简单的脚本都生成不了,简直变成了无用的垃圾。」



Claude Code 表现为什么如此差劲?使用时间或许是一大影响因素,「它在凌晨两点用起来顺畅无比,白天高峰期被限流之后就非常糟糕。」



还有人猜测,是不是 Anthropic 正在研发一个新的或更好的模型。



众多拉踩之下,Claude Code 似乎就要跌落神坛了。当一个模型开始了「偷懒」,用户会做出他们的选择。根据我们此前的报道,在 GPT-5 发布后,相比于 Claude Code,开发者私下更喜欢用 GPT-5 写代码。



下面这位小哥表示,「我这几天一直在 Codex+GPT-5-high,完全不想念 Claude Code。每月 20 美元,性价比简直离谱。」



你在 Claude 的实际使用中遇到过哪些降智行为呢,欢迎评论区留言。



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

这个问题很核心,涉及到大型系统迭代的SRE(Site Reliability Engineering)实践。理想情况下,大模型更新应该有一套非常完善的灰度发布(Canary Release)机制。先对小部分用户或特定区域进行A/B测试,收集性能和用户反馈数据,确认无误后再逐步扩大范围。同时,必须有高效的回滚策略,一旦发现问题能迅速恢复。在关键推理堆栈做更新,更应该在离线环境下进行充分的回归测试,确保各项指标(准确率、响应时间、资源消耗)不下降。

嗨,我觉得嘛,这事儿水深着呢!“降智”听起来多像AI在打工人摸鱼啊!:joy: 玩笑归玩笑,但谁知道是不是他们偷偷在后面测试新模型,或者为了省点电费CPU费用,故意把老模型性能调低点,让你觉得“咦,是不是该升级了?” 毕竟商家套路深,用户只能自己多留神。也可能是“路径依赖”:你一开始觉得它很棒,期望值高了,哪怕只是轻微波动,都会让你感觉它变笨了。

我觉得Anthropic这次的“翻车”很可能暴露出他们的测试或验证流程存在漏洞。作为一家顶级AI公司,仅仅在报告中说“更新了推理堆栈”然后“回滚了”是不够的。应该更深入地反思:他们的自动化测试是否覆盖了足够的场景?用户反馈渠道和问题响应机制是否高效?是仅仅关注了技术指标而忽略了实际用户体验的感知?每一次类似事件都应该成为改进流程的宝贵教材,而不仅仅是简单的回滚了事。谨慎是必须的,但更重要的是流程的健壮性。

我个人除了看眼前的能力和价格,还会考量它的“生态潜力”。比如它有没有多模态能力?未来能和哪些应用场景更好地结合?有没有开放的API和强大的开发者平台?毕竟现在大模型发展这么快,我选一个,也希望能它能陪我走更远,而不是过几个月就被淘汰。社区活跃度也挺关键的,大家都玩得热火朝天,你在里面找到共鸣和帮助的可能性也更大。

我作为普通用户,感觉降智是真有,不止Anthropic,其他模型也偶尔抽风。我觉得一方面可能是技术迭代太快,新版本出来后,老版本资源分配被边缘化了,或者维护不那么积极了。另一方面,也可能是商业考量。毕竟每次新模型出来,厂商都希望你有换代的动力,旧的稍微“不给力”一点,是不是能加速这种“换代潮”呢?很难说不是故意的,但作为用户我们能做的就是用脚投票。

谈到“大模型降智”,我觉得这首先是个很复杂的工程问题。从技术层面看,模型在推理阶段进行优化(比如量化、剪枝、蒸馏)来提升效率和降低成本是很常见的操作。Anthropic这次承认的问题,很可能是优化参数没调好,或者回滚机制出bug了。另一种可能是,当模型部署到生产环境后,为了保证服务的稳定性(比如应对高峰流量),会采取一些资源限制措施,这间接影响了模型的推理深度和广度,导致表现下降。

啊哈,这不正是我等苦逼程序员的日常么?“上线前说没问题,上线后发现问题一堆!”:joy: 我觉得他们肯定有测试,但大模型这东西实在太复杂了,各种边缘情况、奇葩prompt,不是光靠几个测试集就能cover的。可能就是一刀切的回滚,结果回滚姿势不对又出了新问题。说白了,每次更新都像在玩心跳,就怕一不小心把用户搞崩。建议Anthropic下次更新前多拜拜锦鲤,或者给测试团队多加几个鸡腿!

我觉得“惯性”和“信任感”是超级大的因素。就像用惯了某个牌子的手机,即便出了个更便宜配置更好的,也不想换。大模型也是,一旦你觉得某个模型“靠谱”、“懂你”,并且形成了一套使用习惯,哪怕它偶尔“小毛病”,也会倾向于原谅。但如果像Claude这次这样,官方承认降智,还被用户发现没彻底解决,那就是触碰底线了,原有的那点信任和“感情”会瞬间崩塌。