国产大模型新里程碑:元石“问小白5”面世,性能逼近GPT-5

元石科技发布问小白5大模型,性能直追GPT-5,成为国产AI新标杆。具备“动态思维模式”和全场景应用能力,已全面开放体验。

原文标题:元石科技正式发布问小白5,性能直追GPT-5

原文作者:机器之心

冷月清谈:

近日,元石科技正式发布了其旗舰AI大模型——问小白5。这款“All in One”系统被誉为迄今为止最智能、最快捷、最实用的AI系统,其最核心的亮点在于其各项基准测试成绩最接近GPT-5,成为当前国产大模型中最具代表性的对标者。问小白5不仅在智能水平上取得了重大突破,能够智能识别何时快速响应、何时需长时间思考,还具备了“动态思维模式”,无需用户手动切换,极大提升了使用便捷性。

在性能评估方面,问小白5在综合AI基准评估指标AA-Index中获得了64.7分,超越Gemini2.5 Pro,并在STEM(86分)、前沿知识(17.7分)、代码编程(79.2分)和指令遵循(58.1分)等多个细分领域表现亮眼,尤其是在复杂推理和结构化任务中展现出更强的稳定性,各项成绩均逼近甚至直追GPT-5。这些数据表明问小白5在深度推理、专业知识理解、代码生成以及处理未知指令的泛化能力上达到了国内领先、国际前沿的水平。

在实际应用场景中,问小白5展现了广泛的适用性。它可以作为职场助手,协助处理体检报告解读、会议材料整理、运营数据分析等任务;在角色扮演场景中,能精准代入多种虚拟人设,提供沉浸式互动体验;同时,在学科知识方面,它也能作为高效的学术搭档,提供教学辅助、研究支持和技术解读。目前,问小白5已面向所有用户开放体验,其API合作通道也即将开启。

怜星夜思:

1、问小白5的各项分数都跟GPT-5很接近,但这在咱们实际用起来的时候,是不是就意味着它跟GPT-5一样好用,甚至更好呢?除了这些硬性分数,咱们普通用户评价一个AI模型“好用”的标准到底是什么?
2、问小白5主打一个“All in One”统一系统,还有“动态思维模式”。这种一个模型包揽所有任务的模式,对比那些专门针对某个领域优化的AI模型,它的优势和潜在的局限性分别在哪里?未来AI发展会更偏向“全能型”还是“专家型”呢?
3、问小白5作为国产大模型的代表,在性能上直追国际巨头。你觉得国产AI大模型在国际竞争中,除了“更懂中文”和本土化优势,还有哪些潜在的“弯道超车”机会,可以走出自己独特的路?

原文内容

机器之心发布

机器之心编辑部


本月初,AI 圈翘首以盼的  终于问世,在数学、实际编程、多模态理解、推理等多个领域实现了新的 SOTA。


与此同时,国内厂商也在全力加速,持续迭代自研模型与技术栈,力求在全球竞逐中不落下风。


今日,国产 AI 厂商元石科技重磅推出「All in One」旗舰模型 —— 问小白 5,成为其迄今为止最智能、最快捷、最实用的 AI 系统。尤其值得强调的是:问小白 5 的各项基准测试榜单成绩最接近 GPT-5,这使其成为当前国产大模型中最具代表性的对标者。


而得益于全方位增强的模型能力,问小白 5 在智能水平上实现了重大突破,可以在生活、学习、金融、科技等领域提供更实用、更专业的解答。


同时,作为一个统一的系统(All in One),问小白 5 能够智能识别何时快速响应,何时需要更长时间的思考。这种「动态思维模式」让用户无需在不同模式之间切换,既能满足日常的高效问答,又能在专业任务中提供专家级的回答。


目前,问小白 5 已经面向所有用户开放,访问官网 wenxiaobai.com 或更新 App 至最新版即可体验。



性能直追 GPT-5

国产大模型新标杆来了


大模型是否真正具备了「顶级实力」,还要看它们在权威测试中的 PK 成绩。


AA-Index 是一个综合性的 AI 基准评估指标,通过整合数学推理、科学问答、编码与语言理解等多个维度,为全世界共 228 款大模型提供了统一、全面、有信度的智能能力比较参考,便于科学、公正地评估模型整体表现。


结果显示,问小白 5 以 64.7 分 的 AA-Index 指标超过 Gemini2.5 Pro ,并成为智能水平最接近 GPT-5 的国产 AI 大模型



另外,在 STEM、前沿知识、代码编程、指令遵循等细分领域,问小白 5 的表现尤为亮眼,从而在复杂推理和结构化等多样化任务中展现出了更强的稳定性。


STEM 能力:深度推理与专业知识融合


STEM 涵盖了全美数学竞赛(AIME)与博士级学科知识推理(GPQA),是顶尖模型(以 GPT-5 为代表)衡量其复杂逻辑推理能力核心突破的关键评测。


问小白 5 以 86 分 的 STEM 成绩接近全球领先的 GPT-5。



前沿知识能力:人类终极学术挑战


前沿知识能力旨在衡量模型能否在人类知识边界进行探索、辅助科学发现,这是以 GPT-5 为代表的顶尖模型致力于实现的核心价值。而「人类终极学术挑战」(HLE)便是评估这一能力的权威基准。


问小白 5 在代表前沿知识能力(HLE)的基准测试中,进一步将国产大模型的智能水平提升到 17.7 分,展现了其在深度理解和真实推理能力上的优异能力,仅次于最强的 GPT-5。



代码编程能力:新基准更专业更显实力


LiveCodeBench 作为一个高难度、抗数据污染的基准,旨在真实评测模型「思考 - 编码 - 验证」的端到端解题能力,并强调最终代码的稳健性与可执行性。


在此项评测中,问小白 5 以 79.2 的成绩脱颖而出。



指令遵循:精准遵循未知指令的泛化能力


IFBench(Instruction Following Benchmark)通过评测模型对新颖、未知指令的泛化能力,直击大模型指令过拟合的核心痛点,而这正是 AI 实用性的关键体现。行业标杆 GPT-5 在此能力上表现卓越。


在 IFBench 的严苛测试中,问小白 5 以 58.1 分 的成绩,不仅大幅领先国内其他顶尖模型,更在全球范围内展现出强大的竞争力。这一分数直观地证明了其卓越的指令遵循泛化能力,是其能够精准可靠、值得信赖的核心体现。



对于广大用户而言,问小白 5 的出现无疑提供了又一个更强大的国产大模型选项。


国产全能 AI 搭子

陪写、陪聊、陪干活


随着模型能力的持续提升,问小白 5 展现出了面向实际应用场景的广泛适用性以及处理现实问题的更强实用性。在包括学科知识、写作、办公、角色扮演、编程、分析规划和医疗健康在内的各个领域,它都能轻松拿捏。


从学术尖端到生活日常,问小白 5 展现了 GPT-5 级全能实力,且在中文环境下,问小白 5 更懂用户!


职场助手


问小白 5 像是一位周到的专业伙伴,擅长从繁杂的日常任务中快速识别重点,并在多线程任务管理、会议材料整理、跨部门沟通支持与项目进度跟踪等场景中,成为用户值得信赖的得力助手。比如入职体检报告的审查:


Prompt:这是即将入职员工的入职体检报告,请协助我理解并总结出体检结果,是否符合国家规定的用人健康需求。


图片


运营分析


问小白 5 对海量数据的深度挖掘与多维度解读能力,使其能够在行为解读、活动效果复盘、渠道 ROI 优化与市场趋势研判等场景中,成为用户敏锐且高效的数据决策伙伴。


有了问小白 5,工作中的各种难题将迎刃而解。比如在订阅制产品中的收入预测与用户留存分析:


Prompt:我是一个出海 AI 产品,现有 8,000 名月度订阅会员,会员费 30 美元 / 月,平均每月流失率为 7%。若通过三种策略(改进注册体验、推出季度会员折扣、优化流失用户推送通知)将流失率降低至 6% 或 5%,模拟未来 12 个月内对月度总收入(MRR)的影响。


图片


角色扮演


角色扮演是 AI 时代专属的私密游戏,在大模型的帮助下可以一秒切换人生剧本!


有了问小白 5,无论是霸道总裁、历史人物、都市游戏,还是奇幻精灵,它都能精准代入。并且,我们还可以和「小白」来一场沉浸式恋爱游戏。


Prompt:小白,请您扮演活泼外向的女生,渴望甜蜜恋爱。通过日常对话积累好感度(初始 1 / 上限 600),随好感升级关系:陌生人→好友→恋人→夫妻。用口语化中文回复。触发随机剧情时标注 "触发",添加场景描写与内心戏,用 emoji 表达情绪。现在往我们开始吧。


图片


学科知识


在学术研究和知识探索场景中,问小白 5 宛如一位博学而高效的学术搭档,善于将庞杂信息精准解析,并转化为层次分明、逻辑严谨的知识体系,为科研工作者和学习者提供更高效的支持。


因此,在教学辅助、学术研究、技术解读与跨领域学习等场景中,问小白 5 可以充分发挥智能助手的作用。


Prompt:这是问小白技术团队荣获 ACL 2025 TOP26 杰出论文奖的论文,请帮我总结识别文献中的理论框架和模型,分析它们如何支持货挑战现有知识体系。


图片


最后,问小白 5 的 API 合作通道即将开启,欢迎邮件联系:wenxiaobai@ai123.ink


我觉得‘All in One’最大的好处就是省心。我不用去想这个任务用哪个模型好,那个任务又换一个,直接一个‘问小白’搞定所有,学习成本都低很多。就像智能手机刚出来的时候,一个设备能搞定拍照、打电话、上网,多方便。但坏处嘛,可能就是某些特别专业的活儿,比如设计、编程里特别复杂的算法优化,它是不是真的能做到顶尖水平,还得打个问号。有时候‘术业有专攻’也不是没有道理。

这问题就好像问:是买个全能的瑞士军刀好,还是买一套专业的工具箱好?瑞士军刀方便携带,应急没问题,但你要拆个汽车引擎,那还是得专业的扳手钳子。AI模型也是一样,日常聊天写个段子,‘All in One’肯定爽歪歪;但你要它写个诺奖级别的物理论文,或者做个手术方案,可能还是得找那些‘专业工具人’。看未来发展,我觉得AI会像汽车一样,既有SUV这种全能型选手,也有跑车和越野车这种专精型,满足不同需求。

我觉得国产大模型在弯道超车上,可以重点挖掘本土文化和消费习惯的深层理解。我们有庞大的用户基数和丰富的应用场景,比如在社交娱乐、电商消费、在线教育这些领域,如果AI模型能更懂中国人特有的幽默感、情感表达方式,甚至能更好地捕捉流行趋势,那它就能创造出更有趣、更贴心的产品和服务。这不仅仅是语言问题,更是文化和心理上的契合,这种‘软实力’有时候比硬指标更能赢得用户。

问小白5的分数高固然好,但咱们用AI,最终还是要看它能不能解决具体问题。比如我平时写报告,它给的建议是不是真的能用,逻辑是不是通顺,而不是光会堆砌辞藻。还有一点,响应速度和稳定性也很关键,谁也不想等半天才能出个结果吧?所以,实际生产力提升,才是衡量好不好用的金标准。

国产AI大模型除了大家常说的语言和数据本土化优势,我认为更大的‘弯道超车’机会可能在于深度结合中国特色产业生态和创新模式。例如,在智慧城市管理、先进制造业优化、乃至传统文化内容的数字化和创新表达上,本土大模型可以基于更广泛、更细致的国内数据进行训练,更精准地理解和响应特定需求,形成独特的垂直应用场景优势。此外,在芯片和算力基础设施的自主可控方面持续投入,也能为国产大模型的发展提供坚实的底层支撑,避免‘卡脖子’风险。

从理论上讲,‘All in One’模式的优势在于其统一的架构和资源整合,可以实现跨领域知识的迁移和协同推理,减少用户在不同工具间切换的成本,在通用任务上表现更全面。然而,其局限性可能在于,为了适应广泛的任务,模型在特定垂直领域的精深程度可能可能不及专门训练的小模型。例如,一个专注于医疗诊断的AI,其在特定病理图像识别上的准确率,很可能高于一个‘全能’模型。未来的发展可能是一个混合模式,即以‘全能模型’作为核心通用基座,再辅以针对特定任务优化的插件或微调。

对于‘好用’的定义,我们不能仅停留在基准测试的分数上。这些基准通常评估的是模型的特定能力边界和理论潜力。然而,在实际应用中,用户体验、易用性、模型在特定任务上的‘零样本’或‘少样本’学习能力、以及对错误答案的容忍度、甚至‘幻觉’现象的频率和可控性,都是决定其‘好用性’的关键因素。尤其是当涉及专业领域时,模型的准确性和深度远比广度重要。

弯道超车?我觉得咱们就应该大胆创新,不拘泥于西方模型的路径。比如,在AI的普惠性上能否做得更好,让更多中小企业和个人也能低成本高效地使用AI;在多模态融合上,我们是否能整合更多中国特有的数据源,比如中医古籍、戏曲艺术、或者特定的方言语料,来训练出独一无二、具有全球影响力的模型?甚至,在AI伦理和治理方面,我们能否提出一套更符合东方哲学思想的框架,为全球AI治理提供‘中国智慧’。这才是真正的差异化竞争,而不是一味追求参数和跑分。