稍微留意下近期的新闻,“赶超GPT-4”正在成为国产大模型的新热点。
百度文心一言、商汤日日新以及阿里云刚刚发布的通义千问2.5,均已迈入“全面赶超GPT-4”阵营。
把时间线稍微拉长一些的话,过去大半年时间里,“超越GPT-4”的消息可谓屡见不鲜,即使在报道中刻意加上了多项基准、部分指标等前缀,依然赚足了眼球,成为国产大模型佐证自身能力的有力指标。
简单做个复盘的话,国产大模型对GPT-4的追赶已经进行了400多天,其中“赶超进程”可以粗分为三个阶段。
第一阶段:部分性能超越GPT-4
2023年3月14日,OpenAI正式推出了GPT-4,彼时大多数国产大模型还未开放,少数内测大模型的比较对象还是GPT-3。作为业界标杆的GPT-4,就像是科幻照进了现实,被无数人捧上神坛。
但在短短半年后,GPT-4就出现在了国产大模型厂商的比较名单里。

2023年8月底,商汤科技对外公布了一则新进展:拥有1230亿个参数的“书生·浦语”,在全球51个知名评测集共计30万道问题集合上,测试成绩排名全球第二,并在综合考试agieval、知识问答commonsenseqa、阅读理解和推理的十项评测中位列第一,分数超过风头正盛的GPT-4。
2023年10月17日的“生成未来”发布会上,百度正式发布了文心大模型4.0版本,李彦宏在现场依次演示了大模型的理解、生成、逻辑和记忆四大核心能力的特点与应用场景。尽管没有给出评测数据,李彦宏却自信地表示:文心大模型4.0的综合水平,“与GPT-4相比毫不逊色”。
国产大模型赶超GPT-4的序幕正式拉开,此后一两个月里,不少大模型给了这样的营销口径:整体能力已经不输于GPT-3.5,并且在部分性能指标上开始超越GPT-4。
第二阶段:整体性能逼近GPT-4
时间来到2024年初,国内的“百模大战”进入收敛期,一些不被资本市场认可的大模型,渐渐成了一个数字,只有几家科技大厂和独角兽仍活跃在大模型一线。“活下来”的大模型,势必要在能力上证明自己。
综合性能逼近GPT-4,开始成为新的营销话术。

2024年1月中旬的智谱AI技术开放日上,正式发布了新一代基座大模型GLM-4。按照智谱AI官方的说法:在权威的英文测试榜单中,GLM-4已经整体逼近GPT-4,平均能达到GPT-4 90%以上的水平,在个别项目上表现持平;而在国内企业更加看重的中文任务上,GLM-4的表现全面超过GPT-4。

同样是在2024年1月,科大讯飞发布了星火认知大模型V3.5,在逻辑推理、语言理解、文本生成、数学答题、代码、多模态等核心能力均显著提升,其中语言理解、数学能力已经超过GPT-4 Turbo,代码能力达到GPT-4 Turbo 96%,多模态理解达到GPT-4V 91%。“在中文理解方面,甚至遥遥领先。”

回头来看,智谱AI和科大讯飞的营销策略还是有些“保守”,百川智能在同一时间段发布的Baichuan 3,对外表示已经在CMMLU、GAOKAO等中文评测中超越GPT-4。
第三阶段:全面赶超GPT-4 Turbo
2023年11月的OpenAI首届开发者大会,GPT-4 Turbo可以说整个活动的焦点,不仅比GPT-4更聪明,文本处理的上限更高,推理的速度更快,价格也更便宜,国产大模型随即迎来了新的比较对象。

先是2024年4月份发布的日日新5.0,拥有6000亿参数,并在发布会上引用了OpenCompass的评测数据:日日新5.0达到或超越了GPT-4 Turbo版本,几乎全方位碾压了同期发布的 Llama 3-70B。

再然后就是阿里云刚刚发布的通义千问2.5,根据媒体报道中的说法:模型性能全面赶超GPT-4-Turbo,成为“地表最强”中文大模型;通义千问1100亿参数开源模型在多个基准测评收获最佳成绩,超越Meta的Llama-3-70B,成为开源领域最强大模型。

可以笃定的是,日日新5.0和通义千问2.5只是个开始,后续将有更多国产大模型在能力上超越GPT-4-Turbo。
毕竟科大讯飞早已预热了上半年发布星火认知大模型V4.0的消息,将全面对标GPT-4系列;文心一言4.0的发布已经超过半年,不排除新版本正在准备中,且大概率会在性能上再上一个台阶……
“跑分”的意义在哪里?
不管是一开始的“部分性能超越”,还是现在进行中的“全面赶超”,依据都是第三方评测结果,或者说大模型厂商的主观判断。比如商汤和阿里云争相引用的OpenCompass,就是上海人工智能实验室开源的大模型评测平台。
对于一些大模型沉迷于刷榜、跑分的现象,上海人工智能实验室领军科学家林达华教授曾在媒体采访中直言:通过题海战术提高大模型成绩,对于模型实际能力的反应是失真的,影响了模型研发团队的改进方向和模型的商业落地,“高分低能”伤害的是机构本身;榜单上任何具体的名字只是大模型成长过程中无数次测试中的一次,一时的排名高低并不真正反映模型的能力。
何况很多大模型测试集为了公开透明,测试题目或者提纲都是公开的,大模型厂商不难通过“针对性的训练”来提高分数。只要将足够的的测试题喂给大模型,在开卷考试的机制下,分数总不会太低。
也就是说,分数高并不一定代表大模型的能力强。“跑分”的意义仅仅是让客户或开发者对大模型能力有一个初步的认识,最终的评估因素永远是“能不能解决问题”,“能不能在场景中带来实实在在的生产力”。
特别是在大模型走向落地应用的趋势下,一味炒作“超越GPT-4”、“跑分第一”,妄顾落地应用的实效,可能会适得其反。以大模型应用中比较常见的财报分析为例,如果大模型连一家企业的财报都看不懂,再高的计算分数也不会让客户信服,反而会被排除在合作名单外。
而参考中信证券等机构的研究报告,目前OpenAI的GPT-5正处于红队测试阶段,有望在今年夏天正式发布,可能在多模态理解、长文本输入、zero-shot学习等方面实现重大突破,且性能将远超GPT-4。即使国产大模型花费400多天追平了GPT-4,在相当长一段时间里,仍将处于追赶的姿态。
大模型的价值是解决日常问题的生产力工具,赶超GPT-4的阶段性升级,可以看作是国产大模型有序迭代部署、不断拉近差距的标志,切莫像手机跑分那样,在过度营销的作用下,沦为被群嘲的对象。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
9月24日,2025云栖大会在杭州开幕,阿里巴巴集团CEO、阿里云智能集团董事长兼CEO吴泳铭发表主旨演讲,首次系统性地阐述通往ASI的三阶段演进路线,包括智能涌现、自主行动以及自我迭代等,实现从学习人、辅助人到超越人的发展脉络。基于上述的发展路线,吴泳铭对外做出判断,大模型是下一代的操作系统。“我
文/二风来源/节点财经每年高考成绩放榜后,数千万考生和家长将迎来另一场硬仗——填报志愿。今年,这一领域迎来了AI的全面介入,多家互联网大厂和教育公司纷纷推出智能志愿填报产品,为考生提供院校和专业选择建议。据艾媒咨询数据,2023年中国高考志愿填报市场付费规模约9.5亿元,近九成考生愿意借助志愿填报服
崔大宝|节点财经创始人进入2024年,大模型似乎有熄火之势:资本市场,与之关联的概念炒不动了,英伟达股价动辄暴跌重挫,引发“泡沫戳破”的担忧;消费市场,BATH们的推新活动少了,产品更新迭代的速度慢了,民众的关注度降了……热闹的大概只剩下两场酣仗:自5月15日字节跳动宣布“以厘计费”,打响国内大模型
年初大模型行业上演“长文本”大战时,我们就萌生过做一个“读书助理”的想法。测试了市面上主流的大模型后,发现普遍存在两个不足:一种是可以处理的文本长度不够,即使有些大模型将文本长度提升到了20万字,像《红楼梦》这样近百万字的名著,还是需要多次才能“读”完。另一种是语言理解和生成能力不足,经常出现“幻觉
9月23日,在2026云栖大会上,华中科技大学同济医学院附属同济医院(以下简称“同济医院”)宣布将与阿里云共建人工智能科研转化平台,依托阿里巴巴AI大模型将科研成果转化为医院智能体、专家智能体等临床应用,推动医疗AI从科研走向临床。该平台将服务于同济医院国家医学中心,打通从基础研究、临床验证到产业转
9月23日,2026云栖大会上,千问办公启动“AI教育灯塔计划”。该计划面向全国大中小学,在教学、科研和校园管理等场景提供AIAgent产品与应用支持。北京大学、浙江大学、复旦大学、东南大学、同济大学、南开大学等高校,以及北京、上海、深圳、杭州、重庆、西安、武汉等地区域教育主管部门和中小学首批加入,
依托QuestMobile人工智能洞察数据库统计数据,一份国产AI影响力榜单正式出炉。该榜单以2026年8月底前的各主流大模型平台App端与PC网页端合计月活跃用户规模为衡量标准,按用户规模降序完成排名。本次榜单评出的国产AI影响力六强依次为豆包、千问、DeepSeek、腾讯元宝、Kimi、文心一言
AI办公的战争,已经打成了白刃战。今年9月前后,腾讯、阿里、字节、百度——这四家互联网巨头,都完成了AI办公产品线的集中收口,当下他们都在关注一件事情:让AI真正走进企业工作流程。四家的兵器也完全不同。腾讯手里最锋利的刀,是企业微信,1400万企业账号是它的刀锋。阿里的矛是钉钉,2亿级的月活用户,就
8月31日,一部没有任何真人演员的AI剧集—《后西游记》,进入了省级卫视的电视剧黄金档。该剧由芒果TV出品、芒果TVAIGC创新内容中心制作、伯璟文化承制,改编自明末清初同名神魔小说,是《西游记》三大续书之一。作为季播剧,《后西游记》率先播出的是第一季“花果山篇”共5集、每集40分钟。这是第一部以长
2026年,AI不再只是“问答对话”的工具,开始真正“完成工作”,这背后发生了一连串技术变化,从模型Scaling转向智能上界、推理效率、长程任务、Agent系统。这些变化,汇聚在“先行者”自述的字里行间。Anthropic有望在9月下旬公开招股书,智谱发布上市以来的首份中期业绩。中美两家大模型公司
在AI演员是否能取代真人的讨论愈演愈烈之际,已经有明星开始“未雨绸缪”将AI当成了副业。据悉,胡彦斌用AI做了一个App;C罗投资了一家200亿美元的AI公司;王嘉尔设计了一副AI眼镜,MagicAIGlasses售价约1000元;周杰伦母亲持股的公司和宇树科技联手,要做一只“巨星狗”……除此之外,
过去两年,在AI技术浪潮的驱动下,硬件“复兴”成为电子消费市场一条清晰的主线,不仅诞生了许多新品类,而且几乎所有的硬件都在以AI为卖点,重新打造产品竞争力。他们想要抓住的,不单单是某一个产品或赛道,而是未来可能成为一个控制入口或交互入口的希望。当然,更为迫切的是为低迷的市场找寻新的增长点、扭转增长的
作者:Evin编辑:刘致呈审核:徐徐出品:互联网江湖最近,具身智能赛道迎来了一场意外风波。先是刚刚才带领公司完成上市的梅卡曼德CEO邵天兰,在朋友圈公开炮轰当前行业盛行的一种“攒局型”具身智能创业——套路就是靠各种关联交易(如“数采中心”“租赁公司”)做出不可持续的收入,并通过发布“大新闻”炒作,以
近日,中国金融AI领跑者讯兔科技正式完成超3亿元人民币B轮融资。至此,公司在过去一年内已连续完成三轮融资。本轮融资进一步汇聚金融产业的战略力量,投资方覆盖险资、券商、公募、产业资本与头部投资机构。保险业国家级投资平台中保投资、头部券商系私募基金子公司广发信德共同参与;同时获得启明创投、琥珀资本、嘉程