国产模型再证实力!Qwen 3.7 Max预览版深夜突袭,LMSYS竞技场上演“双星登顶”

导语:通义千问Qwen3.7预览版突发上线大模型竞技场,斩获国产文本与视觉双项第一,技术迭代迎来全新爆发期。

国内大模型圈子这阵子温差极大,让人有些摸不着头脑。前阵子大家还在热烈探讨Qwen 3.6-Max-Preview的实测表现,结果没过几周,阿里又在一片安静中整了个大活儿。今天一早醒来,相信不少深耕AI圈子的朋友已经被海外社交媒体刷屏了——Qwen 3.7的双版本预览版已经在前线打响了第一枪。

根据大模型排位赛风向标LMSYS Chatbot Arena官方公布的最新进展,Qwen3.7-Max-Preview与Qwen3.7-Plus-Preview的测试成绩已新鲜出炉。这个突如其来的消息,不仅让社区开发者们感到猝不及防,更直接把阿里在大模型全球竞技场上的身位往前狠狠送了一大步。看着这份沉甸甸的成绩单,我们能清晰感知到,通义千问团队在模型迭代这件事上,已经从“小步跑”演变成了“挂挡狂飙”。

空降即王座:LMSYS双榜之下的国产骄傲

衡量一个大模型是否真正耐用,不能只看厂商发布会上的静态跑分,而要看它在复杂、无序的真实人类交互场景下究竟能走多远。Chatbot Arena之所以被业内公认为权威,正是因为其盲测排名的机制基本排除了“刷榜”取巧的可能。这次Qwen 3.7并不是单枪匹马杀入战局的,而是派出了文本与视觉的“双子星”阵容。

在传统强项的文本领域,Qwen3.7-Max-Preview展现出了令人惊艳的压迫感,直接冲到了全球总榜第13位。这也让阿里巴巴背后的技术团队(实验室)在组织总榜上的排名跃升至全球第6。在所有上榜的中国大模型中,它是无可争议的头名。

如果仔细瞅瞅它身前的对手,你会发现这含金量高得吓人。排在Qwen3.7-Max前面的,几乎全被 Claude 4.6和4.7系列、Gemini 3 Pro系列,以及GPT-5系列等全球顶尖的“怪兽级”闭源模型霸占。换句话说,Qwen3.7-Max-Preview是全球前十五名中唯一的一抹中国亮色。

在细分赛道上,这款模型也敲开了世界前十的大门。尤其是在对逻辑能力、架构化思维要求极其苛刻的Coding(软件工程与代码编写)领域,它直接拿到了全球第10名的好成绩。

多维立体的“战力渗透”:视觉与专家竞技场双重突围

在文本版大杀四方的同时,偏向多模态视觉处理的Qwen3.7-Plus-Preview也交出了一份优秀的答卷。在LMSYS视觉领域榜单中,它取得了全球第18名的成绩,助力阿里团队在多模态视觉领域的合力排名上升至全球第5。同样,它也是视觉领域榜单里,唯一名列前茅的中国模型。

不仅如此,在高难度任务聚集的“专家竞技场”(Hard Prompts Arena)上,阿里本次的表现也堪称稳健。在专门考量大模型理解高难度、多步骤复杂指令的“专家提示词”维度上,Qwen3.7-Max-Preview一举夺得全球第9名。而在这个细分榜单上,我们还能看到另一家中国厂商的惊艳表现——小米的Mimo v2.5 Pro位列全球第7,展现了中坚AI力量的抱团崛起。

看着这一连串在海外核心榜单上拿下的漂亮战果,Qwen官方账号也在社交平台上兴奋互动,直言已经“迫不及待想要发布完整的Qwen3.7系列”。不过,很多围观的开发者在兴奋之余,心里也犯起了咕哝:前不久刚露脸的Qwen 3.6-Max还在预览阶段,怎么新一代的超大杯这么快就端上桌了?阿里的保密工作做得实在太严,手里到底还藏着多少大招?

解密Qwen迭代曲线:从“随大流”到“狂奔交付”的背后

如果说模型性能的提升让用户用得爽,那么Qwen团队这近乎失控般的迭代速度,则让整个行业感到了些许窒息。就像有些社区网友调侃的那样:“我上一个模型都还没跑完 benchmark 呢,阿里的下一个预告片怎么就自动播放了?”

这可真不是大家的错觉。当我们静下心来拉出一条关于Qwen系列演进的全局时间线,就能清晰地看出这背后惊人的加速轨迹:

【Qwen3.7Max版发布】通义千问大模型竞技场排名跃升

回看2023年到2024年的早期阶段,Qwen的发展节奏基本遵循着市面上主流AI大厂的做法。从初代发布,到后来的Qwen1.5和Qwen2,大版本的更新周期维持在4-6个月之间。这对于需要沉淀技术、消化算力的阶段来说,是一个极为健康且稳扎稳打的节奏。

真正的变局发生在Qwen3系列的诞生。自此,通义千问全面引入了“极速响应”与“深度思考”的双轨模式——前者满足低延迟的日常对话与高并发交互;后者则针对复杂的数学、编程等高阶Agent长链路决策进行深度优化。参数覆盖面从0.6B的端侧极小尺寸,一路贯穿至235B的怪兽级MoE结构。

也是从这一代开始,整个Qwen家族的进化速度陡然换挡。大版本之间的间隔被直接缩短到了2-3个月,甚至在进入2026年之后,几乎每个月我们都能看到全新的版本动作。这种“Preview先上、社区共建、正式版迅速补位”的敏捷模式,不仅成了阿里团队独树一帜的战术,也印证了其内部工程研发管线已经高度跑通且流水线化。

主帅离任后的长跑:国产开源AI的血路与承接

在这场疯狂的迭代秀中,不少细心的业内观察者不由得联想到了前段时间的人事变动。作为Qwen系列前关键负责人的林俊旸,在其离职时曾经留下过一段让人印象深刻的寄语:“Qwen的兄弟们,按原来安排继续干,没问题的。”

彼时正值Qwen 3.5初露峥嵘的关口。作为与DeepSeek并肩站立在国产开源最前沿的标杆,核心主帅的卸任,在当时确实给外界蒙上了一层微弱的担忧阴影。但从如今Qwen3.6以至今天Qwen3.7的奔跑姿态来看,这支团队的底层齿轮依然在极其高效地啮合前行。老将虽去,新火不熄。更快的交付频率、更加稳健的榜单霸榜表现,无一不在回应对技术传承的信心。

过去,我们习惯于用年、甚至几年的跨度去等待一项硬件产品的技术微调;而现在,大模型产业正以一种撕裂常规的成长阵痛,逼着每一个参与者拼命往前狂奔。在这条不断陡峭的智能指数曲线前,没人能够停下脚步。这一次Qwen 3.7双预览版的试水爆红,不仅是一场技术实力的集中展示,更是对全球AI开源竞争格局的一次有力宣告。技术长河滚滚向前,接下来的正式版究竟能把上限拔高到什么地步,确实值得我们保持高度关注。

【Qwen3.7Max版发布】通义千问大模型竞技场排名跃升

© 版权声明

相关文章