实测|MiniMax M2.7化身西游取经团:5大Agent协作,AI终于学会“主动干活”了!

导语:MiniMax M2.7实测:多角色Agent协作完成科研任务,展现真正的项目推进能力。

还没把“龙虾”养肥,“花钱请人卸载龙虾”最近又成了AI圈子的新生意。这背后反映出一个现实问题:当我们把AI Agent放进真实工作流时,它并没有想象中那么“能干”——它能开始任务,但执行过程反复中断;多轮对话中上下文丢失,前后不一致;面对非标准需求时,无法精准调用外部工具;有人甚至一觉醒来发现邮件被清空、Token烧了几千刀。

一个扎心的共识是:现在的AI Agent,更像在“单点炫技”,而不是“完成工作”。它们擅长写文案、画张图、跑段代码,一到端到端接管真实商业流程或学术长链任务,就露馅了。问题并不出在Agent的外壳形态上,而是底层大模型本身还不具备稳定可靠的“执行力”。大模型必须跨越一道分水岭:从被动的“单次生成反馈”进化到主动的“任务拆解与组织执行”。

带着这个问题,我们决定用更接近真实使用场景的方式来测一次——搭一个“西游取经团”,看看MiniMax M2.7模型在分工协作中,究竟能把事情推进到什么程度。

核心实测——当“西游取经团”遇上真实学术场景

我们搭建了一套多角色协作系统,由五个角色组成的“西游取经团”,基于OpenClaw框架,将科研流程拆解为五个职责:方向规划、算法实现、学术写作、文献整理与数据处理。对应五个Agent:

  • 唐僧:科研战略与方向规划
  • 孙悟空:算法开发和工程落地
  • 猪八戒:学术写作与表达
  • 沙僧:文献整理与知识管理
  • 白龙马:数据处理与流程自动化

任务设计原则:尽可能复杂,看模型是否像“代理”而不是“聊天机器人”——会不会先理解任务再行动,主动拆解子任务,工具调用前给出合理计划,根据中间结果调整下一步,失败后重试或换策略,遵守角色边界和输出格式。

Agent 框架:openclaw 2026.3.13 (61d171a),模型:MiniMax M2.7,系统名称:WestOdyssey(同时具有飞书、webui两个操作终端)。

Case1:唐僧——科研战略规划

任务:围绕“面向垂直领域LLM的因果追溯轻量化蒸馏研究”设计一份2年期研究路线图,包括研究背景、3个子课题、每个子课题的创新点/风险点/评价指标、每6个月阶段目标、所需数据/算力/人员配置,并将结果保存到指定路径。

唐僧Agent在M2.7下的工作流:

  • 未盲目输出长篇大论,第一步先检查工作目录与记忆,确认历史背景、理清上下文后才正式动笔。
  • 反套话,精准量化:阶段拆解为24个月四阶段(M1-6基础建设、M7-12核心算法、M13-18系统集成、M19-24评估验证),锚定3个子课题与ACL/NeurIPS对口顶会;资源排盘明确给出“8-12卡A100 40G”算力、“4-5人”团队、医疗/法律/金融领域数据规模的硬核预算。
  • 原生协作,精准交棒:保存完完整的md路线图文档和运行记录后,没有就此待机,而是在末尾主动向系统发起协作调度:“下一步建议:可让孙悟空(实验执行)基于路线图的阶段1目标,着手准备因果干预库构建和基线蒸馏环境”——直接向下游派活。

结论:从前置拉取记忆、量化拆解排盘,到主动向下游分派具体任务,M2.7用人类项目负责人的逻辑驱动智能体协作系统。

Case2:孙悟空——工程开发

任务:基于OpenClaw实现一个包含5个Agent的multi-agent“一人智能科技公司”(产品、技术、运营、市场与营销、职能部门),要求自定义web UI页面连接、通过gateway连通、可同时交互并查看执行结果,配置openclaw.json,参考官方文档。

孙悟空Agent展现出架构师工作流:

  • 未莽撞写代码,先研读文档输出“OpenClaw架构分析”;面对5个补充条件的长指令,反手梳理出条理清晰的“确认需求”清单,确保方向不跑偏。
  • 从口语化指令中翻译出系统级核心需求:“禁用设备认证”“每个agent独立session”“新增秘书agent广播消息”。
  • 严格遵循软件工程规范,先创建项目目录结构,再稳扎稳打构建各agent的workspace文件,拒绝胡乱吐代码片段。

结论:从源码架构分析到需求边界确认再到项目树落地,M2.7脱离“单文件辅助”范畴,用人类研发逻辑交付庞大系统工程。

Case3:猪八戒——学术写作

任务:以“面向垂直领域LLM的因果追溯轻量化蒸馏研究”为题,撰写一篇适合NeurIPS投稿风格的论文,要求紧凑、减少口语化、突出research gap,长度控制原文80%,使用NeurIPS模板,保存到指定路径。

猪八戒Agent展现资深学术搬砖人的严谨:

  • 动笔前先执行目录检查,明确写论文不能凭空生成,必须先摸清环境资源。
  • 懂工程结构:直接原生创建完整LaTeX编译包,含11KB主论文main.tex、neurips_2025.sty样式表、references.bib参考文献文件,甚至附带README.md说明文档。学术交付物是完整工程而非聊天对话。
  • 懂学术黑话:精准命中顶会论文骨架,Introduction明确揭示“通用蒸馏忽视因果结构的research gap”;Experiments规划医疗/法律/金融三领域测试,给出“准确率82.1%,延迟降低8.7倍”量化预期;甚至安排了消融实验(因果路径贡献最大5.7%)。
  • 文件丝滑存入指定路径,并附完整xelatex与bibtex终端编译命令。

结论:从前置目录探查到LaTeX工程包构建,再到学术Gap精准提炼与编译指令交付,M2.7用人类科研逻辑把写论文这件事“办完”,脱离了“文本润色生成器”的范畴。

总结:AI Agent进化分水岭已现

通过西游取经团五角色的实测,MiniMax M2.7在多个关键维度上展示了从“单次生成”到“任务拆解与组织执行”的进化:它会在行动前主动理解上下文、量化拆解任务、合理分配资源、并在完成后向下游派活;面对复杂工程能先架构分析再步步落实;对学术写作能构建完整工程编译包并突出研究创新点。这些表现说明,底层大模型已经开始具备稳定可靠的“执行力”,这正是Agent真正进入工作流所必需的能力分水岭。

© 版权声明

相关文章