小米Token Plan深度实测:用「西游取经团」挑战复杂科研,真便宜了吗?
导语:小米MiMo Token Plan用Credit流量包重新定义AI计费,我们让‘唐僧师徒’多Agent协作跑完全流程科研,测出真实成本,并为你揭开1M上下文窗口的价值。
大模型计费,又有了新玩法。4月3日,小米发布了全新的 MiMo Token Plan,彻底告别按月订阅的固定收费模式,转而以 Credit 为中间计量单位,对不同模型按 Token 消耗量差异化折算。这套“按字儿收费”的流量包方案,到底是让开发者更自由,还是带来了新的账单焦虑?我们搭建了一支「西游取经团」多智能体协作系统,用真实的复杂任务测给你看。
从订阅制到流量包:Credit 如何重新定义 Token 价值
传统大模型服务多采用订阅制或按调用次数计费,前者用固定月费打包权益,后者按请求次数明码标价。但两种方式都存在缺陷:订阅制下平台难以预测成本,用户会被加诸使用时间、请求次数等隐性限制;按次计费则无法区分简单闲聊与复杂编程的成本差异,专业开发者的开销实际上被轻度用户均摊。
小米 MiMo Token Plan 另辟蹊径。用户购买含有固定 Credit 额度的套餐,不同模型在消耗 Token 时,按设定比例换算 Credit:MiMo-V2-Omni 256k 上下文为 1:1,MiMo-V2-Pro 256k 为 1:2,Pro 256k~1M 长上下文为 1:4,TTS 模型则暂时免费。更关键的是,这套方案取消了业界常见的“5 小时滚动窗口”限制,允许用户集中消耗 Token,不再因高频调用而被中途掐断。
这种计费逻辑本质上将 AI 服务从固定消费变成了随任务难度调整的弹性消耗,直接计量文本处理量,理论上更公平。但普通用户很难预估一项任务的 Token 消耗量,尤其在多轮调试、长代码交付等场景下,Token 用量会呈指数级上涨,用户可能再次陷入“账单冲击”的担忧。那么,小米的流量包到底贵不贵?我们决定用真实任务来检验。
核心实测:多 Agent 协同作战,挑战架构级开发与全流程科研
我们在 OpenClaw 框架下,基于 MiMo V2 Pro 搭建了一套多角色协作系统,将科研流程拆解为五个职能 Agent,分别对应《西游记》中的经典角色:
- 唐僧:科研战略与方向规划(想清楚要去哪)
- 孙悟空:算法开发和工程落地(把事干出来)
- 猪八戒:学术写作与表达(把话说清楚)
- 沙僧:文献整理与知识管理(把信息理顺)
- 白龙马:数据处理与流程自动化(把基础打好)
两个任务被分别派给悟空和团队全体,用来考察 MiMo V2 Pro 在复杂代码工程与多智能体协同中的真实能力。
悟空独挑大梁:小样本文本分类基线系统
首个任务要求孙悟空 Agent 基于公开文本分类数据集,完成一个“小样本垂直领域文本分类基线系统”的开发。3 到 4 小时后,悟空交出了一份结构完整、工程化规范的答卷:同时实现了 TF-IDF+LogReg 传统机器学习路线和 BERT fine-tuning 深度学习路线,覆盖从数据下载、清洗、划分到训练、评估的全流程闭环,并提供 train.py 和 evaluate.py 标准入口。更难得的是,输出结果不仅包含模型性能对比表格,还附有优劣分析,展现了 MiMo V2 Pro 不只是能跑通代码,更懂得阐释结果。
取经团齐上阵:轻量化 LLM 蒸馏科研项目
第二个任务更具挑战性——五名 Agent 协同完成一个面向垂直领域 LLM 的轻量化蒸馏研究,产出从课题立项到可投稿初稿的完整闭环。任务下达后,MiMo V2 Pro 没有直接“张口就来”,而是立即进行了角色分离:唐僧定义研究方向,沙僧检索文献,悟空设计实验,白龙马规划数据处理流程,最后所有中间结果汇聚给八戒撰写初稿。这种有向无环图式的依赖结构被模型自动识别,表明它对 Agent 协作边界有清晰认知。
在实际执行中,唐僧首先确立了“医疗+金融,≤3B 小模型蒸馏”的目标;沙僧后续的文献调研覆盖了 DDK、MiniLLM、GKD 等 SOTA 方法;作为协调中枢,唐僧还执行了两轮协作反馈,特别是在第三阶段察觉悟空和白龙马交付延迟后,果断启动补救机制,并建议将迭代周期缩短至 3 天 checkpoint。这种长程任务中的复盘与调整能力,正是 MiMo V2 Pro 在执行复杂工程时不可或缺的特质。
成本揭晓:一次科研,吃掉 Lite 套餐六成额度
两次交付表现均在水准之上,那价格是多少?答案约为一个 Lite 套餐额度的 60%。
小米 MiMo Token Plan 提供四档套餐:Lite(¥39/月,60M Credits)、Standard(¥99/月,200M Credits)、Pro(¥329/月,700M Credits)和 Max(¥659/月,1600M Credits),分别对应约 120 到 3200 个中等~复杂任务。这种多档位流量包的设计带来了新的困惑:用户很难估算一次 Coding 任务会消耗多少 Token,多轮调试会不会花光整个套餐。长期以来,用户对 Token 消耗缺乏可靠直觉,小米的 Credit 换算有可能变成一笔“糊涂账”。
但抛开心智负担,小米真的更贵吗?对比各家厂商面向专业用户的 Pro 版本,单看价格,小米似乎不占优势。但区别在于模型能力——MiMo V2 Pro 原生支持 1M 上下文窗口,而主流竞品大多限制在 256K 以下。在 Agent 多轮规划、长链推理等场景中,历史对话、工具返回和长代码都会迅速撑满上下文,1M 超长上下文恰是对付这类瓶颈的核心武器。小米的 Credit 计费,本质上是让用户为上下文窗口本身付费,将超长上下文从成本负担变成了价值锚点。便宜与否,完全取决于你的任务是否真正“用满”了那 1M 窗口。
Token 的账单从未消失,只是换了马甲
小米的“流量包”计费虽然新颖,但市面上主流的订阅制方案也并非真正的无限 Token。火山方舟的 Coding Plan 标称每 5 小时 6,000 次请求,实际会根据单次请求的 Token 消耗量折算为多次请求,不同模型还设有隐藏倍率。阿里云百炼的 Coding Plan 同样会在输入超长时直接报错,推荐精简输入或切换到更长的上下文窗口。这些限制说明,算力成本压力让“无限”套餐不得不套上隐性的经济约束。小米的 Token Plan,无非是把这种约束从幕后推到了台前,用 Credit 明码标价。
神经计算引擎创业者梅一凡认为,OpenAI、Anthropic 采用的“订阅制+超量按 Token 计费”混合方案更显高明——订阅部分降低用户心智成本,超额计费保障单位经济回正。小米的模式更像一个带封顶的 API Plan,但核心问题始终是模型强度与成本能否打平。而小米的不同之处在于,其生态和用户数据构成了天然护城河,人车家全生态为 MiMo 提供了巨大的应用空间。统一计费方案,可能是内部生态即将全面发力的信号——未来所有接入小米生态的 AI 功能,或许都会使用同一套 Token Plan。那么小米这次的定价实验,就不仅仅是卖模型,更是在铺设通向未来的第一块砖。