140万亿词元调用量背后:Token中文名终被官方定为“词元”
导语:AI大模型中最基础的Token,终于有了官方中文名。国家数据局公布数据,每日“词元”调用量突破140万亿,这一命名背后,是AI与人类语言交互的最小单元如何定义的博弈。
AI领域持续数月的Token中文名之争,终于随着一份官方数据公报落下帷幕。今日,中国政府网转发人民日报援引国家数据局的文章,其中一组数据格外引人注目:“日均词元调用量突破140万亿”。至此,“词元”作为Token的官方中文译名,经国家数据局发布、人民日报报道、中国政府网转发,三重权威认证下正式确立。
这场命名的争议,源于腾讯研究院的一篇文章。学者杨斌提出了“模元”这一译法,随即在AI社区激起千层浪。不久之后,“智元”异军突起,获得了广泛共鸣。新加坡国立大学尤洋教授调侃:“Token中文叫做’智元’,不知道’新智元’创始人是不是时空穿梭回来的。” 自由学者胡翌霖则从学术角度力挺:“真不如’智元’。计算机的单元是字节,Token是人类智识的计算单元。‘智’比‘通’更切中要害。” 百川智能创始人王小川等业界人士也纷纷表态认同,使得“智元”一度成为“民意”所向。
然而,最终官方一锤定音,选用了更为朴实的“词元”。据人民网解释,词元是AI理解人类语言的最小单位,Token切分出的单位有时是字,有时是词,而“词”能更全面地覆盖这种动态粒度。这一定名不仅平息了“模元”“智元”之争,也反映出国家数据局在AI术语标准化上的务实态度——既保留技术本质,又降低公众认知门槛。
从语言学角度,“词元”比“模元”更贴近普通人对语言单元的理解,又比“智元”少了些形而上的色彩,回归到自然语言处理的根基。当每天140万亿次调用在云端奔涌,一个清晰准确的命名,或许正是AI走向产业深处时需要的第一块路标。



© 版权声明
本文部分内容、图片整理自互联网公开渠道,版权归原作者所有。ACGFav 仅负责对信息进行整理、翻译或排版优化,不代表本站完全赞同其观点。若文中内容涉及版权问题,请通过本站“关于我们”页面联系站长,我们将尽快核实并处理。
相关文章
暂无评论...