前DeepMind研究员离职警示:限制大模型下一次飞跃的不是算力,而是终将崩溃的“评估系统” 大模型评估系统正面临失效危机。当模型跨入全新区间,静态基准将暗中失效。前DeepMind研究员Lun Wang指出,限制AI下一次飞跃的是评估而非算力。行业急需引入物理学中的‘序参量’预测智能相变,并... AI 前沿动态# AGI涌现# AI评测基准# DeepMind 2个月前280
手机 Agent 的隐私红线:点个汉堡都能泄露手机号?港中深等团队首次量化越界风险 港中深联合腾讯等团队发布 MyPhoneBench,首次量化手机 Agent 在正常任务中的隐私越界行为,包含10个模拟App、300个任务、5个模型评估,并提出 iMy 隐私交互协议。 AI 前沿动态# iMy 协议# MyPhoneBench# 大模型评估 2个月前340