LLMEval – 复旦NLP大语言模型评测框架

2个月前发布 31 0 0

LLMEval是由复旦大学NLP实验室发起的大模型综合评估项目,提供公正、稳健的多维度LLM学术评测基准。

收录时间:
2026-05-24
LLMEval – 复旦NLP大语言模型评测框架LLMEval – 复旦NLP大语言模型评测框架

关于 LLMEval 评测项目

LLMEval 是由复旦大学自然语言处理实验室(Fudan NLP Lab)发起的一项前沿学术研究计划,旨在为大语言模型(LLM)构建全面、公正且稳健的评估框架。目前该项目已被 ACGFav导航 收录,为AI研究人员和开发者提供开源且高质量的模型衡量基准与测试数据集。

覆盖多学科的评测基准

LLMEval 包含多个专注于不同维度的子项目:LLMEval-Logic 专注于逻辑推理,利用 SMT 求解器进行双重审计;LLMEval-Fair 进行长期鲁棒性与防作弊评测,拥有超 22 万道研究生水平的试题;而 LLMEval-Med 则是由专业医师验证的真实医疗临床任务评测集。该体系对于精确评估前沿人工智能的推理上限具有重要价值。

顶会研究与评测榜单

项目团队在 AAAI、EMNLP、ACL 等顶会上发表了多篇高质量学术论文。用户可以通过 LLMEval 官网查看最新的 Leaderboard(模型评测排行榜),直接获取开源代码与论文,帮助学术界与产业界深入理解大语言模型在多学科及专业领域的实际表现。

数据统计

相关导航

暂无评论

none
暂无评论...