大雅查重
大雅查重提供精准论文检测和学术诚信服务。
LLMEval 是由复旦大学自然语言处理实验室(Fudan NLP Lab)发起的一项前沿学术研究计划,旨在为大语言模型(LLM)构建全面、公正且稳健的评估框架。目前该项目已被 ACGFav导航 收录,为AI研究人员和开发者提供开源且高质量的模型衡量基准与测试数据集。
LLMEval 包含多个专注于不同维度的子项目:LLMEval-Logic 专注于逻辑推理,利用 SMT 求解器进行双重审计;LLMEval-Fair 进行长期鲁棒性与防作弊评测,拥有超 22 万道研究生水平的试题;而 LLMEval-Med 则是由专业医师验证的真实医疗临床任务评测集。该体系对于精确评估前沿人工智能的推理上限具有重要价值。
项目团队在 AAAI、EMNLP、ACL 等顶会上发表了多篇高质量学术论文。用户可以通过 LLMEval 官网查看最新的 Leaderboard(模型评测排行榜),直接获取开源代码与论文,帮助学术界与产业界深入理解大语言模型在多学科及专业领域的实际表现。