LLMEval – 复旦NLP大语言模型评测框架 LLMEval是由复旦大学NLP实验室发起的大模型综合评估项目,提供公正、稳健的多维度LLM学术评测基准。 0310 Ai学术论文学术资源与文献检索# AI基准测试# NLP研究# 复旦大学
AGI-Eval – 通用人工智能大模型评测基准 AGI-Eval 是专为评估大语言模型在高考、SAT及司法考试等人类标准化考试中认知与推理能力的双语评测基准。 0420 Ai学术论文学术资源与文献检索# AGI-Eval# 人工智能# 基准测试