CMMLU

1年前更新 209 0 0

CMMLU是一个综合性的中文评估基准，专门用于评估语言模型在中文语境下的知识和推理能力，涵盖了从基础学科到高级专业水平的67个主题。

收录时间：

2025-03-21

打开网站手机查看

AI模型评测 # AI模型评测

CMMLU

打开网站

CMMLU是一个综合性的中文评估基准，专门用于评估语言模型在中文语境下的知识和推理能力，涵盖了从基础学科到高级专业水平的67个主题。它包括：需要计算和推理的自然科学，需要知识的人文科学和社会科学，以及需要生活常识的中国驾驶规则等。此外，CMMLU中的许多任务具有中国特定的答案，可能在其他地区或语言中并不普遍适用。因此是一个完全中国化的中文测试基准。

数据统计

C-Eval

Chatbot Arena

Chatbot Arena是一个大型语言模型 (LLM) 的基准平台，以众包方式进行匿名随机对战，该项目方LMSYS Org是由加州大学伯克利分校、加州大学圣地亚哥分校和卡内基梅隆大学合作创立的研究组织。

Open LLM Leaderboard

Open LLM Leaderboard 是最大的大模型和数据集社区 HuggingFace 推出的开源大模型排行榜单，基于 Eleuther AI Language Model Evaluation Harness（Eleuther AI语言模型评估框架）封装。

H2O EvalGPT

H2O Eval Studio is a modular studio for assessing the performance, reliability, and security of Retrieval-Augmented Generation and Large Language Model applications.

LLMEval3

LLMEval是由复旦大学NLP实验室推出的大模型评测基准，最新的LLMEval-3聚焦于专业知识能力评测，涵盖哲学、经济学、法学、教育学、文学、历史学、理学、工学、农学、医学、军事学、管理学、艺术学等教育部划定的13个学科门类、50余个二级学科，共计约20W道标准生成式问答题目。

CMMLU

数据统计

相关导航

FlagEval

C-Eval

H2O EvalGPT

C-Eval

Chatbot Arena

Open LLM Leaderboard

H2O EvalGPT

LLMEval3

加入收藏夹

设为首页

网址

FeedAIback

AI Girlfriend

微密圈

Website Builder Hub

FollowFox

DeepMode

CMMLU

数据统计

相关导航

FlagEval

C-Eval

H2O EvalGPT

C-Eval

Chatbot Arena

Open LLM Leaderboard

H2O EvalGPT

LLMEval3

加入收藏夹

设为首页

网址

FeedAIback

AI Girlfriend

微密圈

Website Builder Hub

FollowFox

DeepMode

标签云