在评测大语言模型性能时,各种基准测试(Benchmarks)是衡量模型能力的重要标准。常见的基准测试涵盖了不同维度:MMLU(大规模多任务语言理解)测试模型在57个学科上的知识广度;GSM8K和MATH用于评估数学推理能力;HumanEval和MBPP测试编程能力;HellaSwag和WinoGrande评估常识推理;BENCH和MT-Bench则关注模型的对话质量。不同的基准测试各有侧重点,没有任何一个测试能全面反映模型能力,因此需要综合看待多个Benchmark的结果。本视频系统梳理了主流LLM基准测试的含义、测试方法和注意事项。