
源码系统概览
文章正文
PerceptionBench 是 MoonshotAI 开源的多模态大模型(MLLM)原子级视觉感知评测基准,专注于把“看得准不准”从推理与知识中隔离出来单独衡量。
它用十项原子感知能力把看错从想错中分离出来,用短答案题目单独衡量模型在感知层面的真实水平。
源码简介
PerceptionBench 由 MoonshotAI 团队开源,采用自底向上的方法构建:通过对 42 个现有基准中前沿 MLLM 响应的最早失败点做诊断,归纳出感知分支下的十项原子感知能力。
仓库包含一个 Python 评测主程序 eval/eval.py、判定提示词 judge_prompt.txt 与依赖说明 requirements.txt,题目与答案以 Hugging Face 数据集形式发布。
项目遵循 Apache-2.0 协议,体积小、依赖简单,便于二次研究。
评测主程序轻量、依赖简单,题目以数据集形式发布,非常适合作为多模态模型能力画像与对比的研究工具。
适用场景
该项目适合做大模型评测的研究者,以及需要横向对比多个 MLLM 视觉感知能力的团队。
它可以用于模型选型、能力画像、论文复现,也适合作为教学示例理解“感知错误”与“推理错误”的区别。
对于关注幻觉、计数、属性、深度、定位等细分能力的开发者,PerceptionBench 提供了一套能力级的标准。
功能亮点
包含 3000 道经校验的短答案问题,每题隔离单一感知能力,难度来自感知本身而非推理或知识。
覆盖十个原子感知能力维度,并通过能力级均衡与难度分层进行抽样。
使用统一提示词与最高可用推理预算评估十六个前沿 MLLM,由 GPT-oss-120B 作为判定器对比参考答案,与人类判断一致性达 99.7%。
最终形成能力级排行榜,揭示看似相近总分背后的能力差异。
技术架构与部署指南
| 维度 | 本套源码 | 同类通用方案 |
|---|---|---|
| 技术栈 | 前端:无前端界面,提供评测脚本与说明文档。 | 依具体方案选型,需自行搭建与维护 |
| 部署方式 | 安装依赖 pip install -r requirements.txt,在 .env 中配置 OPENAI_API_K | 多托管于第三方平台或订阅云服务 |
| 功能侧重 | 包含 3000 道经校验的短答案问题,每题隔离单一感知能力,难度来自感知本身而非推理或知识。 | 功能通用,定制深度有限 |
| 数据归属 | 数据自持,部署在自有服务器,不出站 | 数据通常留存于服务商侧 |
| 成本模式 | 获取后自主部署,无持续授权费用 | 通常按订阅或调用量计费 |
技术栈与运行环境
前端:无前端界面,提供评测脚本与说明文档。
后端:Python 实现的评测主程序 eval/eval.py 与判定逻辑。
数据库:题目与答案以数据集形式提供(Hugging Face),本地读取。
运行环境:Python 3 环境与 OpenAI 兼容接口,需配置 API Key。
其他依赖:openai、python-dotenv、tqdm 与 judge_prompt 模板。
安装与部署提示
安装依赖 pip install -r requirements.txt,在 .env 中配置 OPENAI_API_KEY 与 OpenAI 兼容端点。
运行 eval/eval.py 加载数据集与待评测模型,判定器会对照参考答案给出每题结果。
评测结果可汇总为各能力维度的准确率,便于生成能力级画像与对比。
建议先在小样本上跑通流程再扩展到全量。
截图与演示说明
仓库 images 目录提供了项目标识与分布示意图。
下图是项目主页关联的品牌标识。

概览图展示了 PerceptionBench 从失败点诊断到能力构建的思路。

数据分布图则说明 3000 道题目在十项原子感知能力上的构成与抽样方式。

这些图来自官方文档与论文,能直观呈现这一评测基准的设计。
常见问题
问:如何接入自己的模型?
配置 OpenAI 兼容的推理端点与 API Key,评测脚本会按统一提示词调用你的模型。
问:判定是怎么做的?
由 GPT-oss-120B 作为判定器,将模型回答与参考答案对比,经抽样审计与人类判断一致性很高。
问:题目从哪里来?
3000 道题部分从已有基准的归因失败中分解得到,部分为在补充图像上新撰写,并以数据集形式发布。
安全风险提示
静态扫描在仓库文档中检出凭据类特征,经研判为示例占位值,并非真实泄露密钥,但部署前仍建议替换为自有密钥并避免把真实密钥提交到仓库。
路径:README.md。
类型:hardcoded-credential(文档示例密钥)。
证据:快速开始示例中出现 OPENAI_API_KEY=”your-api-key-here” 的占位写法。
建议:上线前将示例值替换为真实自有密钥,密钥通过 .env 等环境变量注入,切勿提交到仓库。
特别提示:以上为文档示例占位,并非真实泄露凭据;
下载后请仍对源码做一次安全审计,确认无恶意代码后再部署使用!
下载说明
源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。
本项目为 Apache-2.0 协议,可自由使用但须保留版权与许可声明。
评测过程需要调用外部模型 API 并产生费用,请在合规前提下使用自有密钥,并妥善保管评测数据与结果。
GitHub项目开源地址:https://github.com/MoonshotAI/PerceptionBench