PerceptionBench 多模态视觉感知评测系统工具源码

PerceptionBench 多模态视觉感知评测系统工具源码

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁

项目封面图

源码系统概览

文章正文

PerceptionBench 是 MoonshotAI 开源的多模态大模型(MLLM)原子级视觉感知评测基准,专注于把“看得准不准”从推理与知识中隔离出来单独衡量。

它用十项原子感知能力把看错从想错中分离出来,用短答案题目单独衡量模型在感知层面的真实水平。

源码简介

PerceptionBench 由 MoonshotAI 团队开源,采用自底向上的方法构建:通过对 42 个现有基准中前沿 MLLM 响应的最早失败点做诊断,归纳出感知分支下的十项原子感知能力。

仓库包含一个 Python 评测主程序 eval/eval.py、判定提示词 judge_prompt.txt 与依赖说明 requirements.txt,题目与答案以 Hugging Face 数据集形式发布。

项目遵循 Apache-2.0 协议,体积小、依赖简单,便于二次研究。

评测主程序轻量、依赖简单,题目以数据集形式发布,非常适合作为多模态模型能力画像与对比的研究工具。

适用场景

该项目适合做大模型评测的研究者,以及需要横向对比多个 MLLM 视觉感知能力的团队。

它可以用于模型选型、能力画像、论文复现,也适合作为教学示例理解“感知错误”与“推理错误”的区别。

对于关注幻觉、计数、属性、深度、定位等细分能力的开发者,PerceptionBench 提供了一套能力级的标准。

功能亮点

包含 3000 道经校验的短答案问题,每题隔离单一感知能力,难度来自感知本身而非推理或知识。

覆盖十个原子感知能力维度,并通过能力级均衡与难度分层进行抽样。

使用统一提示词与最高可用推理预算评估十六个前沿 MLLM,由 GPT-oss-120B 作为判定器对比参考答案,与人类判断一致性达 99.7%。

最终形成能力级排行榜,揭示看似相近总分背后的能力差异。

技术架构与部署指南

维度 本套源码 同类通用方案
技术栈 前端:无前端界面,提供评测脚本与说明文档。 依具体方案选型,需自行搭建与维护
部署方式 安装依赖 pip install -r requirements.txt,在 .env 中配置 OPENAI_API_K 多托管于第三方平台或订阅云服务
功能侧重 包含 3000 道经校验的短答案问题,每题隔离单一感知能力,难度来自感知本身而非推理或知识。 功能通用,定制深度有限
数据归属 数据自持,部署在自有服务器,不出站 数据通常留存于服务商侧
成本模式 获取后自主部署,无持续授权费用 通常按订阅或调用量计费

技术栈与运行环境

前端:无前端界面,提供评测脚本与说明文档。

后端:Python 实现的评测主程序 eval/eval.py 与判定逻辑。

数据库:题目与答案以数据集形式提供(Hugging Face),本地读取。

运行环境:Python 3 环境与 OpenAI 兼容接口,需配置 API Key。

其他依赖:openai、python-dotenv、tqdm 与 judge_prompt 模板。

安装与部署提示

安装依赖 pip install -r requirements.txt,在 .env 中配置 OPENAI_API_KEY 与 OpenAI 兼容端点。

运行 eval/eval.py 加载数据集与待评测模型,判定器会对照参考答案给出每题结果。

评测结果可汇总为各能力维度的准确率,便于生成能力级画像与对比。

建议先在小样本上跑通流程再扩展到全量。

截图与演示说明

仓库 images 目录提供了项目标识与分布示意图。

下图是项目主页关联的品牌标识。

PerceptionBench 项目截图

概览图展示了 PerceptionBench 从失败点诊断到能力构建的思路。

PerceptionBench 项目截图

数据分布图则说明 3000 道题目在十项原子感知能力上的构成与抽样方式。

PerceptionBench 项目截图

这些图来自官方文档与论文,能直观呈现这一评测基准的设计。

常见问题

问:如何接入自己的模型?

配置 OpenAI 兼容的推理端点与 API Key,评测脚本会按统一提示词调用你的模型。

问:判定是怎么做的?

由 GPT-oss-120B 作为判定器,将模型回答与参考答案对比,经抽样审计与人类判断一致性很高。

问:题目从哪里来?

3000 道题部分从已有基准的归因失败中分解得到,部分为在补充图像上新撰写,并以数据集形式发布。

安全风险提示

静态扫描在仓库文档中检出凭据类特征,经研判为示例占位值,并非真实泄露密钥,但部署前仍建议替换为自有密钥并避免把真实密钥提交到仓库。

路径:README.md。

类型:hardcoded-credential(文档示例密钥)。

证据:快速开始示例中出现 OPENAI_API_KEY=”your-api-key-here” 的占位写法。

建议:上线前将示例值替换为真实自有密钥,密钥通过 .env 等环境变量注入,切勿提交到仓库。

特别提示:以上为文档示例占位,并非真实泄露凭据;

下载后请仍对源码做一次安全审计,确认无恶意代码后再部署使用!

下载说明

源码仅供学习研究、测试部署和二次开发参考,商用前请自行确认授权、版权和安全风险。

本项目为 Apache-2.0 协议,可自由使用但须保留版权与许可声明。

评测过程需要调用外部模型 API 并产生费用,请在合规前提下使用自有密钥,并妥善保管评测数据与结果。

GitHub项目开源地址:https://github.com/MoonshotAI/PerceptionBench

本文章资源https://www.aosen.cc/mianfei8050.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码