LLM Verifier 智能体验证工具源码 Python查询源码

LLM Verifier 智能体验证工具源码 Python查询源码

  • 全站源码免费
  • 日/微信/10次解锁
  • 日/IP/100次解锁
资源下载
免费资源
立即下载

LLM-as-a-Verifier 智能体验证框架源码

源码系统概览

文章正文

LLM-as-a-Verifier 是一套开源的通用智能体验证框架源码,为任意 AI 代理提供细粒度反馈而无需额外训练。

该框架的核心思想是:使用细粒度评分粒度、对 LLM 分数词元的完整对数概率分布取期望值、并通过重复评估和标准分解进行扩展。该框架在 Terminal-Bench、SWE-Bench Verified 和 MedAgentBench 等代理基准测试中达到 SOTA 性能。

该项目由 Jacky Kwok 等人开发,采用 MIT 许可证开源,已获得 2600 以上 GitHub Star。

框架支持 Best-of-N 选择、细粒度进度跟踪和多模态验证,适用于编码代理、机器人控制和医疗智能体等多种场景。

源码简介

LLM-as-a-Verifier 是斯坦福等机构联合开发的开源智能体验证框架源码,当前版本 v0.2.0。

该项目采用 MIT 许可证开源,欢迎贡献 star 和 fork。框架支持多种后端模型,包括 DeepSeek V4、Gemini 2.5 Flash 和本地部署的 vLLM 服务。

该框架已在多个权威基准测试中取得优异成绩。

v0.2.0 版本新增前缀缓存优化(减少约 3.4 倍未缓存输入词元)、Terminal-Bench 2.1 自验证基准、deepseek-v4-flash 验证后端和词元统计功能。

最后更新 2026 年,项目持续维护中,更新日志见 CHANGELOG.md。

适用场景

适用于 AI 代理的测试时扩展、进度跟踪和强化学习。

编码场景可使用该框架从多个候选轨迹中选择最优方案,机器人场景可通过逐步评分监控代理执行进度,医疗场景可验证智能体诊断建议的准确性。

该框架还支持 Claude Code 插件 TurboAgent,作为 LLM API 代理在客户端和模型提供商之间运行,并行生成多个候选响应并通过概率枢纽锦标赛选择最佳方案。

技术栈与运行环境

该项目基于 Python 构建,通过 pip install llm-verifier 安装。

运行需要 DEEPSEEK_API_KEY 或 VERTEX_API_KEY 环境变量,也支持 OpenAI 兼容服务端(如 vllm serve Qwen/Qwen3.5-9B)。

依赖 PyTorch 和 Transformers 库进行对数概率计算。

框架核心模块包括 fine_grained_reward(对数概率评分和分数缓存)、pivot_tournament(概率枢纽锦标赛选择算法)、progress(逐步进度曲线追踪)和 benchmarks(基准测试注册表)。

功能亮点

  • 细粒度奖励估计:对完整对数概率分布取期望,而非离散化单一分数
  • 概率枢纽锦标赛:O(Nk) 复杂度选择最优轨迹,替代 O(N^2) 全量对比
  • 实时进度追踪:ProgressTracker 在代理执行过程中逐步评分,支持提前终止
  • 多模态支持:接受图像输入,适用于机器人控制等视觉任务
  • Claude Code 集成:TurboAgent 插件作为 API 代理,可视化管道 DAG

技术架构与部署指南

安装与部署提示

安装方式:执行 pip install llm-verifier 安装最新发布版本,或克隆仓库后执行 pip install -e . 安装开发版本。

运行前在 .env 文件中配置 DEEPSEEK_API_KEY 或 VERTEX_API_KEY。

最后更新 2026 年,版本号 v0.2.0。

快速开始:使用 llm_verifier.select() 进行 Best-of-N 选择,llm_verifier.compare() 进行成对比较,llm_verifier.track() 进行进度追踪。

运行 python scripts/run.py 可复现各基准测试结果。

更新日志详见 CHANGELOG.md。

截图与演示说明

以下截图展示了 LLM-as-a-Verifier 框架的整体架构,包含细粒度奖励估计、概率枢纽锦标赛和多步进度追踪的核心流程。

LLM-as-a-Verifier 框架架构概览截图

架构概览图展示了从任务输入到候选评估的完整管道:细粒度奖励模块对 LLM 分数词元的对数概率分布取期望值,概率枢纽锦标赛通过 O(Nk) 复杂度高效排序候选方案,进度追踪器在代理执行过程中逐步输出完成度评分。

常见问题

问:LLM-as-a-Verifier 是什么?

LLM-as-a-Verifier 是通用智能体验证框架,通过细粒度对数概率评分和概率枢纽锦标赛为任意 AI 代理提供反馈,无需额外训练。

问:LLM-as-a-Verifier 和 LLM-as-a-Judge 的区别是什么?

LLM-as-a-Verifier 对比 LLM-as-a-Judge 的区别在于以下方面:

特性 LLM-as-a-Verifier LLM-as-a-Judge
评分方式 对数概率分布取期望 离散单一分数
选择复杂度 O(Nk) 锦标赛 O(N^2) 全量对比
粒度 连续细粒度 粗粒度

LLM-as-a-Verifier 和 LLM-as-a-Judge 的区别核心在于评分粒度和效率。

问:如何安装 LLM-as-a-Verifier?

执行 pip install llm-verifier 安装,然后在 .env 文件中配置 DEEPSEEK_API_KEY 或 VERTEX_API_KEY 环境变量即可开始使用。

问:LLM-as-a-Verifier 支持哪些模型?

支持 DeepSeek V4、Gemini 2.5 Flash、本地 vLLM 部署的 Qwen 等多种模型,以及任何返回 logprobs 的 OpenAI 兼容服务端。

安全风险提示

该项目未发现 eval、base64_decode、shell_exec 等高风险函数。CORS 配置不适用于本地框架。

Docker 部署时需注意 API Key 环境变量不泄露到镜像层。

nginx 反向代理配置需限制验证端点的访问权限。

API Key 存储在 .env 文件中,建议加入 .gitignore 防止意外提交。

使用 TurboAgent 代理时需确保本地端口 8888 不对外暴露。

下载说明

本源码包含 LLM-as-a-Verifier 完整框架源代码、基准测试脚本和示例数据。下载后可通过 pip install -e . 安装并运行各基准测试。源码包已打包为 zip 格式,提取码 8888。

GitHub项目开源地址:https://github.com/llm-as-a-verifier/llm-as-a-verifier

资源下载
下载价格免费
本文章资源https://www.aosen.cc/mianfei14965.html来源于互联网,如存在侵权,请联系我们立马删除!
0
显示验证码