你的位置:任丘市奥力斯涂料厂 > 联系奥力斯 > 河北护角胶 配套CLI与Skills,浙大开源可插拔Agent评测底座

河北护角胶 配套CLI与Skills,浙大开源可插拔Agent评测底座

发布日期:2026-09-13 15:07 点击次数:53
PVC管件胶

同套模型,换个 coding agent 运行时,测试得分和实际消耗往往大相径庭。

而在本地、Docker 与各类云沙箱之间来回适配,又容易陷入写不完胶水代码的泥潭。

针对这问题,浙江大学 ZJU-REAL 团队开源了ageval(agent eval)。它的核心思路是将待测 Agent 与运行环境通过插件解耦:在配置文件中修改行,同份 dataset 就能在不同环境、不同 Agent 间自由切换运行。

配用的 CLI 与 skills,ageval 还能让 coding agent 自主编写 benchmark、迁移已有测试集并执行自动化评测。

△演示:配置次评测,任意切换运行览:从本地调试到 Hub 协作

做 Agent 评测,开发者常遇到两个痛点:是换个 Agent 或换套环境就得重写遍适配脚手架;二是跑完只给出个笼统的分数,中间卡在哪步法追溯。ageval覆盖了从本地复盘调试到云端结果共享的完整工作流。

本地轻量复盘:逐轮交互轨迹回放

评测未通过时,定位问题需要看清 Agent 的实际执行轨迹。

在终端执行 ageval view,即可在本地启动轻量 Web 轨迹查看器,按照Jobs → Tasks层完整复盘每次运行:

阶段耗时清晰可见:明确展示环境准备(environment)、任务循环(run)与评分(evaluate)各个阶段的精确耗时;

交互事件逐轮展开:完整对照 Agent 输入、工具调用(Tool Calls)、终端输出与模型回复,需再在终端漫目的地翻看滚屏日志;

单任务直接复现:每个失败 task 均附带完整的重跑命令,便在终端针对单用例单复现和单步调试。

△本地 Viewer 中的次运行轨迹与事件明细插件中心:自由组环境与 Agent 运行时

ageval 将运行环境与 Agent 运行时均封装为标准插件,去重复编写适配胶水代码的成本:

环境插件(Environment):支持 Docker、E2B、Daytona 以及 Local 本地宿主环境;

Agent 运行时插件(Executor):默认支持通过 ACP 接入通用 coding agent(如 pi、Codex、Claude Code、OpenCode 等),同时也原生收录了各类特化执行栈(如 DeepSeek 官 dsh、NVIDIA nooa、SWE-agent miniswe)。

如果需要切换执行环境或待测 Agent,只需在配置文件 profiles.yaml 中修改对应声明,原有的 dataset 需任何改动即可直接运行。

△插件市场:浏览与接入环境插件和 Agent 运行时插件插件详情页:依赖契约与运行参数览

点击进入任意插件详情页,可以直观查看该插件对外 export 的服务、所依赖的环境 capabilities,以及安装命令与参数配置示例:

△dsh 插件详情页:查看 DeepSeek 官 harness 的插件配置与能力说明

△nooa 插件详情页:NVIDIA 官 Agent 运行时插件详情公开榜单(Leaderboard):环境与配置严格对齐的对比

许多公开 benchmark 往往只公布模型名称与得分,既没有说明使用的是哪套 Harness,也没有标明沙箱环境版本与 Prompt 模版,外界往往难以真正复现。

在 ageval Hub 的公开榜单上:

每项成绩都明确绑定了具体的 Agent 运行时版本与执行环境(如 Docker、E2B);

论是换底层沙箱还是调整工具调用策略,得分与资源消耗的变化都可以在榜单中横向对照;

每次提交均附带不可变的 lock.json 与完整轨迹文件,其他开发者可以直接拉取配置键复现。

△Hub Leaderboard 榜单:查看不同环境与 Agent 组下的真实评测成绩 Agents 市场:沉淀与复用 Agent 资产

在实际业务中,调优出套好用的 Agent(包括 Prompt 模版、工具链编排与执行逻辑)通常需要投入大量的工程精力。

在 ageval Hub 上河北护角胶,团队可以直接将调优好的案包发布为 Agent 包:

完整包含 Prompt 模版、Tool 定义以及底层插件依赖声明;

其他成员在运行评测时,只需指定 --agent,即可直接拉取并在任意 dataset 上开箱即用。

△Agents Hub:浏览、发布与复用已配置好的 Agent 包

点击进入单个 Agent 主页,可以进步查看该 Agent 的配置详情、参与测评的模型列表与 dataset 历史记录。

△dsh-agent 详情页:查看 Agent 架构、配置参数与历史评测记录 Models 视图:模型画像与横向 PK

在针对业务场景进行模型选型时,团队通常关注两个核心问题:

该模型在不同的评测任务和不同的 Agent 架构下的整体表现如何?

在固定当前自研 Agent 架构的前提下,换用哪个模型能在成功率与调用成本之间取得优平衡?

Models Hub:以模型为维度的综画像

在Models  Tab 中,可以按照模型维度查看其在各类 dataset 与 Agent 组下的解题成功率和调用成本:

△Models Hub:以模型为主维度的全景观测面板

点击具体模型进入详情页,可以进步查看该模型在不同 dataset 和不同 Agent 下的表现明细:

△Model 详情页:查看模型在各个 dataset 和不同 Agent 下的表现明细固定 Agent 架构,横向对比不同模型

在 Agent 详情页中,可以固定同套 Agent 运行时(保持相同的 Prompt 策略与工具调度链),横向对比不同模型在同个 dataset 下的代码生成质量与解题通过率:

△在 Agent Hub 中比较 Model 表现:固定同套 Agent 运行时,横向比对不同模型的解题果自动化评测:让 coding agent 驱动整个流程(Skills&CLI)

在本地开发环境中,万能胶生产厂家只需为 coding agent 安装 ageval CLI 和配套 skills:

uv tool install ageval-cli

npx skills add   ZJU-REAL/ageval

安装完成后,你的 coding agent 就能理解 ageval 的 CLI 指令与数据结构规范。你可以直接吩咐它完成原本繁琐的工程操作:

自主编写新的 benchmark,自动生成各 task 所需的 run.py 与 evaluator.py;

将团队现有的评测脚本迁移为标准的 ageval dataset;

自动拉起测试环境跑完指定评测矩阵,并汇总输出不同配置的对比分析报告。

△Agent 借助 skills 自动化运行评测运行机制:为什么能做到自由插拔?

要既能缝适配多种执行环境(本机、Docker、云沙箱),又能兼容不同的 Agent 运行时,关键在于底层两项核心设计:次运行的五个标准阶段以及基于服务契约的插件机制。

次运行的五个阶段

ageval 的执行底座是条确定的单向流水线:

lock → environment → run → evaluate → record

论运行过程是成功、失败、时还是被外部中断河北护角胶,cleanup 钩子都会在 finally 阶段可靠执行,清理容器实例、注销网络并擦除临时凭证。

△次运行的生命周期:从静态 lock、gold 隔离、run 任务循环到立评分与 evidence 封存

ageval lock:在执行前静态拦截配置问题:在实际拉起运行环境之前,系统会静态解析出依赖图(ExtensionGraph)。比对环境是否满足 Agent 插件声明的 capabilities 要求,并检查宿主 Docker 守护进程与 API Key 凭证。旦校验未通过,在 lock 阶段就会直接报错终止,避运行到半途才因环境缺失而崩溃。

立评分与参考答案隔离(gold 延迟上传):评分逻辑统收敛在 evaluator.py 中,支持程序化断言测试、产物 diff 校验或 LLM-as-a-judge。参考答案(gold)存放在 tasks//evaluation/ 目录中,在 Agent 执行阶段环境内不可见;直到 evaluate 阶段才会挂载上传至分环境。同时分容器可以配置为 network: none 断开外网连接,止模型提前泄题或作弊。

不可变证据链归档(Evidence):运行结束后,执行配置与拓扑快照 lock.json、评分细节 result.json、完整交互事件轨迹 trajectory.jsonl 会被体化封存归档,确保每次评测结果都有据可查、可精确复现。

插件机制:基于 export 与 inject 的服务契约

框架内部没有面向特定环境或特定 Agent 的硬编码 if/else 分支,所有组件均通过声明式的服务契约实现解耦:

△插件机制与依赖图:通过 export 与 inject 服务契约解耦环境与 Agent,由 ExtensionGraph 驱动调度服务声明(export 与 inject):

环境插件(如 docker、e2b、local):对外export提供 environment 服务,并声明自身支持的基础 capabilities(如命令执行 exec、文件上传 upload、终端交互 attach_stdio);

Agent 插件(如 acp、dsh、nooa):通过inject声明自身需要的服务与 capabilities(例如 dsh 声明需要环境提供 exec 与 upload)。

在 lock 阶段校验并编排依赖拓扑:

静态检查 requires ⊆ capabilities 契约是否成立;

检查通过后生成调度拓扑,运行时基座严格依照拓扑关系分发调用,从而实现"基座代码不变,环境与 Agent 自由插拔替换"。

实战:侵入接入 DeepSeek 官 harness

以 DeepSeek 开源的 deepseek-harness(dsh)为例。接入 dsh不需要改动 ageval 框架的行源码,只需要提供份简明直观的插件声明:

plugins/dsh/plugin.yaml —— Agent 插件声明(节选)

plugin_id: dsh

slots:

exclusive:

-   id: executor   Agent 执行器

inject:

-   service: environment  

capabilities: [ exec, upload ]  

对于使用者而言,调用 dsh 与运行普通 Agent 致。原有的 dataset 保持原样不动,切换对应的配置文件即可直接执行:

#1. 安装带 dsh 支持的 extras

uv tool install   'ageval-cli [ dsh ] '

#2.dataset 保持不动,指定 dsh 配置开跑

ageval run --task --profiles profiles.dsh.yaml

快速开始

ageval 现已正式开源。你可以通过 pip/uv 安装 CLI,也可以直接从源码编译体验。

式:直接安装 CLI(荐)

CLI

uv tool install ageval-cli

(含 e2b,dsh,daytona 等)

uv tool install   'ageval-cli [ all ] '

ageval -V

npx skills add   ZJU-REAL/ageval

直接运行公开的 dataset,或本地 dataset 目录:

ageval registry list

ageval run /@ --task

ageval view /@

式二:从源码体验小示例

git clone   https://github.com/ZJU-REAL/ageval.git

cd ageval

uv sync --frozen --all-packages

uv run ageval run examples/datasets/minimal-demo --task terminal-jsonl-agg

uv run ageval view examples/datasets/minimal-demo

GitHub 仓库:https://github.com/ZJU-REAL/ageval

项目主页:https://zju-real.github.io/ageval

文档与插件指南:https://zju-real.github.io/ageval/docs/

键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系式。

� �   我们会 ( 尽量 ) 及时回复你 : )

� � 点亮星标 � �

科技前沿进展每日见相关词条:铝皮保温施工     隔热条设备     钢绞线    玻璃棉卷毡    保温护角专用胶

奥力斯    保温护角专用胶批发    联系人:王经理    手机:13903175735(微信同号)    地址:河北省任丘市北辛庄乡南代河工业区

1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》河北护角胶,以此来变相勒索商家索要赔偿的违法恶意行为。

友情链接:

产品中心 新闻资讯 联系奥力斯

Powered by 任丘市奥力斯涂料厂 RSS地图 HTML地图

Copyright Powered by站群 © 2025-2054