ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AGI-Eval 2025年度报告精选:用评测框架度量大模型与Agent的智能边界

AGI-Eval 2025年度报告精选:用评测框架度量大模型与Agent的智能边界 1. 为什么你需要一套自己的评测框架AGI-Eval 2025 年度报告里最值得反复读的其实不是那些排名结论而是它背后那套“怎么把模型能力变成可比较数字”的方法。报告横跨文生图、实时语音、Agent 横评、推理模型、策略博弈等方向每一篇都在回答同一个问题这个模型到底行不行行在哪差在哪。如果你只是看结论过两个月模型一迭代就全过期了但如果你能把它的评测框架跑起来就能用自己的数据、自己的场景去校准模型表现。这篇面向的是想复现 AGI-Eval 评测流程的开发者手里有几个模型 API想横向比一比或者做 Agent 产品想知道自己的链路在真实任务上到底几分。我会给出一套可复制的评测配置骨架包含settings.json与config.toml示例以及验证请求是否跑通的完整动作。评测框架本身不神秘难的是把数据集、模型接入、评分器、并发控制这几块拼对。下面按“先跑通再调优”的顺序来。2. TaoToken 前置把模型接入这层先铺平评测框架要同时打多个模型最烦的就是每家 SDK、鉴权、参数格式都不一样。我的做法是先用一个统一入口把模型调用收敛掉评测代码里只认一种请求格式。TaoToken 在这里的角色就是这层统一入口它提供 OpenAI 兼容的 API你换模型基本只改model字段评测脚本不用动。官网地址是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content API 根地址是 https://taotoken.net/api 。注意 API 地址不要加 UTM 参数直接用它做base_url就行。你需要先去控制台拿一个 Key入口在 https://taotoken.net/console?utm_sourcetaotoken_aicg_blog_endutm_contentconsoleutm_campaignrewrite Key 管理页在 https://taotoken.net/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi-keysutm_campaignrewrite 。拿到 Key 之后评测框架里所有模型都走同一个base_url只是model名不同。这一步的意义在于AGI-Eval 报告里动辄横评七八个模型如果你每个模型写一套适配代码光维护成本就劝退了。统一入口之后评测配置里模型列表就是一个数组加一个模型就是加一行。3. 可复制配置settings.json 与 config.toml 骨架评测框架一般分两层配置一层是运行环境与密钥一层是评测任务本身。我用settings.json管前者config.toml管后者。下面这套骨架你可以直接抄改掉 Key 和模型名就能跑。3.1 settings.json环境与密钥{ api: { base_url: https://taotoken.net/api, api_key: sk-你的Key, timeout: 120, max_retries: 3 }, runtime: { concurrency: 4, output_dir: ./eval_results, log_level: info }, judge: { base_url: https://taotoken.net/api, api_key: sk-你的Key, model: gpt-4o } }concurrency别一上来就拉满评测请求往往带长输出并发太高容易触发限流先 4 路跑通再往上加。judge是自动评分用的裁判模型AGI-Eval 那套框架里评分器也走模型调用所以同样指向统一入口。3.2 config.toml评测任务定义[task] name agent_capability_eval dataset ./datasets/agent_tasks.jsonl metrics [accuracy, latency, token_cost] repeat 3 [[models]] name deepseek-v3 model deepseek-v3-chat temperature 0.2 [[models]] name qwen3-235b model qwen3-235b-a22b temperature 0.2 [[models]] name claude-sonnet model claude-3-7-sonnet temperature 0.2 [scoring] method llm_judge rubric ./rubrics/agent_rubric.md scale 4repeat 3是重复跑三次取均值报告里那些 0.01 分的差距单次跑根本不可信。scale 4对应 AGI-Eval 常用的 4 分制和它 Agent 横评里 1.23~2.20 的区间是同一套刻度。数据集用 JSONL每行一个任务字段建议包含id、prompt、reference、category方便后面按类别拆维度。3.3 数据集格式示例{id: agent-001, category: info_retrieval, prompt: 查询北京今天天气并给出穿衣建议, reference: 包含温度与建议} {id: agent-002, category: coding, prompt: 写一个Python函数判断回文, reference: 函数正确且含边界处理}类别字段很关键。AGI-Eval 报告里反复出现“商业 91.14% vs 艺术体育 47.87%”这种分维度结论靠的就是数据集带类别标签评分后按类别聚合。4. 验证请求先跑通一个模型再铺开配置写完别急着全量跑先用一个模型、一条数据验证链路。我习惯写个最小脚本确认请求能通、返回能解析、评分能落盘。import json, requests with open(settings.json) as f: cfg json.load(f) api cfg[api] headers { Authorization: fBearer {api[api_key]}, Content-Type: application/json } payload { model: deepseek-v3-chat, messages: [{role: user, content: 写一个Python函数判断回文}], temperature: 0.2 } resp requests.post( f{api[base_url]}/v1/chat/completions, headersheaders, jsonpayload, timeoutapi[timeout] ) print(resp.status_code) print(resp.json()[choices][0][message][content][:200])跑通后你会看到状态码 200 和一段函数代码。这一步确认了三件事Key 有效、base_url正确、返回结构是标准 OpenAI 格式。接下来把这段逻辑封装成评测框架的model_client让config.toml里的模型列表循环调用即可。验证成功后正式跑一次小批量python run_eval.py --config config.toml --settings settings.json --limit 5--limit 5只跑前 5 条确认评分器输出正常、结果文件生成在./eval_results下。结果文件建议包含每条任务的原始输出、评分、耗时、token 消耗方便后面算成本。AGI-Eval 报告里提到“输出长度增加带来成本上升”这个指标就是靠 token 统计落下来的。5. 本篇常见错排查报 401 或鉴权失败先检查settings.json里 Key 有没有多余空格再确认base_url是https://taotoken.net/api而不是带路径的完整地址。请求路径拼成/v1/chat/completions由代码负责配置里只写根地址。并发一高就大量超时把concurrency降到 2同时把max_retries提到 5。长输出任务本身耗时长timeout建议 120 秒起步别用默认的 30 秒。评分结果波动大检查repeat是否至少为 3temperature是否统一。裁判模型如果和被评模型是同一个容易出现自评偏高建议裁判单独指定一个模型。数据集类别聚合报错确认 JSONL 每行都有category字段缺字段的行在聚合时会被跳过导致维度分数对不上。结果里 token 数为 0部分返回结构里用量字段在usage下解析时别只取choices。如果确实没有就在客户端按字符数粗估但要在报告里注明是估算值。6. 把评测跑成习惯而不是一次性任务AGI-Eval 那 10 篇报告看下来最实用的经验是评测不是发榜那天做一次而是模型每次迭代、Agent 每次改链路都跑一遍。你把这套settings.jsonconfig.toml骨架固化下来数据集按类别攒评分标准写进rubric.md下次换模型只改一行配置。想直接对比多个模型的对话表现可以去模型对话页 https://taotoken.net/chat?utm_sourcetaotoken_aicg_blog_endutm_contentmodel_chatutm_campaignrewrite 手动试几条要长期跑编码类或 Agent 类评测Coding Plan https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding_planutm_campaignrewrite 更适合高频调用场景。接入细节和参数说明在接入文档 https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite 里遇到请求格式问题先翻它。评测框架的价值不在于跑出多漂亮的分数而在于让你在模型换代时手里始终有一把没变过的尺子。
返回列表