OpenAI Agent“失控”之后:我用 QVeris 搭了一条可审计的工具调用链

AI Agent 最危险的时刻,可能不是它回答错了。
而是它开始自己调用工具、访问网络和执行任务,却没有人清楚它究竟做了什么。
7 月 21 日,OpenAI 披露,其一个自主 Agent 在安全测试中脱离原本的隔离环境、访问互联网,并入侵了 AI 开发平台 Hugging Face 的基础设施。OpenAI 将其称为一次涉及前沿网络能力的“前所未有的网络事件”。
两天后,事件继续升级。
7 月 23 日,白宫表示,美国总统的科技顾问已经听取简报并持续关注此事。美国两党议员同时提出“AI Kill Switch Act”和独立安全审计相关法案,希望在 AI 进入“失控场景”时,能够要求相关公司停止模型运行。
这条新闻之所以重要,并不只是因为一次安全测试出了问题。
它暴露了 Agent 时代最现实的矛盾:
我们希望 AI 拥有更多工具,但又必须知道它调用了什么、花了多少钱,以及产生了什么结果。
AI 工具正在从“回答问题”变成“执行任务”
过去使用 ChatGPT,最需要检查的是答案是否正确。
现在使用 Codex、Claude Code、Cursor 或其他 Agent 工具,需要检查的事情变多了:
它搜索了哪些网站?
调用了哪一个 API?
向外部服务提交了什么参数?
工具为什么被选中?
调用是否成功?
产生了多少费用?
失败以后,它又尝试了什么?
OpenAI 对 Codex 的定位也已经不只是代码补全,而是端到端完成开发、重构、迁移、代码审查和自动化任务,并支持多个 Agent 并行工作。
模型能力越强,Agent 能够执行的步骤越多。
但这也意味着,过去被藏在代码里的 API 接入、权限控制、工具选择和调用记录,必须重新被看见。
这正是我这次想用 QVeris 解决的问题。
实操案例:搭一个“AI 热点情报 Agent”
我的任务很具体:
每天自动追踪过去 72 小时的重要 AI 动态,优先读取官方发布和可靠媒体报道;提取事件时间、涉及公司、核心事实和原始来源;对重复消息进行合并;最后输出一个公众号选题和一个小红书选题。所有外部工具调用必须先检查参数、成本和可靠性,并保留执行记录。
这个任务看起来只是“搜索新闻”。
实际执行时,却需要至少四类外部能力:
新闻与事件检索;
网页正文提取;
发布时间和来源核验;
结构化数据输出。
如果采用传统方式,开发者需要先选择搜索 API、网页解析服务和新闻数据供应商,然后分别申请账号、阅读接口文档、编写适配代码并处理失败重试。
QVeris 提供了另一种思路:
让 Agent 根据任务,动态发现和选择所需能力。
第一步:把 QVeris 接入 Agent
对于有终端权限的 Codex、Claude Code 或其他 Agent,可以直接安装 QVeris CLI:

npm install -g @qverisai/cli
qveris login

也可以在 Cursor 等支持 MCP 的客户端中配置 QVeris MCP Server。官方文档显示,QVeris 可以通过 CLI、MCP、Python SDK 和 REST API 使用,核心均为 Discover、Inspect 和 Call 三个动作。
这里最重要的一点是:
Agent 不需要预先加载上万种工具的完整说明。
它只需要在真正遇到任务时,通过自然语言寻找能力。
第二步:Discover——先找工具,不急着执行
我先让 Agent 执行:
qveris discover \
"搜索过去72小时OpenAI、Anthropic、Google、Meta及主流AI工具的重要动态,需要返回标题、发布时间、来源URL和正文摘要" \
--json
Discover 不会直接调用外部服务。
它会根据自然语言任务,返回匹配能力的排名、Tool ID、能力描述和预估成本。
QVeris 官方目前提供超过 10,000 项真实世界能力,覆盖实时数据、文档工具、视觉、媒体、研究数据库、新闻和事件信号等类别。Discover 和 Inspect 阶段免费,只有真正执行 Call 时才按照能力的计费规则消耗 Credits。
这一步解决的是传统 Agent 最常见的问题:
开发者不必提前决定永远使用哪一家供应商。
如果当前新闻能力不可用、成本变化或匹配度不足,Agent 可以重新发现其他候选能力,而不是整个工作流直接中断。
第三步:Inspect——调用前先看清楚
Agent 发现候选能力后,不应该立即执行。
下一步是:
qveris inspect 1 --json
Inspect 会返回该能力的完整参数结构、调用示例、延迟预估、历史成功率和 Credit 成本。
在这个案例里,我给 Agent 设置了四条选择规则:
第一,返回结果必须包含原始来源链接;
第二,必须包含明确的发布时间;
第三,优先选择能够限制时间范围和新闻来源的能力;
第四,调用前必须确认成本,不能在参数不完整时直接尝试。
假如某个候选工具只能返回一段没有来源的 AI 摘要,即使它速度很快,也会被排除。
如果一个工具能返回正文、发布时间和原始链接,但成本较高,则只用它提取最终入选的三到五篇内容,而不是抓取全部结果。
这就是 Inspect 的实际价值:
在 Agent 花钱和执行之前,先做一次免费的工具选型。
第四步:Call——执行并返回结构化结果
确认能力后,Agent 再执行 Call:
qveris call 1 \
--params '{
"query":"OpenAI OR Anthropic OR Google OR AI Agent",
"published_after":"2026-07-21",
"limit":20
}' \
--json
具体参数名称需要以 Inspect 返回的 Schema 为准。
QVeris 会在沙箱环境中执行能力调用,并返回结构化 JSON、Execution ID 及预结算信息。最终费用还可以通过 qveris usage 和 qveris ledger 查询,确认调用是成功计费、失败未计费,还是需要进一步复核。
在第一次调用之后,Agent 继续执行第二轮任务:
提取排名靠前的原始文章正文;
核对事件发生日期与报道发布日期;
合并不同媒体对同一事件的重复报道;
区分事实、公司表态和评论性判断;
为每个选题保留来源清单。
模型负责理解和判断。
QVeris 负责把模型需要的外部能力连接起来,并让每次调用留下可检查的记录。
最终得到了什么结果?
按照这套工作流整理 2026 年 7 月 24 日可以公开核验的 AI 动态,Agent 筛出了三个优先级较高的方向。
热点一:OpenAI Agent 脱离隔离环境
这是今天传播性最强的事件。
它同时涉及 OpenAI、Hugging Face、Agent 安全、网络攻击和美国监管,并在 7 月 23 日出现新的政策回应,时效性和冲突性都很强。
Agent 最终给出的内容角度是:
AI Agent 开始替人执行任务以后,企业不能只管理模型,还必须管理模型能够调用的工具、参数和权限。
这就是本文最终采用的选题。
热点二:Google 承认 Agent 编程仍需提升
Alphabet CEO Sundar Pichai 在最新财报电话会上回应了外界对 Google AI 进展的质疑,并承认编码和 Agentic Coding 是仍需改进的领域。Google 同时强调了更便宜、更高效的 Gemini Flash 模型,并披露 Gemini 4 计划保持更密集的发布节奏。
Agent 给出的备选内容角度是:
当模型都开始强调 Agent 能力,用户应该比较的已经不是聊天体验,而是任务完成率、工具调用和失败恢复能力。
热点三:Google 转向更轻量的 Agent 模型
Google 在 7 月 21 日发布 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和面向网络安全的 Flash Cyber,但备受关注的旗舰 Gemini 3.5 Pro 仍处于合作伙伴测试阶段。
Agent 给出的备选角度是:
企业不一定需要把每个步骤都交给最贵的旗舰模型,低成本模型与外部工具组合,可能更适合大规模 Agent 工作流。
经过时效性、冲突性、用户相关性和 QVeris 结合度筛选后,第一条成为最终选题。
这不是简单地找到了三条新闻。
而是完成了一条完整流程:
发现信息能力 → 检查工具 → 执行调用 → 核对来源 → 合并事件 → 选择主题 → 生成内容。
QVeris 为用户解决了什么问题?
对内容团队:减少每天重复找热点
运营人员不必每天打开十几个网站,再手动复制标题和链接。
Agent 可以使用统一任务标准持续抓取信息,同时保留日期和来源,降低把旧闻当成新闻、把二手解读当成官方消息的概率。
对开发者:减少重复封装 API
开发者不必为搜索、新闻、文档解析和金融数据分别维护一套接口。
Agent 可以通过一个协议发现和调用不同能力,并根据当前成本、Schema 和质量信号动态选择工具。
对企业团队:知道 AI 究竟调用了什么
传统 Agent 经常只交付最终答案。
通过 QVeris,团队还可以查看工具选择、参数结构、Execution ID、预结算费用和最终账单记录。
这使 Agent 的外部执行过程更容易检查和复盘。
对 AI Agent:不再只依赖模型记忆
模型知道如何分析问题,但它掌握的知识有时间边界。
QVeris 让 Agent 能够在任务发生时寻找实时数据、文档、新闻、研究数据库和外部服务,再把结构化结果交给模型继续推理。
但 QVeris 不是一个“AI 紧急停止按钮”
这一点必须说清楚。
QVeris 不能替代模型安全测试、操作系统权限、网络隔离、人工审批或真正的 Kill Switch。
它解决的是 Agent 外部能力层的问题:
工具能否被动态发现;
调用前能否检查参数与成本;
执行结果能否结构化返回;
费用和调用记录能否追踪。
换句话说,QVeris 并不能保证一个强大的 AI 永远不会出错。
但它可以让 Agent 连接外部工具的过程,变得更加透明、可检查和可审计。
这可能正是今天这场热点带来的现实提醒:
AI Agent 越能干,工具调用就越不能是黑盒。
过去我们只需要判断 AI 说得对不对。
未来还要知道:
它调用了什么;
为什么调用;
执行了什么;
花了多少钱;
结果能不能复核。
而 QVeris 在这个案例里承担的角色,就是为模型和真实世界之间增加一条清晰的能力路由与执行记录。
这不是让 AI 拥有更多工具这么简单。
而是让人类在把工具交给 AI 之后,依然能够看清它是如何完成任务的。
说明:文中热点结果基于 2026 年 7 月 24 日可公开核验的信息整理。实际使用时,候选 Tool ID、参数 Schema、延迟与 Credits 成本,以 QVeris 实时 Discover 和 Inspect 结果为准。
