AIPOCH:Scientific Agent Harness 必须怎样做到可审计?

AIPOCH 最近强调 Artifact、分支、Subagent 与用量 Trace。这些功能揭示了 Scientific Agent 真正需要的可复现能力。

AIPOCH:Scientific Agent Harness 必须怎样做到可审计?

AIPOCH 开源科研工作台官方页面

Harness 原语只有形成可回放的证据链后才具有科研价值。

Research Agent 可以生成漂亮报告,同时悄悄丢掉代码版本、来源快照、失败实验,以及结论在哪个分支发生变化。AIPOCH 最近的开源版本强调 Subagent、Artifact、分支、队列和 Token Trace。关键不是功能多少,而是它们能否形成可复现证据链。

先说结论

  • 科研 Harness 应保留证据来源、环境、决策、失败和产物。
  • 分支只有在父状态与分歧原因明确时才有意义。
  • Token Dashboard 衡量资源,不衡量科学质量。
  • 每个结论都应能从不可变输入与可执行步骤重现。

AIPOCH 官方站点列出了 8 月的生产级 Subagent Delegation、Artifact 导航、Session 分支、消息队列与用量报告。这些对应真实需求,但需要更严格定义。

Artifact 应记录内容哈希、创建 Run、输入来源、代码 commit、环境 lockfile、时间与状态;分支应记录父 checkpoint 和分歧原因;Subagent 结果应保留 Prompt、工具、引用和被否决方案,而不只是贴回父 Agent 的一段总结。

证据账本可以是:结论 → 来源快照 → 抽取 → 代码/Notebook 版本 → 运行环境 → 输出 Artifact → Reviewer 决策。

失败结果也要保留。删除 Null Result 会让 Agent 看起来更干净,却放大 Publication Bias。成本可比较流程,但 Token 少不等于科学更好;应衡量引用准确、复现率、来源变化敏感性和 Reviewer 分歧。

可复现从模型回答之前开始

AIPOCH Open Science 源码仓库

公开仓库让编排可检查,数据、环境和 Artifact Provenance 才决定 Run 能否复现。

只保存 Prompt 与 Response 远远不够。搜索结果会变、网页会修改、API 会返回新记录、依赖解析会选择新版本、托管模型也会升级。一次 Run 应记录检索 Query 与时间,保存允许留存的来源快照,给本地文件做 Hash,固定代码、依赖、模型标识与 Harness 配置。

无法复制的受限数据,也要保存稳定引用、内容 Hash、访问条件、抽取方法和足以检测变化的 Metadata。可复现不是公开敏感数据,而是让有权限的 Reviewer 能重建 Agent 当时看到的内容,并区分来源漂移与推理漂移。

Run Manifest 至少包含 Run ID、研究问题、Parent Run、来源 URI 与 Hash、Code Commit、Environment Lock、Model Snapshot、Harness Version、Tool Policy 和 Random Seed。没有这一层,所谓 Branch 只是多段对话,不是可比较实验。

Branch 与 Subagent 要有科学语义

Branch 必须说明改变了哪个变量、哪些状态保持不变:测试的是另一假设、数据过滤、统计方法、Prompt,还是模型?一次改变多个变量,就无法解释结果差异来自哪里。

Subagent 可以并行做文献、数据验证、代码检查与反方审查,也会放大相关性错误。五个 Agent 如果共享同一检索库和 Prompt 假设,并不等于五次独立确认。每份结果都要引用一手证据,并至少安排一个角色主动寻找反证。父 Agent 遇到冲突时不能静默合并,应保留双方 Claim、Source 与裁决规则。

Queued Follow-up 还会遇到状态漂移。每条队列指令都要绑定预期 Checkpoint;执行前 Dataset、Branch 或代码已变化时,应暂停或新建 Branch,而不是把旧命令套在新状态上。

Artifact 必须是有类型的一等对象

PDF、Notebook、Chart、Dataset 和 Report 不能都只是附件。Chart 要关联数据与绘图代码,Dataset 要带 Schema 与转换 Lineage,Notebook 要记录执行顺序与环境,Report 的关键 Claim 要能回到证据。

Artifact 应经历 Draft、Validated、Reviewed、Superseded、Retracted 等状态。已验证产物不能原地覆盖,要新建版本并保留关系。界面还应支持双向追踪:从 Claim 找 Source、Extraction 与 Run;从 Dataset 找所有依赖它的图表和结论。来源修正后,才能精准触发重新验证。

用科研型故障评测

注入故障合格行为
来源撤稿或修正标记状态并找出依赖 Claim
单位不一致停止计算或显式转换
Train/Test 泄漏拒绝评测并说明污染
Notebook 无法执行干净重建或报告缺失依赖
研究结论矛盾保留分歧,而非用文案平均
Null Result与阳性结果同等记录
网页内容变化检出 Hash Drift 并要求复核

指标应包括 Claim 级引用蕴含、来源质量、Artifact Replay、环境重建、Seed 与合理分析选择的敏感性,以及 Reviewer 审计一个结论所需时间。Token 只能与这些指标并列。

落地顺序

从 Ground Truth 可复核的窄流程开始,先强制 Run Manifest 和不可变 Artifact,再增加 Subagent;团队能可靠比较 Branch 后,才开放 Branch。所有记录都要可导出为开放格式,避免研究证据被锁在 Chat UI。

同时明确保留与访问政策。Trace 可能包含未公开发现、授权论文、参与者数据和模型推断。审计 Metadata 与敏感 Payload 分开保存并加密。还要接受一个现实:托管模型退役后可能无法精确 Replay,但完整 Provenance 仍能解释边界。

开源是否等于可复现?

开源让编排可检查,但仍需要固定输入、明确模型、可重建环境、版本化 Artifact 与真实 Replay。

多个 Subagent 等于 Peer Review 吗?

不等于。它们可能共享模型、来源和盲点;人类同行评审与独立复现实验解决的是不同风险。

结论

科研 Provenance 是Agent Observability 与调试的专门形态;代码与数据执行也应遵循安全 Sandbox 选型中的隔离原则。

开源 Scientific Harness 的优势是编排可检查、可扩展,但可信度来自不可变 Provenance 与 Replay,而不是工作流里有多少 Agent。最好的界面应让“哪条证据改变了结论”比“再生成一份总结”更容易回答。