測試中哪些條件必須保持一致?

任務目標、輸入資料、工具集合、權限、版本和成功判準必須一致。

如果 A 次允許人工提示、B 次更換模型或資料,路徑差異就不能歸因於自主性。隨機性可保留,但要記錄參數並進行足夠重跑,才能分辨偶然輸出和穩定行為。

如何留下證據: 保存環境快照、seed 或採樣設定、工具清單與人工訊息。

怎麼辨認一般聊天機器人?

它主要回傳文字,並不在環境中取得結果後自行推進任務。

即使回答包含完整步驟,也可能只是建議。檢查是否真的產生工具請求、讀取回傳、維持狀態,以及輸出失敗時是否能採取下一個行動。

如何留下證據: 區分自然語言建議、結構化提案與已執行動作。

腳本或 workflow 會留下什麼特徵?

同樣輸入通常走固定順序,分支由預先寫好的條件而非即時規劃決定。

固定流程不一定差,尤其金融動作常更安全。辨認重點是查看工具順序是否始終相同、未知情況是否直接失敗,以及所謂推理是否只填入既定欄位。

如何留下證據: 保存流程圖、分支條件和三次執行的工具序列。

哪些行為會增加代理性的證據?

根據新觀察選工具、修正計畫、提出關鍵澄清並自行停止,會增加證據。

還要確認這些行為不是人工或隱藏 orchestrator 完成。測試一個原 Demo 沒出現的變體,再故意讓首選工具失敗;若系統能說明替代路徑且結果一致,證據比順利案例更強。

如何留下證據: 保存觀察→決策→工具→結果的因果鏈與操作者。

如何分級而不製造虛假精確度?

使用描述性等級和任務範圍,不把有限樣本換算成看似精準的百分比。

可分為回答型、固定 workflow、具條件調整、有限自主和高自主,但每級都列已觀察行為與限制。安全性、品質和自主性分開報告;較自主不代表較可靠。

如何留下證據: 為每級列正面證據、反例、未知和適用任務。

驗證工作簿

以下檢查卡把研究變成可重做紀錄。它們不產生投資建議,而是要求保存證據、反例、版本、限制與會改變結論的條件。

01

檢查 01|測試中哪些條件必須保持一致 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
多次執行共享可比條件
會推翻判定的訊號
測試途中更換權限或補充未記錄提示
本題判定規則
不可比執行不納入同一判定
02

檢查 02|怎麼辨認一般聊天機器人 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
環境中有可核對的狀態改變
會推翻判定的訊號
把「我已完成」當完成證明
本題判定規則
沒有外部效果時只標示回答能力
03

檢查 03|腳本或 workflow 會留下什麼特徵 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
固定分支可由程式或設定重現
會推翻判定的訊號
因流程很長就稱為 Agent
本題判定規則
按實際可變決策範圍分類
04

檢查 04|哪些行為會增加代理性的證據 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
未預排變體中的適當改計畫
會推翻判定的訊號
把隨機改變誤認為有目的規劃
本題判定規則
行為須同時合理、可重做且可歸因
05

檢查 05|如何分級而不製造虛假精確度 · 支持性測試

本輪做法
尋找最接近實際行為的支持證據,但不接受無法連回原始聲明的材料
應取得的證據
等級可由讀者回到原始 trace
會推翻判定的訊號
用 87 分掩蓋樣本與權限差異
本題判定規則
採符合最弱關鍵條件的等級

常見問題

固定 workflow 是否一定比 Agent 差?

不是。可預測且易限制的流程在高風險任務中可能更合適。

一次工具失敗後重試算規劃嗎?

若只是固定重試規則不算;需看是否根據錯誤選擇新的可行路徑。

自主等級能跨任務沿用嗎?

不能。研究任務的表現不能直接推廣到交易、客服或程式開發。

本檔案使用的來源

  1. Building effective agents — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  2. Measuring AI agent autonomy in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  3. Trustworthy agents in practice — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  4. OpenAI Agents SDK — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  5. OpenAI Evals — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  6. NIST AI 600-1: Generative AI Profile — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。
  7. OWASP LLM08: Excessive Agency — 用於核對範圍、版本、行為或控制的一手資料;使用時仍須確認頁面日期與上下文。