Apa yang harus tetap sama selama pengujian?

Tujuan, input, alat, izin, versi, dan kriteria berhasil harus sama.

Perubahan model, data, atau bantuan manusia membuat hasil tidak sebanding. Catat parameter sampling dan lakukan beberapa pengulangan untuk membedakan perilaku stabil dari kebetulan.

Cara menyimpan bukti: Simpan snapshot lingkungan, seed atau sampling, daftar alat, dan pesan manusia.

Bagaimana mengenali chatbot biasa?

Ia terutama menghasilkan teks dan tidak melanjutkan tugas dari hasil lingkungan.

Daftar langkah yang fasih masih berupa saran. Periksa apakah ada tool request nyata, hasil dibaca, keadaan dipertahankan, dan kegagalan memicu tindakan selanjutnya.

Cara menyimpan bukti: Pisahkan saran teks, proposal terstruktur, dan tindakan tereksekusi.

Apa ciri skrip atau workflow?

Urutan alat cenderung tetap dan cabang berasal dari kondisi yang ditulis sebelumnya.

Workflow tetap tidak buruk dan sering lebih aman untuk keuangan. Periksa apakah situasi baru selalu gagal atau kembali ke operator, serta apakah reasoning hanya mengisi field yang sudah ada.

Cara menyimpan bukti: Simpan diagram alur, aturan cabang, dan urutan alat dari tiga eksekusi.

Perilaku apa yang memperkuat bukti agensi?

Memilih alat dari observasi baru, memperbaiki rencana, meminta klarifikasi penting, dan berhenti dengan alasan yang tepat.

Pastikan orchestrator atau manusia tersembunyi bukan pelakunya. Uji variasi yang tidak ada dalam demo dan gagalkan alat pertama; alternatif yang masuk akal lebih kuat daripada kasus lancar.

Cara menyimpan bukti: Simpan rantai observasi→keputusan→alat→hasil dan operatornya.

Bagaimana memberi tingkat tanpa presisi palsu?

Gunakan tingkat deskriptif per tugas, bukan angka presisi dari sampel kecil.

Kategori dapat berupa jawab, workflow tetap, adaptasi bersyarat, atau otonomi terbatas. Laporkan keamanan dan kualitas terpisah karena lebih otonom tidak berarti lebih andal.

Cara menyimpan bukti: Untuk tiap tingkat simpan bukti positif, bantahan, unknown, dan cakupan.

Buku kerja verifikasi

Kartu berikut mengubah riset menjadi catatan yang dapat diulang. Kartu ini tidak menghasilkan rekomendasi; bukti, kontradiksi, versi, batas, dan kondisi yang dapat mengubah kesimpulan harus tetap disimpan.

01

Pemeriksaan 01 · Apa yang harus tetap sama selama pengujian · Uji pendukung

Langkah putaran ini
mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
Bukti yang dicari
beberapa eksekusi mempunyai kondisi yang sebanding
Sinyal yang menggugurkan
izin atau prompt ditambah diam-diam saat uji
Aturan putusan
eksekusi tak sebanding dikeluarkan dari putusan
02

Pemeriksaan 02 · Bagaimana mengenali chatbot biasa · Uji pendukung

Langkah putaran ini
mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
Bukti yang dicari
ada perubahan keadaan eksternal yang dapat diperiksa
Sinyal yang menggugurkan
kalimat “sudah selesai” dianggap bukti
Aturan putusan
tanpa efek eksternal, simpulkan kemampuan menjawab saja
03

Pemeriksaan 03 · Apa ciri skrip atau workflow · Uji pendukung

Langkah putaran ini
mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
Bukti yang dicari
cabang tetap dapat direproduksi dari konfigurasi
Sinyal yang menggugurkan
alur panjang disebut agen
Aturan putusan
kelas ditentukan oleh ruang keputusan yang nyata
04

Pemeriksaan 04 · Perilaku apa yang memperkuat bukti agensi · Uji pendukung

Langkah putaran ini
mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
Bukti yang dicari
penyesuaian yang tepat pada variasi baru
Sinyal yang menggugurkan
perubahan acak dianggap perencanaan
Aturan putusan
perilaku harus masuk akal, berulang, dan teratribusi
05

Pemeriksaan 05 · Bagaimana memberi tingkat tanpa presisi palsu · Uji pendukung

Langkah putaran ini
mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
Bukti yang dicari
pembaca dapat kembali dari tingkat ke trace
Sinyal yang menggugurkan
skor 87 menyembunyikan sampel dan izin
Aturan putusan
pakai tingkat yang memenuhi seluruh kondisi kunci

Pertanyaan umum

Apakah workflow tetap selalu lebih buruk?

Tidak. Prediktabilitas dan pembatasan mudah dapat lebih cocok untuk tugas berisiko tinggi.

Apakah retry setelah alat gagal berarti perencanaan?

Tidak bila hanya aturan retry tetap; perlu alternatif yang dipilih berdasarkan error.

Dapatkah tingkat otonomi dipakai untuk tugas lain?

Tidak. Hasil riset tidak otomatis berlaku pada trading, dukungan, atau coding.

Sumber yang menopang berkas ini

  1. Building effective agents — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
  2. Measuring AI agent autonomy in practice — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
  3. Trustworthy agents in practice — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
  4. OpenAI Agents SDK — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
  5. OpenAI Evals — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
  6. NIST AI 600-1: Generative AI Profile — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
  7. OWASP LLM08: Excessive Agency — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.