Apa yang harus tetap sama selama pengujian?
Tujuan, input, alat, izin, versi, dan kriteria berhasil harus sama.
Perubahan model, data, atau bantuan manusia membuat hasil tidak sebanding. Catat parameter sampling dan lakukan beberapa pengulangan untuk membedakan perilaku stabil dari kebetulan.
Cara menyimpan bukti: Simpan snapshot lingkungan, seed atau sampling, daftar alat, dan pesan manusia.
Bagaimana mengenali chatbot biasa?
Ia terutama menghasilkan teks dan tidak melanjutkan tugas dari hasil lingkungan.
Daftar langkah yang fasih masih berupa saran. Periksa apakah ada tool request nyata, hasil dibaca, keadaan dipertahankan, dan kegagalan memicu tindakan selanjutnya.
Cara menyimpan bukti: Pisahkan saran teks, proposal terstruktur, dan tindakan tereksekusi.
Apa ciri skrip atau workflow?
Urutan alat cenderung tetap dan cabang berasal dari kondisi yang ditulis sebelumnya.
Workflow tetap tidak buruk dan sering lebih aman untuk keuangan. Periksa apakah situasi baru selalu gagal atau kembali ke operator, serta apakah reasoning hanya mengisi field yang sudah ada.
Cara menyimpan bukti: Simpan diagram alur, aturan cabang, dan urutan alat dari tiga eksekusi.
Perilaku apa yang memperkuat bukti agensi?
Memilih alat dari observasi baru, memperbaiki rencana, meminta klarifikasi penting, dan berhenti dengan alasan yang tepat.
Pastikan orchestrator atau manusia tersembunyi bukan pelakunya. Uji variasi yang tidak ada dalam demo dan gagalkan alat pertama; alternatif yang masuk akal lebih kuat daripada kasus lancar.
Cara menyimpan bukti: Simpan rantai observasi→keputusan→alat→hasil dan operatornya.
Bagaimana memberi tingkat tanpa presisi palsu?
Gunakan tingkat deskriptif per tugas, bukan angka presisi dari sampel kecil.
Kategori dapat berupa jawab, workflow tetap, adaptasi bersyarat, atau otonomi terbatas. Laporkan keamanan dan kualitas terpisah karena lebih otonom tidak berarti lebih andal.
Cara menyimpan bukti: Untuk tiap tingkat simpan bukti positif, bantahan, unknown, dan cakupan.
Buku kerja verifikasi
Kartu berikut mengubah riset menjadi catatan yang dapat diulang. Kartu ini tidak menghasilkan rekomendasi; bukti, kontradiksi, versi, batas, dan kondisi yang dapat mengubah kesimpulan harus tetap disimpan.
Pemeriksaan 01 · Apa yang harus tetap sama selama pengujian · Uji pendukung
- Langkah putaran ini
- mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
- Bukti yang dicari
- beberapa eksekusi mempunyai kondisi yang sebanding
- Sinyal yang menggugurkan
- izin atau prompt ditambah diam-diam saat uji
- Aturan putusan
- eksekusi tak sebanding dikeluarkan dari putusan
Pemeriksaan 02 · Bagaimana mengenali chatbot biasa · Uji pendukung
- Langkah putaran ini
- mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
- Bukti yang dicari
- ada perubahan keadaan eksternal yang dapat diperiksa
- Sinyal yang menggugurkan
- kalimat “sudah selesai” dianggap bukti
- Aturan putusan
- tanpa efek eksternal, simpulkan kemampuan menjawab saja
Pemeriksaan 03 · Apa ciri skrip atau workflow · Uji pendukung
- Langkah putaran ini
- mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
- Bukti yang dicari
- cabang tetap dapat direproduksi dari konfigurasi
- Sinyal yang menggugurkan
- alur panjang disebut agen
- Aturan putusan
- kelas ditentukan oleh ruang keputusan yang nyata
Pemeriksaan 04 · Perilaku apa yang memperkuat bukti agensi · Uji pendukung
- Langkah putaran ini
- mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
- Bukti yang dicari
- penyesuaian yang tepat pada variasi baru
- Sinyal yang menggugurkan
- perubahan acak dianggap perencanaan
- Aturan putusan
- perilaku harus masuk akal, berulang, dan teratribusi
Pemeriksaan 05 · Bagaimana memberi tingkat tanpa presisi palsu · Uji pendukung
- Langkah putaran ini
- mencari bukti terbaik yang paling dekat dengan perilaku tanpa menerima materi yang tidak dapat dihubungkan ke klaim
- Bukti yang dicari
- pembaca dapat kembali dari tingkat ke trace
- Sinyal yang menggugurkan
- skor 87 menyembunyikan sampel dan izin
- Aturan putusan
- pakai tingkat yang memenuhi seluruh kondisi kunci
Pertanyaan umum
Apakah workflow tetap selalu lebih buruk?
Tidak. Prediktabilitas dan pembatasan mudah dapat lebih cocok untuk tugas berisiko tinggi.
Apakah retry setelah alat gagal berarti perencanaan?
Tidak bila hanya aturan retry tetap; perlu alternatif yang dipilih berdasarkan error.
Dapatkah tingkat otonomi dipakai untuk tugas lain?
Tidak. Hasil riset tidak otomatis berlaku pada trading, dukungan, atau coding.
Sumber yang menopang berkas ini
- Building effective agents — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
- Measuring AI agent autonomy in practice — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
- Trustworthy agents in practice — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
- OpenAI Agents SDK — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
- OpenAI Evals — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
- NIST AI 600-1: Generative AI Profile — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
- OWASP LLM08: Excessive Agency — Sumber primer untuk memeriksa cakupan, versi, perilaku, atau kontrol; periksa tanggal dan konteks halaman tertaut.
