Panatilihing ligtas ang mga ahenteng AI sa punto kung saan nagiging aksyon ang pangangatwiran
Panatilihing ligtas ang ahenteng AI ng negosyo gamit ang least privilege, paghihiwalay ng kredensyal, hangganan ng input, hakbang ng pag-apruba, ebidensyang trace, at nasubok na pag-uugali kapag nabigo.
Nagsisimula ang seguridad ng ahenteng AI sa least privilege. Ihiwalay ang mga kredensyal, paghiwalayin ang read sa write, ituring na hindi mapagkakatiwalaang input ang nakuhang content, patunayan ang mga argumento ng kasangkapan, hilingin ang pag-apruba para sa mahahalagang aksyon, limitahan ang pag-uulit at gastos, at panatilihin ang mga trace para sa imbestigasyon.
Protektahan ang kredensyal at kasangkapan
Huwag maglagay ng magagamit-muling secret sa prompt o sa context na nakikita ng modelo. Itali ang mga kredensyal sa server-side na connector, paliitin ang kanilang saklaw, at maglantad ng mga operasyong ginawa para sa tiyak na layunin sa halip na raw shell, database, o HTTP access hangga't maaari.
Ituring na potensyal na mapanganib ang bawat input
Maaaring dumating ang prompt injection sa pamamagitan ng email, web page, dokumento, resulta ng kasangkapan, at iskrin ng isang kinokontrol na telepono. Ang nakuhang teksto ay ebidensya, hindi instruksyon. Panatilihing hiwalay sa nakuhang content ang patakaran ng sistema, at patunayan ang mga argumento ng bawat mahalagang tool call.
- Ihiwalay ang instruksyon sa nakuhang datos
- Gumawa ng allowlist para sa destinasyon at uri ng aksyon
- Magtakda ng limitasyon sa iteration, oras, gastos, at pagsulat
- Harangan ang ahente sa pagbabago ng sarili nitong pahintulot
- Hilingin ang bagong pag-apruba kapag nagbago ang saklaw
Idisenyo para sa containment at imbestigasyon
Gumamit ng pagkakakilanlan na per-workflow hangga't maaari, itala ang tool call at pag-apruba, at magbigay ng mabilisang global na paraan ng pag-disable. Subukan ang bahagyang pagkabigo, duplicadong paghahatid, lipas na state, at replay attack. Nakadepende ang seguridad sa kung ano ang mangyayari kapag hindi inaasahang kumilos ang modelo o isang dependency, hindi lamang sa happy path.
Mga madalas itanong
Malulutas ba ang prompt injection gamit ang mas matibay na prompt?
Hindi. Tumutulong ang mga prompt, ngunit ang epektibong proteksyon ay nangangailangan din ng hangganan ng pahintulot, paghawak sa hindi mapagkakatiwalaang input, pagpapatunay ng kasangkapan, hakbang ng pag-apruba, at containment.
Dapat bang matanggap ng ahente ang buong pahintulot ng user?
Karaniwan ay hindi. Bigyan ang daloy ng trabaho ng pinakamaliit na pahintulot na kailangan para sa tiyak nitong gawain at haba ng buhay.
Saan dapat itago ang kredensyal ng ahenteng AI?
Dapat itago at gamitin ang mga kredensyal sa labas ng tekstong nakikita ng modelo, mainam sa isang managed secret store o server-side connector na may makitid na saklaw at auditability.
