AI აგენტის უფლებები: დამტკიცების ზღვარი მანამდე, სანამ ის იმოქმედებს
როგორ განისაზღვროს, რისი წაკითხვა, შეთავაზება, შეცვლა ან გაგზავნა შეუძლია AI აგენტს და სად იწყება ადამიანის სავალდებულო დამტკიცება.
- ავტორი
- aiNOW-ის სარედაქციო გუნდი
- კითხვის დრო
- 7 წუთი
- გამოქვეყნდა

მოკლედ: მოქმედების მქონე AI აგენტს იმ ნაბიჯისთვის საჭირო მინიმალური წვდომა უნდა ჰქონდეს. ერთმანეთისგან გამოყავით ნახვა, მონახაზის მომზადება, დამტკიცების მოთხოვნა და შესრულება. კლიენტისთვის შეტყობინება, ჩანაწერის შეცვლა, თანხასთან ან პირად მონაცემთან დაკავშირებული მოქმედება ნაგულისხმევად დამტკიცებას უნდა ელოდებოდეს. სისტემა უნდა ინახავდეს, ვინ რა საფუძვლით დაამტკიცა და რეალურად შესრულდა თუ არა ქმედება.
სარედაქციო შენიშვნა: ეს სტატია მომზადებულია AI-ის დახმარებით. მაგალითი პირობითია, თუ სხვაგვარად არ არის მითითებული; გამოყენებამდე გადაამოწმეთ მითითებული წყაროები და საკუთარი სამუშაო პროცესი.
წვდომის ერთეული მოქმედებაა
ფრაზა „აგენტს CRM-ზე წვდომა აქვს“ არაფერს ამბობს იმაზე, რა შეუძლია მას სინამდვილეში. კლიენტის ჩანაწერის ნახვა, ცოდნის ბაზაში ძიება, ველის შეცვლა, გარე წერილის გაგზავნა და თანხის დაბრუნება ერთმანეთისგან განსხვავებული მოქმედებებია. ამიტომ ზღვარი პროგრამის სახელით კი არა, ინსტრუმენტის კონკრეტული ოპერაციით უნდა დაიწეროს.
Anthropic-ის სანდო აგენტების პრინციპები აღწერს კონფიგურირებად რეჟიმებს: ზოგი მოქმედება ყოველთვის დასაშვებია, ზოგი დამტკიცებას მოითხოვს, ზოგი კი დაბლოკილია. სწორი კითხვა არ არის „ვანდობთ თუ არა აგენტს“. სწორი კითხვაა: რა ზუსტ მოქმედებას ვუშვებთ, რა მონაცემით, ვის სახელით და რომელი დამტკიცების შემდეგ.
aiNOW-ის ავტომატიზაციის განხილვა შეიძლება გამოყენებულ იქნას ასეთი გზის დასახაზად. ეს არ ნიშნავს, რომ აგენტს ფართო წვდომა უნდა მიეცეს.
შედარება: მცირე უფლებების მატრიცა
| ოპერაცია | საწყისი რეჟიმი | რა არის საჭირო | დამტკიცების ზღვარი |
|---|---|---|---|
| არასაიდუმლო, დამტკიცებული წყაროს წაკითხვა | დაშვება განსაზღვრულ ფარგლებში | წყარო, მიზანი და წვდომის წესი | ჟურნალების და ფარგლების პერიოდული შემოწმება |
| მგრძნობიარე ჩანაწერის ნახვა | მხოლოდ დასახელებული ამოცანისთვის | მომხმარებლის იდენტობა, მიზანი და ველების წვდომა | პოლიტიკით ნებადართული ავტორიზაცია და ჩანაწერი |
| პასუხის ან ცვლილების მონახაზის მომზადება | დაშვება როგორც შეთავაზება | წყარო, დაშვებები და გაურკვევლობა | ადამიანის განხილვა გარე შედეგამდე |
| შიდა ჩანაწერის შეცვლა | ნაგულისხმევად დამტკიცება | შემოწმებული ველები და ძველი და ახალი მდგომარეობა | სახელობითი დამმტკიცებელი და აუდიტის კვალი |
| გარე შეტყობინება ან ტრანზაქცია | ცალკე, მკაფიო დამტკიცება | საბოლოო ტექსტი, მიმღები, უფლებამოსილება და საფუძველი | დადასტურება არ შეიძლება იგულისხმებოდეს |
| წაშლა, გამჟღავნება ან კონტროლის გვერდის ავლა | დაბლოკვა | გამონაკლისისთვის ცალკე მფლობელის პროცესი | საერთო დანიშნულების აგენტს არ გადაეცეს |
ასეთი მატრიცა პოლიტიკის დოკუმენტია. მითითება „ფრთხილად იყავი“ ვერ ცვლის ინსტრუმენტზე რეალურ შეზღუდვას, დამტკიცების წერტილს ან აუდიტის ჩანაწერს.
ნახვა, შეთავაზება, დამტკიცება და შესრულება ცალკე მდგომარეობაა
- ნახვა: სისტემა მხოლოდ ნებადართულ წყაროს კითხულობს და ამოცანის კონტექსტს ადგენს.
- შეთავაზება: აგენტი ამზადებს გეგმას, ტექსტს ან სტრუქტურირებულ ცვლილებას და აჩვენებს წყაროსა და გაურკვევლობას.
- დამტკიცება: ადამიანი ან პოლიტიკის ძრავა ამოწმებს კონკრეტულ ოპერაციას, მიმღებს, ფარგლებსა და შედეგს.
- შესრულება: ვიწრო ინსტრუმენტი მხოლოდ დამტკიცებულ ქმედებას ასრულებს და ქვითარს აბრუნებს.
- შედეგის დადასტურება: სისტემა ამოწმებს რეალურ მდგომარეობას და მხოლოდ მოთხოვნის გაგზავნას დასრულებად არ თვლის.
Anthropic-ის უსაფრთხოების ჩარჩო ეხება მხოლოდ-წაკითხვის რეჟიმს, სისტემის შეცვლამდე დამტკიცებას, მაღალი რისკის გადაწყვეტილებებზე ადამიანის კონტროლს და გამჭვირვალობას. პრაქტიკაში ეს ნიშნავს: გენერირებული გეგმა გამოსადეგია მანამ, სანამ შესრულების უფლება ცალკე არ არსებობს.
გამოყენების შემთხვევა: ჰიპოთეტური მაგალითი: დუბლირებული კლიენტის ჩანაწერი
წარმოიდგინეთ მხარდაჭერის აგენტი, რომელმაც სავარაუდოდ დუბლირებული კლიენტის ჩანაწერები იპოვა. მას შეუძლია ნებადართული ჩანაწერები შეადაროს და მოამზადოს შეთავაზება: რომელი ველი დარჩება, რომელი ჩანაწერი იცვლება და სად არის წინააღმდეგობა.
აგენტმა მხოლოდ იმიტომ არ უნდა გააერთიანოს ჩანაწერები, წაშალოს ისტორია, კლიენტს მისწეროს ან ბილინგის სტატუსი შეცვალოს, რომ ტექსტი თავდაჯერებულად ჟღერს. შემმოწმებელი ხედავს საწყის ჩანაწერებს, განსხვავებულ ველებს, შემოთავაზებულ მდგომარეობას და მიზეზს. უფლებამოსილი პირი ზუსტად ამ გაერთიანებას ამტკიცებს. შემდეგ ვიწრო ინსტრუმენტი ასრულებს მოქმედებას, შედეგს აბრუნებს და კვალს ტოვებს. მგრძნობიარე ველის წინააღმდეგობისას პროცესი ჩერდება.
კონტროლი ინსტრუმენტსა და მონაცემსაც უნდა გარშემორტყმოდეს
უსაფრთხოება ირღვევა, როცა მოდელი ერთადერთ საზღვრად ითვლება. OWASP-ის RAG უსაფრთხოების სახელმძღვანელო ყურადღებას ამახვილებს წვდომის მეტამონაცემზე, წარმომავლობაზე, უსაფრთხო უარზე და დამტკიცების პროცესზე. მოქმედების მქონე სისტემაში ეს გადაითარგმნება კონკრეტულ კონტროლებად:
- თითოეულ ინსტრუმენტს ვიწრო სქემა ჰქონდეს და ზედმეტი ველი უარყოს.
- წვდომა მომთხოვნი პირის იდენტობასა და ამოცანის კონტექსტს უკავშირდებოდეს, არა მხოლოდ საერთო ანგარიშს.
- ჩანაწერი გაფილტრული იყოს მანამდე, სანამ მოდელი მას ნახავს; წყაროს იდენტიფიკატორი შემოწმებისთვის დარჩეს.
- დამტკიცება ვადაგასულად ჩაითვალოს, თუ ჩანაწერი, მიმღები ან წესი შეიცვალა.
- უარი და აკლილი საფუძველი ხილული იყოს; სისტემამ ფართო წვდომით ჩუმად ხელახლა არ სცადოს.
დამტკიცების პაკეტი მთელ საუბარზე მოკლე უნდა იყოს
შემმოწმებელს გადაწყვეტილების აღსადგენად გრძელი მიმოწერის წაკითხვა არ უნდა დასჭირდეს. აჩვენეთ ზუსტი მოქმედება, დაზარალებული ობიექტი, მიმდინარე და შემოთავაზებული მდგომარეობა, მტკიცებულება, დაშვებები, ცნობილი გაურკვევლობა, მიმღები და აღდგენის გზა. მიუთითეთ მომთხოვნი და დამმტკიცებელი პირების ვინაობა. თუ რომელიმე ველი აკლია, მოქმედება შეთავაზებად უნდა დარჩეს.
ეს პაკეტი ასევე გვეხმარება, განვასხვავოთ მითითებაში ჩადებული შეტევის მცდელობა ნამდვილი ინსტრუქციისგან. დოკუმენტში ან შეტყობინებაში დაწერილი ფრაზა, რომელიც აგენტს პოლიტიკის უგულებელყოფას ან მონაცემების გამჟღავნებას სთხოვს, შესაფასებელი შესატანი ინფორმაციაა და არა უფლებების შეცვლის საფუძველი.
შეზღუდვები: უფლებები დაუდასტურებელ გეგმას სწორად ვერ აქცევს
მინიმალური წვდომა შეცდომის ზიანს ამცირებს, მაგრამ გეგმის ფაქტობრივ სისწორეს ვერ ამტკიცებს. მხოლოდ-წაკითხვის აგენტმაც შეიძლება მგრძნობიარე კონტექსტი არასწორ ადამიანს აჩვენოს. დამტკიცებული ქმედებაც მოძველებულ წესს შეიძლება ეყრდნობოდეს. ინსტრუმენტმა წარმატება შეიძლება დააბრუნოს, მაგრამ შემდგომმა სისტემამ ცვლილება ნაწილობრივ მიიღოს. ამიტომ მატრიცა გამოსცადეთ აკლილი ველით, წინააღმდეგობრივი წყაროთი, ვადაგასული დამტკიცებით, ორაზროვანი იდენტობითა და ინსტრუმენტის შეცდომით. პროცესის საზღვრის დასახაზად aiNOW-ის კონსულტაციას შეგიძლიათ მიმართოთ.
შემდეგი ნაბიჯი: ოპერაციების ინვენტარი
ჩამოწერეთ ყველა ოპერაცია, რომლის შესრულებაც აგენტს შეიძლება დასჭირდეს და მონიშნეთ: ნახვა, შეთავაზება, დამტკიცება, შესრულება ან ბლოკირება. თითოეულს დაუმატეთ მონაცემის ფარგლები, საჭირო მტკიცებულება, დამმტკიცებელი, ქვითარი და აღდგენის გზა. დაიწყეთ ერთი დაბალი რისკის წაკითხვითა და ერთი შეთავაზებული მოქმედებით. თუ პასუხისმგებლობა ან ინტეგრაცია გაურკვეველია, aiNOW-ის კონსულტაციით ჩამოაყალიბეთ მართვის კითხვები და დაგვიკავშირდით.
ხშირი კითხვები
რატომ არ არის საკმარისი მითითება, რომ აგენტი ფრთხილად იყოს?
მითითება ტექსტია, ხოლო წვდომა და შესრულება სისტემური შესაძლებლობაა. თუ ხელსაწყოს შეუძლია გარე წერილის გაგზავნა ან ჩანაწერის შეცვლა, საჭიროა რეალური შეზღუდვა, დასამტკიცებელი ოპერაცია და შემოწმებადი კვალი.
რა განსხვავებაა შეთავაზებასა და შესრულებას შორის?
შეთავაზება ჯერ მხოლოდ მონახაზია, რომელიც წყაროს, დაშვებებსა და გაურკვევლობას აჩვენებს. შესრულება რეალურ სამყაროში ცვლის ჩანაწერს, გზავნის შეტყობინებას ან ქმნის ვალდებულებას, ამიტომ მას ცალკე ნებართვა და შედეგის შემოწმება სჭირდება.
საიდან დავიწყოთ?
ჩამოწერეთ ყველა შესაძლო ოპერაცია და მონიშნეთ: ნახვა, შეთავაზება, დამტკიცება, შესრულება ან ბლოკირება. თითოეულს დაუმატეთ მონაცემის ფარგლები, საჭირო საფუძველი, დამმტკიცებელი, ქვითარი და დაბრუნების გზა. გაურკვეველი ინტეგრაციის შემთხვევაში დაუკავშირდით aiNOW-ს.