UC Berkeley-ს კვლევა: AI მოდელები რეალურ სამუშაო ამოცანებში მარცხდება
AI ინდუსტრიაში დახარჯულმა 1.6 ტრილიონმა დოლარმა ჯერ ვერ უზრუნველყო მოდელების მიერ რეალური სამუშაო ამოცანების ეფექტიანი შესრულება. UC Berkeley-ს ბენჩმარკმა Agents' Last Exam 55 პროფესიის 1 500-ზე მეტი ამოცანა შეამოწმა.
საუკეთესო შედეგი GPT-5.5-მა აჩვენა, თუმცა მისი წარმატება მხოლოდ 24% იყო. ტესტირებაში მონაწილეობდნენ Fable 5, Gemini 3.1 Pro და Composer 2.5. ყველაზე რთულ ამოცანებში ყველა მოდელმა 0%-იანი შედეგი დააფიქსირა.
მკვლევარმა დონ სონგმა განმარტა: „როდესაც საქმე ეხება ყველაზე რთულ ამოცანებს, რომლებიც ხანგრძლივ მსჯელობას მოითხოვს, ისინი ადამიანურ დონეს ჯერ კიდევ შორს არიან.“ Fable 5 4-დან 12-ჯერ მეტ დანახარჯს მოითხოვდა.
ანგარიშის თანახმად, კვლევა 2026 წლის 21 ივლისს გამოქვეყნდა. ექსპერტები მიუთითებენ, რომ რუტინული სამუშაოები პირველ რიგში შეიცვლება, თუმცა AI ჯერ ვერ ჩაანაცვლებს ადამიანებს კომპლექსურ გადაწყვეტილებებში.