Dieser Artikel ist noch nicht übersetzt. Originalversion wird angezeigt.

UC Berkeley-ს კვლევა: AI მოდელები რეალურ სამუშაო ამოცანებში მარცხდება

Andrew Altair, Founder
UC Berkeley-ს კვლევა: AI მოდელები რეალურ სამუშაო ამოცანებში მარცხდება

AI ინდუსტრიაში დახარჯულმა 1.6 ტრილიონმა დოლარმა ჯერ ვერ უზრუნველყო მოდელების მიერ რეალური სამუშაო ამოცანების ეფექტიანი შესრულება. UC Berkeley-ს ბენჩმარკმა Agents' Last Exam 55 პროფესიის 1 500-ზე მეტი ამოცანა შეამოწმა.

საუკეთესო შედეგი GPT-5.5-მა აჩვენა, თუმცა მისი წარმატება მხოლოდ 24% იყო. ტესტირებაში მონაწილეობდნენ Fable 5, Gemini 3.1 Pro და Composer 2.5. ყველაზე რთულ ამოცანებში ყველა მოდელმა 0%-იანი შედეგი დააფიქსირა.

მკვლევარმა დონ სონგმა განმარტა: „როდესაც საქმე ეხება ყველაზე რთულ ამოცანებს, რომლებიც ხანგრძლივ მსჯელობას მოითხოვს, ისინი ადამიანურ დონეს ჯერ კიდევ შორს არიან.“ Fable 5 4-დან 12-ჯერ მეტ დანახარჯს მოითხოვდა.

ანგარიშის თანახმად, კვლევა 2026 წლის 21 ივლისს გამოქვეყნდა. ექსპერტები მიუთითებენ, რომ რუტინული სამუშაოები პირველ რიგში შეიცვლება, თუმცა AI ჯერ ვერ ჩაანაცვლებს ადამიანებს კომპლექსურ გადაწყვეტილებებში.