Bu makale henüz tercüme edilmemiştir. Orijinal versiyon gösteriliyor.

OpenAI-ის ცნობით GPT-5.6 Sol-მა ARC-AGI-3 ტესტში Opus 5-ის შედეგი გაუმჯობესა

Andrew Altair, Founder
OpenAI-ის ცნობით GPT-5.6 Sol-მა ARC-AGI-3 ტესტში Opus 5-ის შედეგი გაუმჯობესა

OpenAI-ის წარმომადგენლებმა განაცხადეს, რომ მოდელმა GPT-5.6 Sol-მა ARC-AGI-3 ტესტში 38.3% დააგროვა და Opus 5-ის 30.2%-იან შედეგს გადააჭარბა. ტექნოლოგიურმა გიგანტმა ეს მონაცემები 2026 წლის 30 ივლისს გამოაქვეყნა.

კომპანიამ ეს შედეგი საკუთარი Responses API-ს მეშვეობით მიაღწია. ოფიციალურ სატესტო გარემოში კი მოდელმა მხოლოდ 7.8% აჩვენა, რადგან იქ მსჯელობის ჯაჭვი იშლება.

ARC Prize-ის ორგანიზატორებმა დაადასტურეს, რომ ოფიციალური შეფასება სტანდარტულ გარემოს მოითხოვს. მათმა წარმომადგენელმა განმარტა: „ჩვენი მიზანია მოდელების სუფთა შესაძლებლობები შევაფასოთ“.

Opus 5-მა თავისი 30.2%-იანი შედეგი დამხმარე ინსტრუმენტების გარეშე დააფიქსირა. ამიტომ ოფიციალურ რეიტინგში პირველ ადგილს კვლავ Anthropic-ის პლატფორმა ინარჩუნებს.

ექსპერტების შეფასებით, 2 სხვადასხვა სატესტო გარემოს არსებობა ახალ დისკუსიას წარმოშობს. მკვლევრები 2026 წლის ბოლომდე ახალი სტანდარტების შემუშავებას გეგმავენ.