Kimi відкрив PerceptionBench — візуальний бенчмарк для сприйняття; точність GPT-5.6-Sol є найвищою, але без прориву моделей понад 60%

robot
Генерація анотацій у процесі

PANews 29 липня повідомляє, що Kimi оголосила про відкриття вихідного коду багатомодального моделі з багаторозмірним зором для тестування оцінювального базису PerceptionBench, який має на меті розкласти здатність до візуального сприйняття на 10 атомарних можливостей для незалежної оцінки, охоплюючи візуальні відносини, підрахунок, атрибути, глибину та 3D, локалізацію, порівняння, тонкозернисту ідентифікацію, інтеграцію контексту, OCR та розпізнавання галюцинацій тощо. Цей базис побудовано на основі невдалих випадків із 42 наявних наборів оцінювання, він містить 3000 завдань, перевірених вручну; у кожному завданні перевіряється лише одна візуальна здатність, без необхідності міркувань або зовнішніх знань.

Результати оцінювання показують, що серед 16 найсучасніших багатомодальних моделей жодна не досягла загальної точності понад 60%. GPT-5.6-Sol посідає перше місце з точністю 59.7%, далі йдуть Kimi K3 (58.5%), Claude-Fable-5 (57.2%), Gemini-3.1-Pro (56.2%) та GPT-5.5 (55.8%) — у топ-5. У звіті зазначено, що візуальні галюцинації (Hallucination) досі є найслабшою здатністю в роботі всіх моделей, а загальна здатність до сприйняття все ще має значний простір для покращення.

Переглянути оригінал
Ця сторінка може містити контент третіх осіб, який надається виключно в інформаційних цілях (не в якості запевнень/гарантій) і не повинен розглядатися як схвалення його поглядів компанією Gate, а також як фінансова або професійна консультація. Див. Застереження для отримання детальної інформації.
  • Нагородити
  • Прокоментувати
  • Репост
  • Поділіться
Прокоментувати
Додати коментар
Додати коментар
Немає коментарів
  • Закріплено