01
New benchmark confirms AI models still perform poorly at visual perception
Moonshot AI의 PerceptionBench는 다중 모드 AI 모델이 논리적 추론과 별도로 실제로 얼마나 잘 "볼" 수
있는지 테스트합니다 60% 정확도에 도달하는 프론티어 모델은 없으며 GPT-5.6 Sol이 근소한 차이로 앞서고 있습니다 가정된
많은 추론 오류가 실제로는 초기에 발생합니다