Kimi publica PerceptionBench de código abierto, un benchmark de percepción visual; la precisión de GPT-5.6-Sol ocupa el primer lugar, pero no logra superar el 60%

robot
Generación de resúmenes en curso

PANews 29 de julio, Kimi anunció la apertura de código de un modelo grande multimodal de evaluación del benchmark de percepción PerceptionBench, con el objetivo de descomponer la capacidad de percepción visual en 10 habilidades atómicas para una evaluación independiente, que abarcan relaciones visuales, conteo, atributos, profundidad y 3D, localización, comparación, reconocimiento de grano fino, integración de contexto, OCR y detección de alucinaciones, entre otras dimensiones. Este benchmark se construye a partir de casos fallidos de modelos en 42 conjuntos de evaluación existentes, e incluye 3000 preguntas verificadas por humanos; cada pregunta solo evalúa una única capacidad visual, sin necesidad de razonamiento ni conocimiento externo.

Los resultados de la evaluación muestran que, entre 16 modelos grandes multimodales de vanguardia, ningún modelo supera el 60% de precisión global. GPT-5.6-Sol ocupa el primer lugar con 59,7% de precisión; Kimi K3 (58,5%), Claude-Fable-5 (57,2%), Gemini-3.1-Pro (56,2%) y GPT-5.5 (55,8%) se sitúan entre los cinco primeros. El informe señala que la alucinación visual (Hallucination) sigue siendo la capacidad más débil en el desempeño de todos los modelos, y que aún existe un margen significativo para mejorar la capacidad general de percepción.

Ver original
Esta página puede contener contenido de terceros, que se proporciona únicamente con fines informativos (sin garantías ni declaraciones) y no debe considerarse como un respaldo por parte de Gate a las opiniones expresadas ni como asesoramiento financiero o profesional. Consulte el Descargo de responsabilidad para obtener más detalles.
  • Recompensa
  • Comentar
  • Republicar
  • Compartir
Comentar
Añadir un comentario
Añadir un comentario
Sin comentarios
  • Fijado