O benchmark de percepção visual de código aberto Kimi PerceptionBench, com a precisão do GPT-5.6-Sol em primeiro lugar, mas sem avanços do modelo acima dos 60%

robot
Geração de resumo em curso

PANews 29 de julho, a Kimi anunciou a disponibilização em código aberto do benchmark de avaliação de percepção multimodal PerceptionBench, um modelo de perceção visual, com o objetivo de decompor as capacidades de perceção visual em 10 capacidades atómicas para avaliação independente, cobrindo dimensões como relações visuais, contagem, atributos, profundidade e 3D, localização, comparação, identificação de granularidade fina, integração de contexto, OCR e deteção de alucinações, entre outras. O benchmark é construído a partir de casos de falha de modelos existentes em 42 conjuntos de avaliação, e inclui 3000 questões que foram verificadas manualmente; cada questão avalia apenas uma capacidade visual individual, sem necessidade de raciocínio ou conhecimento externo.

Os resultados da avaliação indicam que, entre 16 modelos multimodais de ponta, nenhum modelo alcançou uma exatidão global superior a 60%. O GPT-5.6-Sol ficou em primeiro lugar com 59,7% de exatidão; a Kimi K3 (58,5%), a Claude-Fable-5 (57,2%), a Gemini-3.1-Pro (56,2%) e a GPT-5.5 (55,8%) ficaram no top 5. O relatório aponta que as alucinações visuais (Hallucination) continuam a ser a capacidade mais fraca do desempenho de cada modelo, e que ainda existe espaço significativo para melhorias na capacidade global de perceção.

Ver original
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • Comentar
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
Nenhum comentário
  • Fixado