PANews, le 26 septembre - OpenAI a lancé un nouvel outil d'évaluation, GDPval, qui se concentre sur la mesure de la performance de l'IA dans des tâches ayant une valeur économique réelle. GDPval couvre 44 professions dans les neuf grands secteurs qui contribuent le plus au PIB américain, avec des tâches conçues par des experts de l'industrie ayant en moyenne 14 ans d'expérience. Les résultats de l'évaluation montrent que le modèle Claude Opus 4.1 est comparable ou supérieur à la plupart des sorties des experts. OpenAI a déclaré qu'il continuera à élargir la portée et les détails de l'évaluation GDPval à l'avenir.
Voir l'original
Cette page peut inclure du contenu de tiers fourni à des fins d'information uniquement. Gate ne garantit ni l'exactitude ni la validité de ces contenus, n’endosse pas les opinions exprimées, et ne fournit aucun conseil financier ou professionnel à travers ces informations. Voir la section Avertissement pour plus de détails.
OpenAI a publié l'évaluation des performances de la tâche de valeur économique de l'IA GDPval.
PANews, le 26 septembre - OpenAI a lancé un nouvel outil d'évaluation, GDPval, qui se concentre sur la mesure de la performance de l'IA dans des tâches ayant une valeur économique réelle. GDPval couvre 44 professions dans les neuf grands secteurs qui contribuent le plus au PIB américain, avec des tâches conçues par des experts de l'industrie ayant en moyenne 14 ans d'expérience. Les résultats de l'évaluation montrent que le modèle Claude Opus 4.1 est comparable ou supérieur à la plupart des sorties des experts. OpenAI a déclaré qu'il continuera à élargir la portée et les détails de l'évaluation GDPval à l'avenir.