En résumé:
- PCWorld rapporte que Claude Opus 4.8 d’Anthropic se concentre sur l’amélioration de l’honnêteté de l’IA en apprenant au modèle à admettre quand il manque d’informations.
- Le modèle a obtenu des scores presque parfaits dans les critères d’honnêteté pour les questions de codage et a fait preuve d’une conscience de l’évaluation pendant les tests.
- L’Opus 4.8 représente une avancée significative pour rendre les systèmes d’IA plus transparents sur leurs limites et incertitudes en matière de connaissances.
L’honnêteté est un point de friction clé, même avec les LLM les plus puissants. Ce n’est pas tant qu’ils vous mentent intentionnellement ; au lieu de cela, ils vous diront en toute confiance des choses dont ils ne sont pas sûrs à 100 pour cent (ou même à 50 pour cent).
Avec Opus 4.8, son dernier modèle Claude, Anthropic affirme avoir rendu Claude plus honnête lorsqu’il vous dit ce qu’il ne sait pas, ou s’il a un faible niveau de confiance dans ce qu’il vous dit.
Sorti jeudi, Claude Opus 4.8 est pas Claude Mythos Preview, le nouveau modèle « frontière » d’Anthropic si puissant que seule une poignée de « partenaires de confiance » ont été autorisés à le tester pour des raisons de sécurité. Il n’y a toujours pas de date de sortie précise pour Claude Mythos.
Arrivant environ six semaines après Claude Opus 4.7, Opus 4.8 devient le modèle le plus puissant d’Anthropic en disponibilité générale, et pour l’essentiel, il marque une amélioration « modeste » par rapport à son prédécesseur, tandis que Mythos Preview le surpasse largement dans les tâches de cybersécurité, dit Anthropic.
Mais selon les critères de référence de l’entreprise, l’Opus 4.8 est en tête dans une catégorie clé : l’honnêteté, le modèle obtenant des scores « presque parfaits » lorsqu’il s’agit d’admettre qu’il ne connaît pas la réponse à une question de codage.
Même le très puissant Mythos Preview n’a pas pu battre l’Opus 8.7 dans ce test d’honnêteté particulier, arrivant en deuxième position, tandis que l’Opus 4.7 a terminé loin quatrième.
Bien sûr, ce sont les critères d’Anthropic que nous observons ; nous devrons attendre des tests tiers pour obtenir des résultats plus objectifs, sans parler des rapports provenant de la nature. Je prévois d’essayer l’Opus 4.8 dans les prochains jours.
Anthropic a également partagé quelques « indices concernant la sensibilisation à l’évaluation » – ce qui signifie que l’Opus 4.8 a montré des signes indiquant qu’il savait qu’il était testé – tout en notant une « tendance du modèle à raisonner sur la façon dont ses résultats seront notés ». Ces préoccupations ne sont pas propres à l’Opus 4.8 ; en effet, les derniers modèles « frontières » semblent souvent savoir quand ils sont poussés et poussés.
Pourtant, il est bon de voir que des modèles comme l’Opus 4.8 réduisent le BS, du moins sur le papier. Espérons que cela maintiendra ce niveau d’honnêteté dans la pratique.











