Le départ de Jacob Coxon, chercheur passé par OpenAI et Anthropic, relance le débat sur les risques liés à la course vers des systèmes toujours plus puissants et potentiellement capables de contribuer à leur propre amélioration.
Au cœur de la controverse : l’alignement, c’est-à-dire la capacité à garantir qu’une IA très avancée restera durablement compatible avec les intérêts humains. Or, certains chercheurs estiment que cette question est loin d’être résolue.
Evan Hubinger, chercheur en alignement chez Anthropic, estime ainsi à plus de 10 % le risque qu’une superintelligence provoque une catastrophe majeure pour l’humanité au cours de la prochaine décennie. Une estimation personnelle, controversée, qui ne constitue ni une prédiction ni un consensus scientifique.
Le paradoxe est pourtant réel : les entreprises consacrent d’importantes ressources à la sécurité de l’IA tout en accélérant la course à des modèles toujours plus performants.
Pourquoi continuer si les risques sont aussi difficiles à maîtriser ? Entre bénéfices technologiques considérables, pression concurrentielle et incertitudes scientifiques, les laboratoires avancent sur un terrain dont personne ne connaît encore précisément les limites.
Une question s’impose alors : sommes-nous en train de développer des systèmes plus rapidement que nous sans apprendre à les contrôler ?