🧠 IA & agents

Stagiaire de recherche IA d’OpenAI : annonce, preuves et limites

Schéma du travail d'un agent de recherche : cadrage humain, code et expériences, contrôle des résultats, puis décision humaine

OpenAI a annoncé le 6 septembre 2026 avoir atteint son objectif de disposer d'un « stagiaire de recherche automatisé ». Le terme évoque facilement un scientifique autonome. La définition de l'entreprise est plus étroite : un système supervisé qui exécute des tâches bien délimitées, comparables à quelques jours de travail qualifié.

OpenAI rapporte aussi davantage d'usage des agents, de code produit et d'expériences lancées en interne. Ces observations ne constituent pas une mesure causale de la vitesse des découvertes et ne disent pas si un autre laboratoire obtiendrait le même résultat.

Ce que signifie « stagiaire de recherche »

Dans le cadre décrit, une personne fixe l'objectif et conserve les décisions importantes. OpenAI vise ensuite un « chercheur IA automatisé » pour mars 2028. Cette date est une cible annoncée, pas une disponibilité garantie.

Ce qu'OpenAI a mesuré

L'entreprise suit des indicateurs d'activité dans son organisation. Leur évolution accompagne l'adoption des agents, mais plusieurs variables ont changé en même temps, dont les outils et la capacité de calcul. Le billet ne fournit pas d'essai contrôlé opposant deux équipes comparables.

Le regard indépendant de METR

METR évalue la durée de tâches logicielles qu'un agent réussit avec une probabilité donnée. Cet indicateur ne mesure ni l'intelligence générale ni la productivité d'un laboratoire. L'organisme rappelle que les résultats dépendent du protocole et deviennent incertains lorsqu'une batterie de tests sature.

Sa note du 21 juillet ajoute une dimension souvent absente : le coût. Jetons, calcul expérimental et supervision doivent entrer dans la comparaison avec le travail humain. Une capacité technique et un gain économique sont deux affirmations différentes.

Notre grille de lecture

Pour juger les prochains résultats, quatre questions sont plus utiles qu'un compteur d'expériences : la tâche était-elle définie avant l'essai ? Le résultat est-il reproductible par une équipe indépendante ? Le coût complet inclut-il calcul et contrôle humain ? Une personne peut-elle comprendre l'échec et interrompre la boucle ?

Notre schéma place donc l'humain au début et à la fin : cadrer, laisser l'agent exécuter, vérifier, puis décider. Si la capacité de revue ne suit pas la production, l'automatisation déplace le goulot d'étranglement sans le supprimer.

Ce qui est confirmé, annoncé et encore inconnu

Déclaré par OpenAI : le jalon du « stagiaire » et les tendances internes. Étayé indépendamment : la capacité d'agents récents à mener des tâches logicielles longues, avec des résultats sensibles au protocole. Annoncé : l'objectif de mars 2028. Inconnu : l'effet causal sur les découvertes, le coût par résultat utile et la reproductibilité hors d'OpenAI.

Le jalon du 6 septembre mérite donc l'attention, sans devenir une preuve d'autonomie scientifique. Il décrit surtout un changement d'échelle dans l'exécution supervisée. La question décisive des prochaines années sera moins le nombre d'expériences lancées que la qualité des résultats que des équipes indépendantes peuvent vérifier.

✔ Comment nous avons vérifié

Analyse vérifiée le 12 septembre 2026 à partir de l'annonce et de la note méthodologique d'OpenAI du 6 septembre, confrontées aux travaux indépendants de METR sur la durée des tâches et le coût d'optimisation. Les mesures de productivité restent internes à OpenAI et ne sont pas traitées comme une preuve causale.

Informations vérifiées à la date de publication ou de mise à jour indiquée. La technologie évolue vite — consultez les sources ci-dessous.

Sources

  1. Research acceleration: The view inside OpenAIOpenAI
  2. Task-Completion Time Horizons of Frontier AI ModelsMETR
  3. Expenditure Horizon: Measuring Optimization AbilityMETR

À lire aussi