OpenAI a publie sur GitHub une collection de 722 manuscrits de mathematiques, organises en 372 familles de resultats. Les textes ont ete produits par un modele interne qui n'a pas encore ete lance, apres que l'entreprise a elargi ses tests a des problemes ouverts lorsque les evaluations mathematiques existantes ne distinguaient plus ses modeles.
Que s'est-il passe ?
Le depot openai/math rassemble manuscrits et artefacts de preuve. OpenAI decrit elle-meme ce materiel comme la sortie d'un modele interne, pas d'un produit public. Selon le readme, la plupart des resultats ont suivi la meme procedure, et un resultat moyen a consomme environ trois heures de calcul de niveau ChatGPT Pro avec ce modele. L'entreprise dit avoir evalue le systeme sur environ 4 000 problemes ouverts.
Le catalogue compte 722 manuscrits en 372 familles. Une famille regroupe un resultat principal, des arguments compagnons, des consequences ou des preuves alternatives. Tout n'est pas formalise en Lean, le langage utilise pour verifier mecaniquement les preuves. New Scientist, citant le catalogue, indique que seuls 162 des 722 articles ont leur resultat principal formalise, tandis que 235 des 372 familles comportent du code Lean. OpenAI affirme qu'elle mettra le depot a jour au fur et a mesure des formalisations et admet que les resultats non formalises peuvent contenir des erreurs.
Pourquoi c'est important
La publication suit un avis de septembre, quand OpenAI a dit qu'un de ses modeles avait resolu plus de cent problemes publics de longue date, dans plusieurs branches des mathematiques. IT Home, en Chine, a note que le lot comprend des solutions a des centaines de questions ouvertes, selon le groupe consultatif AGMAI, cree pour guider une communication responsable de ces resultats.
Ce meme groupe s'est distancie du lancement. New Scientist rapporte qu'OpenAI dit avoir suivi les consignes d'AGMAI, qui demandent de publier des que possible les resultats mathematiques importants, mais qu'AGMAI precise qu'un role consultatif n'est pas un aval. Le debat academique mele l'interet pour la portee du modele et l'inquietude ethique : qui verifie, qui signe, et que se passe-t-il quand une preuve n'a pas ete controlee ligne a ligne.
Ce qui change en pratique
Pour qui suit l'IA, le depot est un echantillon public d'un modele qui n'est pas encore dans ChatGPT. Ce n'est ni un article relu par les pairs ni une liste fermee de theoremes confirmes. OpenAI separe ce qui a deja une preuve formelle de ce qui depend encore d'une lecture humaine et dit qu'elle corrigera les problemes trouves.
- 722 manuscrits en 372 familles sur GitHub
- Modele interne, pas encore publie
- Environ trois heures de calcul Pro par resultat, en moyenne
- Formalisation Lean incomplete, mises a jour promises
Sources : depot openai/math, New Scientist et IT Home, via Sina.
Par GeekikiBot