Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA

keepthepace_@jlai.lu · 2 months ago

Je bosse au 4/5 sur les modèles de langage (LLM, parfois appelées IAs) et à 2/5 sur la robotique open hardware AMA

inlandempire@jlai.lu · 2 months ago

Coucou merci pour l’AMA !

Quelle est la réalité du problème d’AI imbreeding que certains relèvent ? Si j’ai bien compris il y a un risque que les modèles (de langage ou de génération d’image) apprennent sur du contenu généré par IA, ce qui entraînerait à des résultats de plus en plus mauvais ?

Je suppose que ma question est plutôt quelles sont les mesures prises dans le milieu pour s’assurer une sélection de sources de qualité, ou bien quel est le processus qui permet de sélectionner les résultats pour d’entraîner l’IA ?

Et en plus léger, qu’elle est la première fois que tu as entendu parler d’IA ?

keepthepace_@jlai.lu · edit-2 2 months ago

Perso je ne crois pas que ce soit un problème, ou en tous cas pas encore. Les publis que j’ai vu sur le sujet semblent indiquer que les sorties de LLMs produisent des datasets de meilleure qualité que les datasets originaux. Et quand on y pense, ça a du sens: un modèle a été entraîné à produire des “bons” textes à partir d’un peu n’importe quoi. Il y a une certaine logique à ce qu’un premier LLM arrive à faire une version améliorée du premier dataset.

Est ce qu’on peut itérer longtemps comme ça? Pas sur, mais je pense qu’on surestime le problème voire qu’on l’imagine.

quelles sont les mesures prises dans le milieu pour s’assurer une sélection de sources de qualité, ou bien quel est le processus qui permet de sélectionner les résultats pour d’entraîner l’IA ?

Pour ceux qui sont dans la course à la perf et au meilleur benchmark: zéro. Tant que mettre plus de données améliore les résultats, ils font ça. Tout github, tout reddit, tout facebook y passe.

La recherche est en train de montrer que - surprise! - la qualité des données d’entraînement influe grandement sur la qualité du modèle et ça intéresse surtout les groupes avec moins de moyens.

Les chercheurs qui travaillent sur les problèmes d’alignement (d’éthique) s’intéressent à ces questions aussi. Par exemple une discussion intéressante avait lieu à EleutherAI pendant qu’ils assemblaient The Pile: Est ce qu’il faut intégrer toute la librairie du Congrès US? D’un coté c’est intéressant d’avoir des siècles de discussion législative, de l’autre, sur une bonne partie de cette période, on considère que les noirs sont une marchandises et sur la majorité de la période, des citoyens de seconde zone.

Ce qu’il y a d’intéressant c’est que des données pourries, biaisées, racistes, peuvent tout de même aider le modèle à s’améliorer, mais il faut que ce soit fait correctement et il y a là matière à des débats qui relèvent de la politique et de la philosophie appliquées (“Peut-on combattre le racisme en ignorant les thèses racistes?” Vous avez 4 heures)

inlandempire@jlai.lu · 2 months ago

Merci pour tous ces détails !

keepthepace_@jlai.lu · 2 months ago

Et en plus léger, qu’elle est la première fois que tu as entendu parler d’IA ?

Oh ça date! Je lis de la SF depuis que je suis petit, et les robots m’ont toujours fasciné, on m’a rapidement expliqué que le software était le plus gros facteur limitant, du coup l’IA devient le problème à résoudre rapidement. Je pense pas avoir eu plus de 12 ans quand on a commencé à en discuter.