HomeVideos

Le comportement IA que personne n'avait prédit (actus IA)

Now Playing

Le comportement IA que personne n'avait prédit (actus IA)

Transcript

717 segments

0:00

Cette semaine, un laboratoire chinois a

0:02

publié un papier qui pose une question

0:04

gênante. Si on arrête d'apprendre à

0:06

réfléchir, est-ce qu'elle peut par

0:07

elle-même développer la capacité de

0:10

formuler des réflexions ? La réponse du

0:11

papier, oui, mais pas n'importe comment.

0:13

Dans cette vidéo, vous allez voir trois

0:14

choses. 1, comment est-ce qu'ils ont

0:16

entraîné cette IA qui a appris à

0:17

réfléchir. De ce que le modèle arrive à

0:20

faire tout seul sans qu'on lui demande

0:21

et que personne n'avait pu prédire. Vous

0:22

allez voir, il a par exemple une anxiété

0:24

de Lia qui se développe et trois ce que

0:25

ça implique pour l'aent

0:28

marrant c'est que ce papier il y a un

0:29

scientifique qui l'avait déjà prédit il

0:31

y a 35 ans sur l'intelligence

0:33

artificielle. C'est donc le sujet

0:34

principal des actualités il a de la

0:36

semaine. On verra dans le reste de la

0:37

vidéo les deux modèles chinois qui sont

0:38

sortis cette semaine et qui rivalisent

0:40

avec Claude Fable. Ce que ça veut dire

0:42

aussi pour vous et au niveau des coûts

0:43

des Modelia. Ensuite, le premier modèle

0:45

open weight américain qui a été sorti et

0:48

qui a des performances tout à fait

0:49

correctes par euh l'ancienne cfondatrice

0:51

de Opene. Et enfin, on parlera d'une

0:53

entreprise qu'Apple songerait en ce

0:54

moment à racheter pour faire tourner des

0:56

modèles IA en local sur les iPhones.

0:58

C'est parti.

1:04

Alors, pour comprendre ce papier

1:05

scientifique fascinant qui a été publié

1:07

par le groupe de recherche chinois N

1:09

Group, il faut qu'on remette les bases.

1:11

Tout d'abord, c'est quoi un modèle A ?

1:12

Vous rappelle un modèle il y a à la base

1:14

c'est simplement une fonction qui va

1:16

venir prédire le token suivant donc quel

1:19

mot on voudrait avoir à la suite de

1:20

notre phrase à partir de tous les tokens

1:22

donc les mots précédents. Ça marche à

1:23

peu près de la même manière que

1:24

l'autocompression que vous avez sur le

1:25

clavier de votre téléphone sauf que

1:27

c'est poussé à l'extrême et c'est des

1:28

modèles qui ont des milliards de

1:30

chiffres pour avoir de plus en plus de

1:32

capacité de réflexion. Il y a quelques

1:33

années Lia elle réfléchissait même pas,

1:35

elle répondait direct. C'est-à-dire que

1:36

vous faisiez un prompte et vous aviez

1:38

une réponse instantanée qui générait

1:39

token par token, mot par mot. Sauf que

1:41

petit à petit, à force des évolutions,

1:43

on a remarqué que si on lui faisait

1:45

émettre euh des tokens de réflexion

1:48

avant d'exploer sa réponse finale, la

1:50

qualité des réponses explosé. Donc on a

1:51

voulu lui apprendre à réfléchir.

1:53

D'ailleurs, vous l'avez peut-être vu sur

1:54

GPT ou sur Claude quand vous l'utilisez

1:55

maintenant, vous avez une un onglet

1:57

thinking ou Claude réfléchit. Parfois,

1:59

vous pouvez le voir les étapes de

2:00

réflexion par lesquelles Lia passe avant

2:02

de vous répondre. C'est de ça dont on

2:03

parle aujourd'hui. Donc quand on a

2:04

commencé à créer ces token de réflexion,

2:06

ce mécanisme, ce qui se passait c'était

2:08

que c'était des humains qui rédigaient

2:09

des milliers d'exemples de raisonnement

2:11

étape par étape. Par exemple, pour des

2:12

problèmes mathématiques. D'abord, on

2:13

pose le problème et puis ainsi de suite

2:14

comme ça, les étapes de réflexion. Et

2:16

puis, on entraîait le modèle à prédire

2:17

les tokens de ses réflexions. En clair,

2:19

on lui apprenait à imiter de la

2:21

réflexion humaine. Et c'est là qu'il y a

2:23

un problème. Enfin, enfin, deux

2:24

problèmes en fait. Premier problème,

2:25

c'est que ça coûte cher en humain parce

2:27

qu'il faut rédiger des milliers

2:28

d'exemples. Et le second problème qui

2:29

est en réalité plus profond, c'est que

2:30

le modèle ne fait jamais mieux que ce

2:32

qu'on lui montre. Son plafond, c'est la

2:34

qualité de ce que les humains ont écrit

2:35

qui l'apprennent à imiter. Donc la

2:37

méthode en réalité marchait parce qu'on

2:38

avait réussi à augmenter drastiquement

2:40

la qualité des questions complexes pour

2:42

Lia. Mais c'était une méthode qui était

2:44

coûteuse et plafonnée et c'est

2:46

exactement ce problème que le papier de

2:47

la semaine vient attaquer et a en partie

2:49

réussi à résoudre. Alors en réalité ce

2:51

papier c'est plutôt l'extension d'un

2:52

autre papier scientifique qui a été

2:53

publié en janvier 2025 parsic. Dipsic il

2:56

publie un papier qui change la méthode.

2:58

Leur pari c'est de sauter l'étape dans

3:00

l'entraînement de cette capacité à

3:01

raisonner justement où on montre des

3:03

exemples au modèles. Passe directement

3:04

d'un modèle de base qui arrive à prédire

3:06

des tokens à un modèle de base qui est

3:08

entraîné par récompense sur le fait de

3:10

produire des tokens de réflexion. Leur

3:12

protocole il est assez simple. En une

3:13

phrase, c'est que on donne au modèles un

3:15

problème de math. À partir de ce

3:16

problème, il génère 116 tentatives de

3:18

réflexion, les étapes pour résoudre ce

3:19

problème. On regarde à la fin quelles

3:21

sont les tentatives qui ont réussi à

3:22

aboutir à la bonne réponse finale et

3:24

puis on réenforce les tokens qui ont

3:26

mené à cette bonne réponse pour cette

3:28

tentative. Ce qui est beaucoup mieux

3:29

dans cette manière de faire, c'est qu'on

3:30

a un apprentissage par essai erreur

3:31

plutôt qu'un apprentissage par imitation

3:34

d'une réflexion humaine. Le résultat,

3:35

c'est que le modèle a commencé à

3:36

réfléchir tout seul. étape 1, étape 2

3:39

sont apparus dans ces tokens de

3:40

raisonnement et donc une vérification

3:42

spontanée finalement euh deepsic R10,

3:46

c'est le papier fondateur qui est sorti

3:47

il y a 1 an euh sur une méthode

3:49

d'entraînement qui s'appelle le 0 RL.

3:51

Autrement dit 0 RL, RL pour

3:52

reinforcement learning qui est toujours

3:54

la technique qu'on utilise mais zéro

3:55

pour zéro exemple humains. Mais le

3:57

résultat de ce papier, il a toujours

3:58

posé une question, c'est en fait sur

3:59

quelle échelle est-ce que ça marche ?

4:01

Est-ce que ça tient si on multiplie la

4:03

taille du modèle par 10 par 100 ? par

4:04

que Dips il l'avait fait dans son papier

4:06

initial sur des tout petits modèles et

4:07

ça restait très instable euh dans le

4:09

résultat. Et le papier de cette semaine

4:11

justement c'est une énorme avancée dans

4:12

cette direction pour répondre à cette

4:14

question. Cette semaine Group a poussé

4:16

la méthode jusqu'à l'échelle de 1000

4:18

milliards de paramètres donc parmi les

4:19

plus gros modèles DIIA qui existent et

4:21

ils ont entraîné le raisonnement de ce

4:23

modèle de manière complètement

4:24

autosupervisée avec zéro input humain de

4:27

réflexion. En effet, ils avaient déjà

4:28

fait une tentative il y a quelques

4:29

semaines euh pour appuyer le papier de

4:31

dipsic, sauf qu'ils avaient testé sur un

4:32

modèle qui était plus petit, 10 fois

4:34

plus petit que 1000 milliards euh de

4:35

paramètres. Et à ce moment-là, ils

4:36

avaient dû ajouter des rewards fait à la

4:39

main pour forcer le modèle à structurer

4:40

et à vérifier ses couches de

4:42

raisonnement. En fait, ils arrivaient

4:43

pas à avoir un résultat satisfaisant sur

4:44

des modèles plus petits. Et là, ils ont

4:46

refait un essai mais cette fois-ci sur

4:47

un modèle de 1000 milliards de

4:49

paramètres. Et pour cet essai, ils ont

4:50

aussi retiré donc tous les rewards, donc

4:51

toutes les récompenses qu'ils avaient

4:52

ingénéré et toute l'ingénierie humaine

4:54

de la réflexion qu'on voudrait leur

4:56

faire imiter. La question c'était alors

4:57

bah qu'est-ce qui se passe quand on

4:58

retire ça ? Et la réponse du papier

5:00

avant de vous donner les benchmark et de

5:01

vous donner la qualité du modèle qui en

5:02

est sorti, c'est qu'il y a cinq

5:03

comportements qui sont apparus

5:04

spontanément. Il y a personne qui a

5:05

appris au modèle à réfléchir et comment

5:07

le faire et pourtant il y a des

5:08

structures des comportements qui ont

5:10

autoégé d'un apprentissage complètement

5:12

autonome. Le premier comportement c'est

5:14

la structure. Sans qu'on lui demande le

5:15

modèle, il organise toujours maintenant

5:16

son raisonnement en étape numéroté avec

5:19

des transitions et des liens logiques

5:20

clairs entre les étapes. Déjà, c'est

5:21

fascinant de voir que le modèle a

5:22

compris tout seul que c'était avec cette

5:24

méthode qu'il allait obtenir la

5:26

meilleure réflexion et donc arriver à la

5:27

meilleure réponse. Second comportement,

5:29

c'est la vérification. Le modèle

5:30

revérifie ses calculs, croise les

5:32

formules, substitue le résultat sans les

5:34

contraintes sans qu'on lui demande.

5:35

Troisème comportement, c'est le

5:36

raisonnement parallèle. En fait, le

5:38

modèle et branche des stratégies

5:39

alternatives et converge quand plusieurs

5:41

chemins indépendants s'accordent. En

5:42

fait, il fait un tree of thought tout

5:43

seul dans une seule séquence.

5:45

Finalement, il a appris tout seul qu'on

5:46

avait la meilleure qualité de réflexion

5:47

quand on essayait plusieurs approches

5:48

pour résoudre un problème et qu'on

5:50

voyait celle qui convergent ou qui

5:51

diverge. Le 4rième comportement, c'est

5:53

l'anthropomorphisme.

5:54

Le modèle, il s'est mis à simuler des

5:56

états émotionnels. Oh, j'ai un brain

5:57

thought. Oh, je me sens mal. Oh shit,

5:59

j'y arriverai pas. Oh, c'est bon, je

6:01

vais je vais je vais je vais passer à la

6:02

légère sur ce truc là. Oh Genius, j'ai

6:04

réussi. Nildit, incroyable. Bon, ce

6:06

comportement, je vous arrête tout de

6:07

suite, c'est absolument pas parce que Li

6:09

a une conscience d'elle-même et a

6:10

l'impression d'être humaine. C'est juste

6:11

que dans le modèle initial sur lequel on

6:13

a rajouté la couche de thinking, ce

6:15

modèle a été entraîné sur des milliers

6:17

de forums, des milliers de textes

6:18

humains dans lesquels il y a beaucoup

6:20

ces mots qui reviennent et donc il a

6:21

appris à les utiliser en guise de

6:23

réflexion. Mais c'est le 5ème

6:24

comportement qui pose la question la

6:26

plus gênante. En fait, les auteurs

6:27

l'appellent l'anxiété du contexte. En

6:29

gros, quand le modèle il approche de ce

6:30

qui perçoit comme sa limite de contexte,

6:32

il arrête son raisonnement et il devine.

6:34

Par exemple, si le modèle il sait qu'il

6:35

a 60000 mots pour exposer son

6:37

raisonnement avant ensuite de donner la

6:38

réponse, quand il voit qu'il s'approche

6:40

de la fin des 60000 mots, il dit "Ah,

6:41

c'est bon, je je je sais que c'est plus

6:43

simple pour moi de donner une réponse

6:45

plutôt que de vérifier touses les étapes

6:46

du calcul." Donc, je vais juste

6:48

supposer. Et concrètement, comment

6:49

est-ce que le modèle tout seul, sans

6:50

qu'un humain lui dise quoi faire, il a

6:51

pu développer ce mécanisme ? de de de

6:54

réflexion. Bon alors en réalité vous

6:55

inquiétez pas, c'est pas le modèle qui

6:56

devient humain encore une fois, c'est

6:58

simplement le fait que le modèle sait

6:59

qu'il approche de sa limite parce qu'il

7:01

y a deux signaux. D'abord grâce aux

7:02

zombing positionnel des token, il sait

7:04

donc le token, il est à quelle position

7:06

globalement dans la phrase. Donc s'il

7:08

sait qu'on est au token 600 sur une

7:09

fenêtre de 64000, alors il sait qu'il va

7:11

bientôt devoir s'arrêter. Donc lui-même

7:13

est conscient de sa position. Et ensuite

7:15

le deuxième signal c'est que il y a

7:16

quand même un système prompte dans

7:17

l'entraînement qui fait que le modèle en

7:19

fait il sait qu'il a un budget de x

7:20

token pour raisonner. Donc comme il sait

7:22

le token auquel il en est et qu'il a un

7:23

budget de temps, il a mis en place ce

7:25

mécanisme parce qu'il sait que ça va

7:27

mieux fonctionner pour euh le résultat

7:28

qui doit produire. Mais c'est fou quand

7:30

même que ce comportement apparaisse. Le

7:31

fait qu'il se disent "Oh, c'est bon, je

7:32

dois juste donner une réponse là, j'ai

7:34

pas le temps de le faire, donc je vais

7:35

je vais le faire à l'arrache."

7:35

Globalement, c'est un bug d'optimisation

7:37

parce qu'il sait que il aura beaucoup

7:38

plus de chance d'avoir une récompense

7:41

s'il donne une réponse même partielle.

7:42

Alors que s'il donne pas de réponse du

7:44

tout, il aura toutes les chances de se

7:45

faire pénaliser. Donc il sait que il

7:47

vaut mieux qu'il triche et qu'il donne

7:48

une réponse plutôt que pas de réponse.

7:49

Et comme ils ont optimisé pour ça dans

7:51

leur reinforcement learning, alors

7:53

forcément ce comportement est apparu

7:55

petit à petit et samplifié. Bon. Donc

7:57

concrètement, est-ce que ce modèle est

7:58

performant ou pas ? Qu'est-ce qu'ils ont

7:59

réussi à en tirer de cet autoapentissage

8:02

? Et ben, en réalité, le modèle est

8:03

sacrément surprenant. Alors, ils ont

8:05

surtout entraîné pour les mathématiques

8:06

et le raisonnement pour les maths. Donc,

8:08

tout ce qui est benchmark sur les gros

8:09

problèmes mathématiques de notre monde.

8:11

Euh, ils ont entraîné un modèle qui est

8:12

tout à fait capable, quasiment euh au

8:14

niveau des frontiers modèles et pour le

8:15

coup bien au-dessus des anciens modèles

8:17

par exle de Deepsy qu'ils avaient

8:18

entraîné avec la même méthode. On voit

8:19

ici sur les tests de math qu'il est par

8:20

exemple à 91 alors que le modèle de base

8:22

qu'ils avaient entraîné, il est à 65.

8:24

Donc, ils ont fait gagner énormément de

8:25

points grâce à cet entraînement et la

8:27

capacité de réfléchir du modèle. Et il

8:29

est très proche finalement des

8:30

frontières modèles qu'on peut voir juste

8:32

là. Donc ce papier, je le trouve super

8:33

intéressant parce que un il nous montre

8:35

que Lia arrive à autoapprendre des

8:36

capacités émergentes simplement par du

8:39

reinforcement learning sans que l'humain

8:41

et lui montrer des choses pour qu'elle

8:42

puisse calquer la manière de faire. Et

8:44

surtout deux, ça nous apprend une leçon

8:45

d'humilité mais qui en réalité avait

8:47

déjà été prédite il y a bien longtemps.

8:49

En réalité, ce qu'on voit sur ce papier,

8:50

c'est simplement une prophétie qu'avait

8:52

déjà fait Rich Sutan, l'un des pères du

8:54

Reinforcement Learning en 1989. Il avait

8:57

écrit qu'en matière d'intelligence

8:58

artificielle, les méthodes générales qui

9:00

utilisent massivement le compute, donc

9:02

le calcul, finissent toujours par battre

9:04

des heuristiques humaine. Et c'est ce

9:05

qu'il a appelé et qu'on nomme toujours

9:06

aujourd'hui la bitter leçon, la leçon

9:08

amère. En fait, on aimerait tous se

9:09

croire plus intelligent qu'il a et que

9:11

ça va mieux fonctionner si on lui

9:12

apprend à faire des choses, on lui force

9:13

du raisonnement, on structure, on

9:15

vérifie, on fait des branches et cetera.

9:16

Mais la réalité c'est que on lui a rien

9:18

transmis de tout ça. On lui a donné plus

9:19

de place pour réfléchir. Donc 1000

9:21

milliards de paramètres. Et là, Lia a pu

9:23

apprendre par elle-même et avoir

9:24

finalement des meilleurs résultats que

9:26

pour des mêmes modèles qu'on a entraîné

9:28

euh de la manière humaine. C'est quelque

9:29

chose qu'on revoit dans ce papier mais

9:30

qu'on a vu à main et mainreprise par

9:32

exemple. Vous avez peut-être suivi cette

9:33

actualité il y a quelques années quand

9:35

la machine, une intelligence

9:36

artificielle a battu l'humain au jeu de

9:38

go, un des jeux les plus complexes et

9:39

créatifs de l'humanité. En fait, Li a

9:41

réussi profondément à battre l'humain à

9:43

partir du moment où on a arrêtait de lui

9:45

apprendre comment jouer et où elle a

9:46

simplement pu apprendre euh par

9:48

elle-même en faisant des parties contre

9:49

elle-même. Après, ce qu'il faut quand

9:50

même comprendre, c'est que le

9:51

reinforcement learning, il ne crée pas

9:53

le raisonnement. Il révèle simplement ce

9:54

que le préraining a mis là. C'est-à-dire

9:56

que concrètement, on part d'un modèle de

9:58

base qui est déjà entraîné pour prédire

10:00

le mot suivant et puis ensuite on lui

10:01

apprend une capacité émergente qui est

10:03

lui rajouter de la réflexion pour qu'il

10:04

puisse réfléchir. Et le reinforcement

10:06

learning, on voit du coup que dans la

10:07

première phase d'entraînement, il

10:08

augmente vachement les capacités de lia

10:10

de ce que le modèle sait faire. Puis ça

10:12

fait un plateau, puis ça rend ça

10:13

reliable pour que il puisse raisonner

10:16

proprement et être plus charpe dans ses

10:17

réponses. Donc finalement le

10:18

raisonnement, il a pas été inventé par

10:20

le reinforcement learning, mais il est

10:21

révélé petit à petit. Moi, je trouve ça

10:23

absolument fascinant parce qu'il faut

10:24

toujours rappeler qu'à la base, l'Il,

10:25

c'est simplement des matrices de

10:27

milliards de nombres qui font des

10:28

opérations sur des vecteurs qui sont

10:30

censés représenter le sens de mot. Et

10:31

uniquement grâce à ça, des énormes

10:33

tableaux de nombres, on arrive à avoir

10:35

des comportements émergents qui

10:37

arrivent, de l'intelligence qui émerge,

10:38

des innovations qui sont possibles

10:39

d'être apportées. C'est quoi ce délire ?

10:41

Il faut toujours rappeler ce que c'est

10:43

pour voir la fascination qu'on peut

10:44

avoir derrière. Je vous mettrai le lien

10:45

complet de l'article en description si

10:47

vous voulez plonger dedans. Passons aux

10:48

actualités en bref.

10:54

Cette semaine, l'open source chinois a

10:56

rattrapé Claude Fable deux fois en 3

10:58

jours. En effet, jeudi, on a déjà Moon

11:00

Shotai qui sort Kimika 3 2,8 trillion de

11:02

paramètres open source. Globalement, ce

11:04

qu'il faut en retenir, c'est qu'il est

11:05

largement au niveau de chat GPT 5.6 sol

11:08

sur le raisonnement, le coding, long

11:10

horizon et cetera. Sur certains

11:11

benchmark, il va même Opus 4.8. Donc

11:13

Claude. Cependant, empiriquement, il est

11:15

un petit peu plus faible que Fable. Donc

11:17

Claude Fable, dernier modèle

11:18

d'entropique sur la qualité d'output

11:19

brut. Et pour vous dire qu'il y a

11:20

vraiment un cap qui est se passé, c'est

11:22

que la plupart des modèles open source

11:23

jusqu'à présent, ils étaient aux

11:24

alentours au maximum de 1,3 1,4 trillion

11:26

de paramètres. On a quasiment doublé

11:28

pour aller à 2,8 trillion de paramètres.

11:30

De la même manière, je pense que les

11:31

labs ferm et fond pour faire des modèles

11:32

plus intelligents et des rumeurs comme

11:34

quat GPT 5.6 serait à 4 trillions de

11:36

paramètres. Ça fait des énormes

11:37

ordinateurs pour faire tourner ça. Là,

11:39

c'est pareil, on a rajouté plus de

11:40

paramètres et encore une fois, on a des

11:41

modèles qui sont plus intelligents. Plus

11:43

on met de neurone et de capacité de

11:44

réflexion, mieux c'est et pour l'instant

11:46

on nous a pas encore prouvé le

11:46

contraire. Bref, ça c'était pour Kimi et

11:48

puis samedi, on a Alibaba qui annonce

11:50

Quen 3.8 Max preview, 2,4 trillion de

11:53

paramètres et également selon alors là

11:55

pour le coup, il y a pas encore de

11:56

benchmark tiers ouvert. C'est sorti

11:58

vraiment pendant la nuit, il y a 4 heur

12:00

au moment où je tourne cette vidéo et

12:02

ils disent en tout cas, ils affirment

12:03

que c'est second only to Fable 5,

12:05

c'està-dire que c'est le deuxième du

12:06

marché globalement. Bon, maintenant nous

12:08

en Occident, en France, est-ce que ça

12:09

nous intéresse ? Ma réponse est plutôt

12:10

non parce que Kimika 3 reste plus lent

12:12

parce qu'il tourne sur du hardware

12:13

qu'ils ont accessible en Chine, donc qui

12:15

est plus lent que le hardware Nvidia.

12:16

J'utilise chat GPT Open AI et autres.

12:18

Donc restez sur chat GPT 5.6 parce que

12:20

vous aurez simplement un résultat plus

12:22

lent à un prix équivalent parce que ce

12:23

qui se passe effectivement c'est que

12:24

même si le modèle est un peu moins cher

12:26

sur les tarifs annoncés que JGPT pas mal

12:28

moins cher, en réalité il a besoin de

12:29

plus de tokens pour effectuer ses

12:31

réponses et comme il est quand même un

12:32

petit peu moins bon, il doit travailler

12:33

avec plus de de réflexion et d'agents

12:35

parallèles et donc à la fin vous avez un

12:37

résultat qui est plus long à obtenir,

12:38

qui brûle plus de token et donc

12:40

finalement qui vous coûte le même prix

12:41

qu'un chat GPT. Donc en Occident

12:43

honnêtement utiliser pour l'instant que

12:45

CHG GPT, ça sert à rien de passer sur

12:47

Kimi. Par contre, il y a un truc qui est

12:48

vraiment intéressant, c'est que ils vont

12:49

publier dans une dizaine de jours les

12:51

poids donc de manière ouverte en open

12:53

source et donc il y a plein d'hébergeurs

12:54

de modèles en Europe ou aux États-Unis

12:56

qui vont pouvoir héberger ce modèle, le

12:58

faire tourner sur leur infrastructure et

12:59

donc pour avoir des modèles au niveau de

13:01

fable cependant avec une vie privée

13:02

parfaite. C'est super intéressant pour

13:04

vous dans les domaines médicaux, même

13:05

simplement si vous êtes une boîte et

13:06

vous avez des obligations RGPD. mot

13:09

qu'on a semblé oublier ces derniers

13:10

temps.

13:15

Cette semaine, une start-up américaine

13:17

du nom de Thinking Machines, fondé par

13:19

Mira Murati, l'ancienne CTO d'Open AI

13:21

qui enlevait donc 2 milliards d'euros

13:23

pour créer cette cette start-up ont

13:25

sorti leur premier modèle open source

13:26

qui s'appelle Inling. Inling, c'est 975

13:28

billions de paramètres 41 bilions actifs

13:31

en mystery of experts. Donc pourquoi

13:33

est-ce qu'on en parle aujourd'hui ? En

13:34

fait, c'est vrai qu'il faut quand même

13:35

avouer que d'un point de vue benchmark,

13:36

il est pas si impressionnant que ça. On

13:37

est un score d'intelligence de 41, là où

13:40

par exemple le meilleur modèle open

13:41

source, donc Kimika 3 est un 57. Le

13:43

second meilleur qui est moins cher en

13:45

plus GLM 5.2, il a 51. Donc on est quand

13:48

même bien en dessous des meilleurs

13:50

modèles du marché. On en parle parce

13:51

qu'en fait ça reflète beaucoup les

13:52

valeurs de cette boîte qui est que

13:54

aujourd'hui l'enjeu c'est plus forcément

13:55

d'avoir le meilleur modèle possible. Les

13:57

modèles d'aujourd'hui peuvent déjà faire

13:58

95 % des tâches de bureau. L'enjeu c'est

14:00

la personnalisation et la souveraineté.

14:01

Les boîtes, elles veulent pouvoir faire

14:02

tourner sur leur propre data center dans

14:04

leur euh bureau, leur modèle et elles

14:06

veulent pouvoir le personnaliser pour

14:07

que ce soit adapté à leur euh style. Et

14:09

donc, ils ont carrément créé une

14:10

plateforme qui s'appelle Tinker pour

14:11

permettre à toutes les boîtes de fine

14:13

tuner, donc de modifier le modèle pour

14:14

qu'il leur ressemble plus et que ce soit

14:16

adapté à leurs usages. Et ils ont

14:17

également une manière qui vous permet de

14:19

demander à Lia tiens, j'aimerais que tu

14:21

t'auto améliores, que tu te fasses une

14:22

tune pour que tu puisses être plus

14:23

adapté à tel usage et LIA va pouvoir le

14:25

faire elle-même. Honnêtement, moi je

14:26

crois énormément à la vision de Thinking

14:28

Machines là-dessus. Je pense qu'il capte

14:30

tout à fait le pou des entreprises sur

14:32

le marché et c'est exactement là où

14:34

Anthopic ou Open AI ne veulent pas aller

14:35

parce qu'ils veulent garder justement la

14:37

centralisation de la data et puis de

14:38

leur modèle. Thinking machine s'adresse

14:40

vraiment au B2B, aux grosses boîtes qui

14:41

veulent de la souveraineté et je pense

14:42

qu'ils ont tout à fait raison. Si je

14:44

pouvais investir là-dedans, honnêtement,

14:45

je le ferais. Bravo à eux et bravo aux

14:47

États-Unis d'enfin commencer à mettre

14:49

des modèles open source. Il serait

14:50

temps.

14:55

Cette semaine, on a appris qu'Apple est

14:57

en discussion pour acheter une start-up

14:58

qui fait tourner un modèle IA de 27

15:01

milliards de paramètres sur un iPhone.

15:02

Ces start-up, elles s'appellent Prism et

15:04

euh leur mission principale, c'est de

15:06

concentrer l'intelligence, de créer des

15:07

larges modèles qui peuvent rentrer sur

15:10

les smartphones. Arrêtons d'envoyer une

15:12

demande de reformulation d'email à un

15:13

data center aux États-Unis. gardons la

15:15

donnée sur l'appareil sur les iPhones

15:17

qui sont largement capables de faire

15:18

tourner des petits modèles. C'est leur

15:19

conviction. Le résultat de tout leur

15:21

travail, c'est un modèle qui s'appelle

15:22

Bonzai. Leur flagship, le meilleur

15:24

modèle fait 27 millions de paramètres.

15:25

Il est assez remarquablement performant

15:27

par rapport à sa densité et son faible

15:29

nombre de paramètres. Et ils ont une

15:30

version tercière qui fait donc 6 Go et

15:32

donc ils ont une version 1 bit qui fait

15:34

4 Go ce qui tient largement sur un

15:35

iPhone 17 Pro. Et ce qui est assez

15:37

dingue c'est qu'ils arrivent à maintenir

15:39

à peu près 95 % de la qualité de Coin

15:41

3.6 qu'ils ont utilisé pour densifier ce

15:44

modèle. C'est donc hyper intéressant

15:45

pour Apple parce qu'on dit souvent

15:46

"Ouais, Apple ils ont raté le virage de

15:48

l'intelligence artificielle". Je crois

15:49

pas du tout. C'est une technologie qui

15:50

est pas mature donc ils veulent pas

15:51

l'implémenter trop tôt dans leur

15:53

produit. Par contre, eux, ils sont

15:54

convaincus que il va falloir garder les

15:56

données et la privacy directement sur le

15:57

téléphone pour la plupart des demandes

15:59

qui sont simplement faire de la web

16:00

search et reformuler des choses. Et

16:01

donc, ils cherchent à tout prix à

16:02

pouvoir faire tourner parce qu'ils ont

16:03

un avantage compétitif sur le marché

16:05

énorme avec leur puces, des modèles qui

16:06

peuvent tenir sur un iPhone directement

16:08

sur l'iPhone. Donc s'il s'avère que

16:10

leurs tests sont concluants et qu'ils

16:11

aiment l'équipe, à mon avis, ce sera un

16:12

rachat officialisé prochainement. Prisme

16:14

ML racheté par Apple et ce sera une

16:16

nouvelle phase dans la stratégie

16:17

d'implémentation d'Apple. En tout cas,

16:19

moi ce serait vraiment le pari que

16:20

j'aimerais qu'Apple prenne aller vers

16:22

Lia. on device. Hop, je vous interromps

16:24

juste une seconde pour vous dire que si

16:25

vous voulez apprendre à créer un système

16:27

IA personnel complet, second cerveau

16:29

numérique qui centralise tout ce que

16:30

vous avez jamais lu, vu, entendu et un

16:32

système I construit autour de ce

16:33

dernier. Alors, vous pouvez regarder ma

16:35

masterclass gratuite d' 1h30 dans

16:36

laquelle je vous montre l'ensemble du

16:37

système que j'utilise au quotidien pour

16:39

moi-même et pour mes différentes

16:40

entreprises. Le lien est directement

16:41

disponible en description, mais sortons

16:42

un tout petit peu la tête des LLM, des

16:44

choses qui prédisent du texte pour aller

16:45

dans d'autres modalités, en particulier

16:47

la vidéo avec trois actu. La première,

16:50

c'est Live Avatar. C'est un modèle open

16:52

source qui vous permet de streamer en

16:53

temps réel un avatar avec une super

16:55

qualité de production. Je vous laisserai

16:57

en juger par vous-même avec les exemples

16:58

que vous pourrez voir sur cette page.

17:00

Vous lui donnez un flux d'audio en en

17:02

entrant et une image de référence et

17:03

ensuite le modèle génère automatiquement

17:06

toutes les mimiques du visage disons. Et

17:08

maintenant le l'avatar peut d'ailleurs

17:10

interagir avec son environnement. Donc

17:12

si vous avez un ordinateur assez

17:13

puissant, vous pouvez faire tourner un

17:14

modèle super sympa en local qui vous

17:16

permet de faire de l'avataria en live

17:18

stream. Deuxième modèle qui est

17:19

intéressant, il s'appelle One Dancer.

17:21

C'est un modèle créé open source aussi

17:23

par des Chinois par le Alibaba Group.

17:24

Globalement, il permet de faire des

17:25

vidéos de danse à partir d'une musique.

17:28

Le gros gap qui a à avoir sur ce modèle,

17:29

c'est que un il est open source et que

17:31

de cette fois-ci on tient jusqu'à 3

17:32

minutes de vidéo de danse cohérente du

17:34

début à la fin avec une chorégraphie

17:35

correcte alors que d'habitude c'est

17:36

plutôt quatre ou cinq qu'on arrive à

17:38

mettre d'affilé. Là ça tient sur au

17:40

moins 3 minutes. C'est 85 Go en local,

17:41

donc pas tant que ça. Vous pourrez

17:42

retrouver et télécharger les poids si ça

17:44

vous intéresse directement sur leur

17:45

guitub. Et enfin trisème news, c'est que

17:46

Google Deepmind a prouvé qu'un

17:48

générateur de vidéos peut remplacer tous

17:49

les modèles de computer vision en un

17:51

seul. Globalement, ils disent que à

17:53

l'époque, ils essayaiit d'entraîner un

17:54

modèle par tage de vision, un modèle

17:56

pour avoir la vision sur la profondeur,

17:57

sur le tracking, sur la segmentation,

17:58

sur la pause de la caméra et cetera.

18:00

Sauf que là Jeption en fait, tu prends

18:02

un modèle de génération de vidéos qui a

18:03

été préentné et puis tu le transformes

18:05

en modèle de euh vision généraliste. Et

18:08

le truc, ça bat tous les modèles

18:09

spécialisés sur ces tâches, donc en un

18:11

seul modèle, tu as tous les autres

18:12

modèles. Parce que l'idée profonde,

18:13

c'est qu'en fait les générateurs de

18:14

vidéos, ils ont déjà un sorte de world

18:16

model, comme dirait Yen Lequin, euh que

18:17

la computer vision cherchait depuis des

18:19

années. Et donc finalement, ils vont

18:20

bientôt publier le code qui vient après

18:22

ce P scientifique. Et c'est super

18:24

intéressant parce que ça permet de faire

18:26

des bons énormes dans la computer vision

18:28

dans le fait que Unia puisse comprendre

18:29

ce qui se passe dans une vidéo. Comme

18:31

vous voyez à partir d'une vidéo, on peut

18:32

identifier beaucoup de couches

18:33

différentes. La depth, la dense pause,

18:35

les key points du mouvement, le tracking

18:37

de la caméra. Et c'est super intéressant

18:38

parce que du coup, ils ont aussi réussi

18:40

par exemple à partir d'une vidéo à

18:42

reconstituer un univers 3D et à partir

18:44

de cet univers de poser des questions.

18:45

Par exemple, partir de la vidéo du coup

18:47

de ce bureau, génère-moi ici ce bureau

18:48

en 3D et ensuite je veux trouver un

18:50

endroit confortable où m'asseoir. Ah, le

18:52

sofa serait un bon endroit. Donc super

18:53

intéressant et c'est vraiment une

18:54

innovation breakthrough. Donc à partir

18:56

de cette innovation vont apparaître

18:58

d'autres modèles qui sont basés sur les

19:00

mêmes logiques. Merci beaucoup d'avoir

19:02

regardé cette vidéo. Je vous souhaite

19:03

une excellente journée et à la semaine

19:04

prochaine. Pour les actualités de la

19:06

semaine, n'oubliez pas de vous abonner

19:07

pour ne pas manquer la prochaine

19:08

édition. Yeah.

Interactive Summary

Cette vidéo explore une avancée scientifique majeure concernant les modèles d'intelligence artificielle : la capacité d'auto-apprentissage du raisonnement. Des chercheurs chinois ont démontré qu'en augmentant l'échelle des paramètres et en utilisant l'apprentissage par renforcement sans intervention humaine, une IA peut développer spontanément des structures de réflexion logiques. La vidéo aborde également l'actualité de la semaine, incluant les nouveaux modèles concurrents de Claude, l'émergence d'acteurs comme Thinking Machines, les rumeurs de rachat de Prism par Apple pour l'IA locale, ainsi que des innovations dans la génération vidéo et la vision par ordinateur.

Suggested questions

3 ready-made prompts