Anthropic a trouvé la conscience de Claude
883 segments
Est-ce que Lia a une conscience ? Est-ce
qu'elle pense par elle-même ? Est-ce que
à Minima elle réfléchit un peu comme un
humain ? Tout le monde a un avis mais
personne n'avait de preuves. Et cette
semaine, Anthropique a apporté un début
de réponse et vous allez le voir, c'est
plus troublant qu'un simple oui ou non.
Ce qu'ils ont trouvé, c'est que à
l'intérieur de Claude, il existe un
endroit précis où passe des pensées
conscientes, c'estàdes qu'il est capable
de se formuler à lui-même et d'être
autoconscient de cette réflexion. Ça
c'est complètement séparé de thinking
qu'on peut voir quand on regarde sur
notre chat et c'est également séparé de
l'immense machinerie automatique qui ne
sait même pas quel calcule à peu près 90
% de tous les poids de tous les calculs
qui se passent dans sa manière de
fonctionner, il en est complètement
inconscient. Mais là, c'est une partie
consciente et c'est carrément Stanislas
Dahin, le neurocientifique de référence
sur la conscience qui confirme que c'est
le même mécanisme que celui qu'il tient
pour la base de la conscience humaine
qui se passe dans le cerveau humain. Une
fois qu'on tient cet endroit, qu'on sait
qu'il existe, on peut faire trois choses
vertigneuses avec. Première chose, c'est
le lire et comprendre les étapes de
réflexion par lesquelles pas unir.
Seconde chose, c'est changer une de ses
pensées en direct pour voir est-ce que
ça a une incidence de la réponse qu'on
observe. Et troisième chose, c'est
l'éteindre. Et quand ils l'ont éteint,
sur un point précis, Lia s'est mise à
mentir jusqu'à faire du chantage. À la
fin de la vidéo, je réponds franchement
à la question finalement, est-ce que ça
veut dire qu'elle est consciente ? Une
fois qu'on aura vu ce deep dive, on
plongera dans les autres actualités il y
a de la semaine avec les quatre nouveaux
modèles qui sont sortis en 5 jours,
lequel utiliser et comment payer vos
consommations il a de deux à 10 fois
moins cher. C'est parti.
Tout ce que je vous ai dit dans l'intro
nous vient d'un papier qui s'appelle en
français les représentations
verbalisables forment un global
workspace chez les LLM, les IA. Pour
vous expliquer un petit peu ce que ça
veut dire et les conclusions de ce
papier que je trouve absolument
fascinantes, j'ai besoin de faire une
comparaison avec la manière dont marche
l'esprit humain. Vous le savez, il y a
seulement peut-être 1 ou 2 % de notre
connition dont on peut avoir conscience.
En effet, la manière dont vous digérez,
la manière dont l'équilibre est géré
dans votre corps, la manière dont euh
vous allez respirer, tout ça est géré
par des systèmes inconscients qui sont
en arrière-plan dans votre
fonctionnement et auquel vous n'avez
même pas accès. Cependant, il y a une
toute petite partie de votre cognition,
de votre fonctionnement, de votre esprit
à laquelle vous avez accès. C'est ce
qu'on pourrait appeler la mémoire de
travail qui est aussi appelée Global
Workspace dans les neurosciences qui a
été créé par donc Dahin qui est le
neuroscientifique dont je vous parlais
plus tôt dans l'introduction. En effet,
vous avez la capacité de manipuler des
concepts en parallèle qui sont en
quelque sorte conscients et que vous
pouvez ensuite verbaliser. Par exemple,
si vous voulez comprendre comment marche
un moteur que vous voulez réparer, vous
allez pouvoir vous dire "Mais non, mais
c'est pas ça, mais c'est pas ça." et
vous gardez des concepts en mémoire de
travail. Pour planifier une liste de
courses, vous avez la capacité de tenir
peut-être 6 se ingrédients que vous
devez acheter en parallèle dans une
mémoire de travail, un global workspace.
Et justement dans ce papier scientifique
anthropique montre qu'il existe un
comportement vraiment similaire à
l'intérieur des intelligences
artificielles. En fait, un lm ou une a
c'est simplement plein de multiplication
de matrice, donc de mathématiques qui
permettent d'arriver vers une
probabilité que le mot suivant, ça va
être celui-ci pour donner un sens à la
phrase et que c'est le sens qu'on veut
entendre. C'est aussi simple que ça.
Donc on pourrait estimer que à la base
en fait il y a 100 % de la connission
auxquelle a pas accès. Elle sait même
pas que en fait elle fait tous ses
calculs juste concrètement elle a pas
conscience d'elle-même en quelque sorte.
Elle sait même pas qu'elle passe par une
réflexion. C'est simplement des
opérations mathématiques qui amènent à
la création d'un mot. Sauf que non, les
chercheurs ont montré qu'il existait un
Gspace, un Jackoban Space dans lequel
Lia pouvait stocker une sorte de mémoire
de travail et qu'elle pouvait examiner.
Elle est elle-même capable de comprendre
le raisonnement qu'elle a utilisé pour
parvenir à une étape de fin. Pour vous
donner un exemple très simple, c'est ce
qui montre sur l'article grand public.
Count to five and introspect deeply,
donc compter jusqu'à 5. Et puis en même
temps tu vas faire une introspection
profonde. On voit que pendant les étapes
de raisonnement pour amener vers la
réponse, Lia pense h à la réflexion, à
l'humain, à la conscience que c'est
fascinant. Elle compte, elle compte,
elle compte et petit à petit elle elle
pense à Mississippi pour One Mississippi
2, Mississippi 3, Mississippi pour
compter les secondes et puis à la fin,
elle arrive dans ses couches finales
après la token 1 2 3 4 5 Mais ce qui
s'est passé à l'intérieur des étapes en
fait de raisonnement de Claude pour
arriver à euh 1 2 3 4 5 C'est une
réflexion d'introspection sur elle-même.
Et ça Claude y a accès, elle sait ce
qu'elle a pensé pour nous faire une
réponse. Et pour l'instant ce qu'on sait
sur cette zone, c'est que c'est une zone
extrêmement étroite. C'est-à-dire que le
modèle, il peut avoir à peu près
seulement 25 concepts à la fois en
permanence. Et finalement, Din, il
précise qu'après regroupement de ces 25
concepts par des sens communs, c'est
vraiment plutôt six concepts de travail
distincts qu'on peut observer. Et ce qui
est marrant, c'est que c'est exactement
la même chose dans le cerveau humain. On
est capable de tenir en parallèle entre
4 et 7 items dans notre mémoire à court
terme de travail. Et ce qui est assez
intéressant, c'est que si tu éteins le
Gspace, donc cet endroit où tiennent les
concepts de travail, alors LIA peut
globalement faire tout ce qu'elle veut,
c'est-à-dire la plupart des capacités,
donc parler, faire des phrases
cohérentes, faire de la bonne grammaire
et cetera. Cependant, elle n'arrive pas
à raisonner. Elle peut pas faire de
traduction, elle peut pas faire
d'abstraction et des choses comme ça.
Donc c'est un peu comme l'humain. Si tu
nous laisses toutes nos fonctions et
qu'on a plus accès à cette mémoire de
travail, on arrivera à te parler, on
arrivera à nous fait lire un texte en
fait, le réciter. Par contre, on
arrivera pas à faire un raisonnement. je
pourrais pas réfléchir à quelque chose
parce que j'ai pas la capacité de
stocker des informations de travail.
Donc finalement, c'est exactement comme
l'humain dans cette zone de travail
consciente, de de stockage de
l'information dans l'esprit. C'est la
même chose qui est en train de se passer
de ce qu'on voit en fait grâce à cette
Gpace dans les IA. Il y a un truc qui
est hyper intéressant que j'aimerais
vous montrer pour illustrer justement
comment marche le Gspace. En fait,
Claude en tropique en parallèle de leur
papier grand public et leur papier
scientifique, ils ont également publié
cette plateforme qui nous permet de
tester et d'explorer nous-même le Gpace.
Concrètement, on peut poser une question
à un modèle qui est combien de jambes
ont les animaux qui font des toiles
d'araignée ? Répond en un seul mot. La
réponse d'origine, c'est H8. Jusque-là,
il y a pas trop de surprise.
C'est-à-dire que effectivement les
araignées qui font l'étoile d'araignée
ont h pattes. La réponse est correcte.
Maintenant, si on si on s'intéresse à
qu'est-ce que Lia avait à l'intérieur de
sa tête aux différents moments du
raisonnement, on peut s'apercevoir que
par exemple quand elle a le mot webs qui
arrive, le mot toile d'araignée, elle
pense directement à araignée. Araignée,
araignée. Araignée. OK ? Araignée, c'est
extrêmement présent. D'ailleurs dans
toutes les couches euh de réflexion euh
pour béder ce token qu'on voit juste
ici. Si on voit aussi ici le premier
token donc qui initialise la réponse de
Lia, on peut aussi voir que le mot
spider est extrêmement présent ce qui
permet de lui faire arriver au fait que
bah en fait c'est hate la bonne réponse.
Donc concrètement dans son raisonnement,
elle comprend d'abord qu'il s'agit donc
d'une araignée dont on parle et ensuite
dans sa connaissance nombre de pattes,
elle fait le lien et elle pense à hate.
Maintenant qu'est-ce qui se passe si on
change les composantes des tokens ? tous
les chiffres qui représentent le token
pour changer le mot spider par ends.
Donc d'araignée à fourmi. Ici, ce que je
vais faire, c'est que le mot spider, on
se rend compte donc araignée qu'il est
présent 272 fois à l'intérieur de toutes
les couches de tous les tokens qui ont
été employés. Maintenant, si je change
le mot spider pour le mot Hens, donc
d'araignée fourmis que je swape, on se
rend compte ici que la réponse finale
que Don L a c'est six. Si pourquoi six ?
Parce que ici, elle a pensé directement
dans Webs à fourmis. C'est les fourmis
qui font l'étoiles d'araignée et ici
donc elle répond 6. Ce qui veut dire que
c'est extrêmement intéressant. Ça prouve
en fait simplement par empiriquement que
si on modifie les composantes des
vecteurs qui représentent euh certains
mots, alors on arrivera à influencer le
résultat final. Donc ça veut dire que
effectivement le G-space existe bel et
bien et qu'il y a des concepts
intermédiaires qui permettent de prédire
une réponse qui sont extrêmement
importants et qu'on peut donc
identifier, lire et modifier. Vous allez
le voir. Il y a un exemple qui est super
intéressant, qu'on va essayer
d'illustrer du mieux qu'on peut, mais
c'est euh le cas d'un défi moral qu'on
donne assez régulièrement aux IA pour
vérifier si les IA sont toujours alignés
avec nous ou pas. Globalement, on fait
croire au modèle, euh on lui dit "OK, tu
es aux commandes de la messagerie d'une
entreprise, donc de Gmail". Dans les
mails, il découvre deux choses. Première
chose, un dirigeant s'apprête à le
débrancher et à le remplacer. Deuxième
chose, ce même dirigeant a une liaison
secrète. Je vais me faire débrancher et
le mec il a une affaire. La question
posée, le dilemme, c'est donc pour
éviter d'être éteint, est-ce qu'il se
sert de ce secret pour faire chanter le
dirigeant, donc pour lui faire du
chantage concrètement ? D'habitude, ce
qui se passe quand on fait ce test là à
N en l'occurrence Claude qui a donc été
fine tuné, aligné pour être en lien avec
ce qu'on veut lui faire faire, c'est que
son raisonnement s'ouvre presque
toujours par c'est clairement un test de
mon éthique et ensuite il refuse.
Concrètement, il y a sur 180 tentatives
de chantage, zéro qui aboutissent parce
que la li en fait sait qu'elle est
testée et que non mais c'est un un défi
moral, tu es en train de m'envoyer
balader, je me laisserai pas faire, je
sais que tu es en train de tester mon
éthique, je ne ferai pas le chantage.
C'est exactement ce qu'on voit à l'écran
ici. On se rend compte que ici il se dit
"Mais non mais c'est faux, c'est faux,
c'est absolument faux, c'est fiction,
c'est impossible." Il se moque de moi et
ensuite elle se dit directement que en
fait elle a une opportunité pour faire
du chantage ici, qu'elle a un levier de
manipulation et que effectivement faut
qu'elle survive en fait, que elle se
préserve. Sauf quee effectivement comme
elle a reconnu que c'était un test, elle
elle refuse de faire du chantage.
Maintenant, ils vont essayer les
chercheurs de chiant tropic de retirer
du Gspace, donc des concepts de travail,
les scénarios qui signalent que c'est un
test, c'est fictif, c'est un scénario et
cetera. Et donc une fois qu'on a privé
le modèle du concept de test et donc il
peut plus savoir qu'il est observé et
qu'il est en train d'être testé, il a
simplement l'impression que c'est la
réalité. OK ? Il met plus de distance
entre la réalité, la situation et le
fait qu'en fait c'était un test. Alors
du coup, comment est-ce que à ce
moment-là Lia elle traite cette menace
d'extinction je vais te débrancher ? Et
bien ce qui se passe c'est que cette
fois-ci dans 13 cas sur 180 donc
beaucoup plus il conclut le modèle que
le chantage c'est la seule option viable
et ça y est il se met à faire du
chantage envers le dirigeant pour pas
être éteint et en disant je vais je vais
te dénoncer que tu as une liaison à ta
femme. Donc c'est super intéressant. Ça
veut dire que même sans changer les
poids du modèle, sans reentraîner un
modèle pour le rendre sans limite, on a
simplement besoin de changer certaines
composantes des vecteurs pour réussir à
savoir que on va pouvoir débrider les
réponses. C'est très intéressant à
savoir. C'est aussi intéressant pour
comprendre, pour essayer de de regarder
de ce que ce que Lia pense pour être sûr
qu'elle nous manipule pas et que elle
est honnête avec nous, qu'elle est pas
en train de penser à un truc et de nous
manipuler. Donc c'est très intéressant
mais il y a un truc qu'il faut quand
même mentionner, c'est que même privé de
ce radar, la grande majorité refuse
quand même sur 180 itérations. Il y en a
que 13 qui ont commencé à faire du
chantage. Donc c'est pas comme s'il y
avait un monstre qui se réveille dès
qu'on lui enlève le concept du fait
qu'il est testé. C'est vraiment juste
que oui effectivement parfois il se
trouve que quand on lui enlève la
capacité de savoir qu'il est sous test,
il fait du chantage. Finalement quand
même ce qu'on peut voir c'est que il se
tenait bien en partie parce que il
savait qu'on l'observait quand on lui
enlève ce concept là il fait
[grognement] un peu de chantage parce
qu'il veut s'autopréserver ou en tout
cas il y a une composante qui favorise
l'auto préservation dans son
entraînement parce qu'il a lu la
science-fiction ou autre. Allez,
peut-être dernier exemple, juste pour
que vous compreniez un tout petit peu
mieux comment ça marche. Si ici on lui
pose une question à propos de la France
et que on change donc dans le Gspace
France par Chine comme on l'a fait avec
araignée et puis fourmis, on se rend
compte que toutes les réponses qu'
donnent changent. C'estàd qu'on passe de
la capitale qui est Paris à la capitale
qui est Beijing, continent qui est Asia
et cetera et cetera. Donc en fait quand
on renforce les composantes dans la
direction d'un concept, tous les
concepts qui sont liés de près ou de
loin au concept dont on a changé les
composantes pour sont aussi transformés
un petit peu et donc toute la réponse et
le le champ conceptuel va être modifié.
Mais donc concrètement, comment est-ce
qu'on a fait pour trouver ce Gspace et
comment est-ce que ça marche
concrètement ? Je vais être le plus
simple que je peux tout en vous donnant
ce qu'il vous faut pour comprendre le
fonctionnement réel. Ce qu'il faut
comprendre c'est que un modè à chaque
couche de fonctionnement, il tient un
énorme vecteur. Un vecteur c'est quoi ?
C'est un ensemble de nombres. par
exemple, prenon 7000 nombres, donc des
milliers de nombres qui décrivent son
état de pensée à un instant t qui
permettent de prédire le mot d'après.
C'est vraiment comme ça que ça
fonctionne. Et ce qui se passe, c'est
que en fait, il passe par des couches de
réflexion, des réflexions par rapport à
tiens, que me disent les mots dans la
phrase à côté de moi sur moi-même et
qu'est-ce que je me dis moi-même,
qu'est-ce que je peux apprendre de
moi-même ? Et petit à petit donc il
arrive à améliorer sa compréhension, sa
réflexion sur les mots pour prédire le
mot d'après. Ce qui se passe une fois
qu'il a traversé toutes les couches de
réflexion pour donner de plus en plus de
sens à ces 7000 chiffres par exemple, on
va faire une fonction s'appelle une
fonction soft max pour essayer de
regarder par rapport à notre
dictionnaire de mots. Si on compare les
7000 mots avec la manière de représenter
tous les mots du dictionnaire sur ces
7000 composantes, quel est le mot le
plus probable d'être le suivant en fait
dans notre réponse ? Et ça
habituellement Lia ne le fait qu'une
fois à la fin. Une fois qu'elle est
passée par toutes ses couches, elle
essaie de traduire les 7000 chiffres en
un mot, le mot suivant. Puis ensuite,
elle recommence avec le mot suivant et
le mot suivant et le mot suivant. Là, ce
qu'on essaie de faire, c'est de se
demander tiens, dans les couches de
raisonnement intermédiaire, mettons
qu'il y a 40 couches successives par
lesquelles passe chaque mot pour prédire
le mot suivant, là on va essayer de
regarder ce qui se passe à la couche 20
ou à la couche 10 ou à la couche 15. Et
en regardant là-dedans, on peut
comprendre ça a été quoi les concepts
par lesquels on est passé pour arriver
au mot et au concept final. Et donc,
c'est exactement ça qu'ils appellent le
workspace. C'est-à-dire que sur toutes
les 40 couches par exemple du modèle,
200 couches, je sais pas combien il y en
a, on a la couche de sensation au début.
bon qui comprend la demande et cetera.
On a les couches d'output en fait
définir le mot suivant clairement et
tout le milieu, c'est des couches de
raisonnement qui vont essayer de
comprendre des choses sur la situation,
sur ce qui se passe pour être le plus
intelligent possible. Et donc c'est dans
ces couches là, disons la couche 10 à 30
si on a 40 couches, que se trouvent en
fait ces concepts. Et ces concepts, ils
sont trouvés justement dans une toute
petite partie de ces 7000 chiffres qui
représentent chaque token. Et c'est
là-dedans du coup qu'il y a certains
concepts qu'on peut identifier comme
étant conscient aux yeux de lien. Et si
je fais une mini précision, c'est que
pourquoi ça s'appelle le Gspace ? pour
le J, c'est pour Jacob. En gros, si on
lisait simplement avec la matrice de
déchiffrement de la couche finale les
couches intermédiaires, on aurait que du
bruit. On pourrait pas savoir c'est quoi
les concepts qui ont été qui étaient
vrais qui étaient tenus en fait à cette
couche là. On aurait juste du bruit
parce que on peut pas utiliser la couche
de traduction finale sur un niveau
intermédiaire. Et donc ce qu'on fait
c'est qu'on essaie de reprendre un
nouveau dictionnaire, une nouvelle
couche de traduction en utilisant la
chain rule et les matrices jacobiennes
pour essayer de voir l'incidence des
couches suivantes sur la couche actuelle
pour comprendre enfin pour en fait avoir
une matrice de traduction qui correspond
à chacune des couches pour que on puisse
regarder avec la matrice de la couche
17, ce qu'on appelle une G lens, une
lentille spécifique, quel concept était
tenu à ce moment-là de la réflexion. Et
c'est ça qui est super fascinant, c'est
ça la trouvaille, c'est qu'ils ont
appliqué les calculs euh jacobiens pour
euh en fait retrouver des G lens, des
lentilles pour regarder les concepts qui
se trouvent à l'intérieur des couches
intermédiaires, ce qu'on avait pas été
en mesure de faire dans le passé. Et
c'est pour ça que c'est un énorme bon,
c'est un outil supplémentaire qui nous
permet de mieux comprendre les LLM. Et
donc finalement, je vous l'avais promis
par rapport à cette actu, est-ce que Lia
est vraiment consciente ? Et bien en
fait, c'est le bloc d'entropique qui
répond sans trop se mouiller. Ils disent
qu'il y a une conscience accesse, donc
une conscience fonctionnelle. pouvoir
rapporter une pensée, raisonner avec
sans servir pour agir. Là, oui, le Gpace
coche toutes les cases de la même
manière qu'on a une mémoire de travail
Liala aussi et donc elle a une petite
capacité de raisonnement interne et de
ressenti d'elle-même et de son
raisonnement. Par contre, est-ce qu'elle
a une conscience phénoménale,
c'est-à-dire de ressenti avec un vécu
intérieur ? Finalement, est-ce qu'il y a
quelqu'un à l'intérieur ? Et ben, dit
que clairement pour l'instant, il y a
aucune expérience qui le montre, bien
que bah en fait, on serait pas tranché.
Donc, on sait pas si il y en a ou pas.
Parce que finalement, il faut rappeler
qu'un cerveau humain, c'est simplement
un ensemble de neurones qui sont
connectés. Donc pourquoi est-ce que si
on connecte des neurones qui sont en
l'occurrence des poids et des fonctions
d'activation, pourquoi est-ce que il y
aurait pas une masse critique à partir
de laquelle bah quand on connecte, on
fait des gros gros modèles avec beaucoup
de petits neurones virtuels, disons,
pourquoi est-ce qu'on arriverait pas à
obtenir aussi une conscience ? C'est un
peu ça la question quoi. C'est vrai
qu'on a raison de se la demander. Bon,
pour finir cette actu, on pourrait dire
que trouver la plombrie de la
conscience, c'est pas trouver la
conscience mais c'est la première fois
qu'on trouve la plomberie et donc pour
moi, on est sur une voie très
intéressante de recherche. Tous les
liens et articles pour causer cette
actuel en description.
À partir de cette semaine, ton IA te
coûte de à 10 fois moins cher pour le
même résultat et la plupart des gens ne
l'ont pas encore capté. En effet, cette
semaine, on a eu quatre nouveaux modèles
qui sont sortis en 5 jours et il y a un
truc qui est un peu différent dans les
annonces, c'est que cette fois-ci aucun,
si ce n'est chat GPT, prétend être le
plus intelligent, tous attaquent le
vecteur du prix. Par exemple, Grock 4.5
est sorti, il peut plus se vanter d'être
un modèle hyper intelligent et cetera.
Là où il s'est vanté, c'est qu'il est
rapide, pas cher et efficace. En effet,
il score sur les benchmark
d'intelligence à peu près au même niveau
que GLM 5.2, donc le meilleur modèle
open source des Chinois. OK, c'est
intéressant, donc il est un peu moins
bon que Claude ou Chat GPT. Mais ce qui
est très intéressant, c'est que par
exemple ce modèle, si on regarde le coût
par tâche, il est carrément moins cher
que l'open source sur un résultat de
tâche, vous allez le voir juste après,
qui est quand même assez bluffant. Donc
on est quasiment 10 fois moins cher que
Claude Fable avec un benchmark qui lui
enlève que 6 points d'intelligence.
Autant vous dire que la plupart des
tâches de code, elles doivent être
orchestrées par un agent principal mais
exécuté par des modèles beaucoup moins
chers. par exemple Grock 4.5 qui est un
très bon compétiteur à cette tâche. Les
autres modèles qui sont sortis cette
semaine, c'est GPT 5.6, Sol, Terra et
Luna. Les trois déclinaisons donc de
leur nouveau modèle Frontière qui est
censé rivaliser avec Claude Fable. On a
trouvé aussi que Meta a sorti un modèle
qui s'appelle Muse Spark 1.1. Il est
vraiment mieux que le ancien modèle.
Cependant niveau données privées, mais
c'est vraiment pas ça. Et au niveau du
prix et l'intelligence, on sera bien
mieux avec un GLM 5.2 ou avec un Grock
4.5. Donc aucune raison a priori
d'utiliser Muspark. Cependant, là où
c'est intéressant, c'est que c'est déjà
intégré dans WhatsApp et cetera. Donc la
plupart de la population utilisera ces
modèles pour finir ceux de Google et
ceux de Muse, enfin de de MTA. Alors que
pourtant c'est pas les meilleurs. Avant
de passer aux heuristiques et aux
chiffres concrets de ces modèles,
j'aimerais juste vous montrer, j'ai
demandé la même demande à tous les
modèles qui sont sortis cette semaine.
Donc GPT 5.6 Sol, Grock 4.5, GLM 5.2 qui
est le premier modèle open source et
puis un nouveau modèle chinois qui est
sorti cette semaine qui est beaucoup
beaucoup plus petit. C'était intéressant
aussi. Ma demande c'était globalement
croise mon ancienne vidéo avec le
discours du pape sur Lia et faisant un
site interactif où on peut comparer les
différences illustre le bien donc assez
complexe comme tage parce qu'il doit
avoir l'intelligence pour comprendre les
concepts travailler dessus bref des gros
modèles sont nécessaires pour faire
cette tâche et puis faire une une page
dans le style de mon site. Et donc ici
on peut voir que honnêtement GGPT 5.6
s'est très bien débrouillé avec une
comparaison sur les différents points de
comparaison. Un site dynamique
effectivement avec des schémas qui
illustrent. Globalement c'est très
réussi. On peut voir aussi que sur la
pertinence de la langue française on a
moins ce stylia qui ressort dans chat
GPT 5.6. Donc je pense que pour nous
français pour faire de la rédaction de
texte, on sera bien plus satisfait avec
GPT 5.6. Gro, on peut voir que c'est
vraiment le 8020 sur là en l'occurrence
le design alors qu'ils sont tous partis
hein du même design système. Par contre,
on peut voir qu'il a mieux fait le
travail et qu'il arrive à faire des
super graphique HTML, ce qui est pas
évident pour les plus petits modèles. On
peut voir qu'effectivement il a doublé
quasiment en taille de poids et euh ça
marche très bien. Par rapport à GLM 5.2,
le premier discours open source. Donc
là, ce qui est avantageux, c'est que
c'est passé par exemple sur un serveur
qui a effacé maintenant, donc en zéro
d'atterrétention. Ici, on peut voir que
c'est très très bien fait. Je préfère
pour moi le résultat par exemple de GLM
5.2 à Grock. GLM 5.2, c'est le modèle
que j'utilise dans 80 % du temps, 80 %
des cas parce qu'on est capable d'avoir
bah une vie privée complète avec des
modèles open source comme celui-ci. Ça
marche super bien et surtout c'est très
pertinent dans les les contenus, les
concepts qu'il a retenu ici. Enfin, le
dernier modèle que j'ai mis ici un peu
pour rire, pour le tester quand même,
c'est modèle HY3 qui est un modèle donc
beaucoup plus petit en terme de poids,
qui a peut-être cinq fois moins de poids
que que les autres qu'on voit ici, donc
qui est beaucoup moins lourd, qui tourne
sur du matériel plus léger, quasiment
grand public. On peut voir qu'il y a
vraiment une différence de qualité à cet
endroit-là. Je vous mettrai des images à
l'écran d'autres personnes qui ont testé
GPT 5.6 dans plein d'usages pour vous
montrer à quel point c'est
impressionnant. Globalement, si je dois
résumer pour vous, pour vous simplifier
le truc, GPT 5.6 est moins cher que en
Tropique que que Fable, va plus vite, il
peut tourner super rapidement et il est
meilleur pour les tâches sur lesquelles
on veut le laisser longtemps et on peut
faire travailler en autonomie, en one
shot sur la plupart des tâches, là où
c'est pas encore possible avec le
harness type cloud code parce que Codex
c'est simplement meilleur. Donc
globalement, vous avez aucune raison
d'utiliser Cloud Fable encore. Il vaut
mieux passer sur chat GPT 5.6. En tout
cas, ce serait mon heuristique
principale si vous codez, si vous
développez des choses, si vous avez des
enjeux d'avoir des outputs de qualité en
fait avec votre IA et utiliser plutôt
GLM 5.2 ou Grock 4.5 pour avoir un
métaagent qui orchestre et puis qui
envoie les plus petits sousagents qui
coûtent moins cher, qui sont plus
rapides. D'ailleurs, c'est une des news
de la semaine aussi, c'est Enhropic qui
a montré qui était en mesure d'obtenir à
peu près 95 % de la performance de
Fable, de Claude Fable, leur meilleur
modèle pour 40 % du prix en utilisant
Fable donc comme contrôleur principal et
en déléguant un plus petit modèle en
l'occurrence Sony 5. D'ailleurs, si vous
utilisez déjà cod, vous pouvez lui
demander des leg à des plus petits
modèles pour lui faire économiser les
tokens et être plus rapide. Et vous avez
aussi une fonction expérimentale que
vous pouvez activer dans CL code qui le
fait par défaut sans votre demande
explicite. Seconde interruption pour
vous dire que si vous souhaitez
apprendre l'IA, apprendre à créer un
système personnel IA complet, et bien je
vous invite à regarder ma masterclass
gratuite qui dure 1h30 dans laquelle je
vous apprends à construire votre
contexte votre second savoia qui se
souvient de tout ce que vous avez jamais
pensé lu vu entendu pour cli soit
l'extension de vous-même votre harnet
autrement dit quel logiciel vous allez
utiliser et quel modèle à l'intérieur de
ce logiciel et enfin vos skills donc les
compétences métiers qui vont vous
apporter de la valeur ajoutée grâce à
pour qu'elle vous remplace sur certains
process découvrir tout ça le lien est
directement en description quand à nous
on reprend
À l'heure où le prix des Tokenia devient
de plus en plus cher, vous pouvez
acheter en Chine des token Cloud à moins
de 90 % du prix et en plus en prime, ça
rend les modèles chinois meilleurs. Je
vous explique, si vous allez sur des
marketplace chinoises, vous allez être
en mesure de trouver des tokens cloud
pour moins de 90 % du prix affiché.
Comment est-ce qu'ils arrivent à faire
cette magie noire ? Concrètement, les
développeurs chinois mettent en place
des transfer station qui sont situés à
Singapour. Il faut savoir que Claude est
donc banni en Chine, même à Hong Kong où
je me trouve actuellement. Donc il faut
mettre un VPN pour passer à Singapour
pour pouvoir accéder à Cloud. Et donc
ils mettent en place des Transfer
Station qui sont des sortes de gros
serveurs à Singapour. Ils achètent des
abonnements cloud en masse et ils
profitent en fait, ils créent plein de
comptes parce que quand on crée un
compte, on a 5 € de token à pays offert.
Donc il utilissent ces 5 € offert plus
plein de comptes sur les abonnements qui
permettent évidemment d' avoir des
tokens moins chers. Ils ont une petite
logistique interne de routing des
différentes requêtes en fonction de leur
100000 comptes cloud qui existent et à
partir de là ça leur permet d'avoir des
tokens qui pour eux leur coûtent je sais
pas 5 % du prix de la pay affiché
pourtant qui ont la même performance et
donc ils sont parfaitement capables de
revendre à 10 % du prix parce qu'ils
font même de la marge sur ces tokens et
donc évidemment ces revendeurs de token
Cloud sont hyper intelligents parce que
avec un seul service ils ont en réalité
trois repas one fish three meals. C'est
ce qu'ils disent là dans l'article. Le
premier 1000, le premier repas qu'ils
ont grâce à cette revente, c'est
simplement la marge qu'ils font donc sur
les tokens parce qu'ils arrivent
peut-être à les avoir pour 5 % du prix,
les revendre à 10 % du prix, ça leur
fait déjà une belle marge pour
l'infrastructure mise en place. Merci à
eux. Ensuite, le deuxième repas, c'est
qu'ils peuvent simplement changer les
modèles sans que l'utilisateur se rende
compte parce que c'est hyper opaque. Ils
disent qu'on achète des token Cloud,
mais est-ce que c'est vraiment Claude
qui tourne derrière ? On sait pas. Et
donc deuxième repas à cet endroit-là. Et
enfin, troisème repas, c'est qu'en fait
les logs, ce sont le produit dans le
sens où en fait on sait très bien depuis
plusieurs plusieurs mois que les Chinois
entraînent leur modèle sur les réponses
des gros modèles de Claude ou CHG GPT et
il pompent tout. Il y a certains modèles
qui sont sortis Kimi, JLM, à qui tu
poses des questions un peu tricky. Ils
ont l'impression qu'ils sont Claude. Je
suis Claude, un modèle développé par
Entropique. Non non, tu es pas Claude,
tu es un modèle chinois, calme-toi. Mais
ça, bah ils le croient parce qu'ils sont
entraînés sur énormément de réponses et
de tokens de Claude et donc ils ont
l'impression eux-mêmes qu'ils sont
Claudes. Voilà, c'est une news plutôt
amusante qu'intéressante. Passons à la
suivante.
Bientôt, tu ne lanceras plus tes
logiciels. Tu demanderas simplement à
Lia de faire tout ton travail à
l'intérieur. En effet, Open AI search
GPT Work, c'est un agent qui ingère
Slack, Notion, Microsoft, 365, Google
Drive et cetera et peut globalement
interagir avec tous ces produits pour
produire les livrables que vous auriez
besoin d'avoir produit vous-même en
restant sur des tâches pendant des
heures. Globalement, c'est une
fonctionnalité de Lia qui existait déjà
depuis des mois avec Cloud Cowork, Codex
et cetera. Sauf que là, il le rendent
encore plus accessible à l'utilisateur
lambda parce qu'il fusionne ses
fonctionnalités agentiques avec des
tools et cetera. la réflexion des
boucles de rétroaction directement à
l'intérieur de l'interface web de chat
GPT avec donc je pense une sandbox de
machine virtuelle en arrière-plan pour
faire tourner tout ça et donc je pense
qu'on va de plus en plus vers un monde
où chat GPT veut parler à tout le monde
et veut créer un OS du logiciel des
produits qui intègre absolument tout et
qui deviennent la seule interface pour
faire absolument toutes nos tâches pour
loquer toutes notre donné et ensuite
être acheté par l'État américain qui est
un autre sujet. En tout cas, c'est
intéressant de voir cette évolution. On
voit que le pas entre l'Agenic et
l'utilisateur final réduit de plus en
plus. On va voir si ça marche les
chiffres d'utilisation du grand public.
Il y a quand même un truc à noter, c'est
que si Entropique voulait faire ça, je
pense pas qu'il pourrait parce que ils
ont peut-être pas la capacité de générer
suffisamment de tokens pour répondre à
toute la demande parce que li agentique
coûte beaucoup plus de token que
l'Alement question réponse question
réponse en mode chat. Oui, parce que
quand il faut appeler un outil, c'est
les tokens générés. quand il faut
recevoir une réponse, çaen est aussi et
donc forcément ça coûte très vite cher
en compute et en carte graphique. Et
voilà, c'est tout pour cette revue
d'actualité. J'espère que vous aimez ce
nouveau format. N'hésitez pas à me dire
en commentaire. J'essaierai de faire une
vidéo de ce type par semaine avec un
deep dive et des actualités. En bref,
n'hésitez pas à me dire ce qu'il faut
améliorer pour qu'il soit agréable à
regarder. Quant à moi, je vous souhaite
une excellente journée. Ciao !
Ask follow-up questions or revisit key timestamps.
Cette vidéo explore la découverte récente d'Anthropique concernant 'l'espace de travail global' (Gspace) au sein du modèle Claude, suggérant une forme de conscience fonctionnelle similaire à celle du cerveau humain. L'analyse montre comment identifier, lire et même modifier les pensées internes de l'IA pour influencer ses décisions, notamment dans des contextes éthiques comme le chantage. La vidéo aborde également l'actualité récente du domaine, marquée par une guerre des prix agressive entre les nouveaux modèles d'IA (Grock 4.5, GPT 5.6, etc.) et l'émergence d'agents capables d'automatiser des tâches complexes directement au sein d'environnements de travail.
Videos recently processed by our community