DeepSeek vient d’humilier ChatGPT et Claude (actu IA)
888 segments
Cette semaine, trois modèles open source
sont sortis. Alors, chacun pourrait être
l'événement de la semaine normalement,
mais le vrai signal, c'est pas encore
des modèles supplémentaires. Le vrai
signal, c'est que l'intelligence se
compresse. Des modèles de plus en plus
petits, de plus en plus accessibles qui
font ce que seul avant des modèles sur
des Hunter à plus de 100000 € pouvaient
faire. Par exemple, on a Deepsic V4
flash qui sort une nouvelle version où
il compresse encore plus d'intelligence
dans la même architecture. C'est
fabuleux. On arrive à avoir des prix 100
fois moins chers que Claude à un niveau
de Opus 4.7 4.8. Kimika 3 par exemple
qui est le modèle qui est sorti la
semaine dernière qui a fait trembler
tout le monde aux États-Unis parce que
il score numéro 1 sur la web Arena. Je
vous montrerai ça dans un instant. Et
qu'est-ce qu'on peut en tirer de ce
modèle ? Quels sont les prix ? Mais ce
n'est pas tout parce qu'il y a aussi des
révolutions cette semaine dans le monde
de l'open source de la vidéo avec site
dance 2.5 qui est sorti non open source
mais surtout Mini Max H3 qui sera en
open source qui est un des modèles open
source de génération de vidéos les plus
impressionnants qui combinent le son
aussi. Vous allez voir c'est une semaine
fascinante pour Lia. C'est parti.
Commençons cette section sur les modèles
de texte avec Deepsic V4 flash. Donc
désormais, vous pouvez faire tourner un
modèle du niveau de GLM 5.2, donc de
Opus 4.8, vraiment de très haute qualité
pour 100 fois moins cher que Claud, mais
surtout sur un hardware qui coûte
beaucoup moins cher. En effet, vous
pouvez le faire tourner sur un Mac
Studio aux alentours de 8000 € alors
qu'avant un GM 5.2, c'était uniquement
dédié à des énormes ordinateurs qui
coûtaient au moins 80 à 100000 € pour
faire tourner ce type d'intelligence en
local. Ce weekend, Deepsek a publié leur
nouvelle version de leur modèle V4
flash, un des modèles les plus utilisés
au monde pour tous les usages de type
chatbot, agentique, automatisation. Donc
c'éit un modèle extrêmement populaire
déjà parce qu'il était extrêmement peu
cher et très intelligent mais ils ont
poussé la barrière encore plus haut
parce que ils viennent de sortir une
nouvelle version de ce modèle sur la
même architecture d'ailleurs que j'avais
présenté dans une vidéo à l'époque avec
le même nombre de poids et de
paramètres. Cependant, ce modèle, il
éclate ses prédécesseurs et toute la
concurrence. Comme vous pouvez le voir,
ce nouveau modèle Deepsic V4 flash score
déjà 10 points au-dessus de son
prédécesseur qui est sorti il y a
seulement 2 mois. également au-dessus de
la même version mais du V4 Pro et au
même niveau de l'intelligence que GLM
5.2 qui est un modèle qui coûte en
l'occurrence à peu près 10 fois plus
cher. Si on regarde ici l'index de coût
par intelligence de tâche, ici on se
rend compte que Dipsic V4 Flash est donc
100 fois moins cher que Fable 5 par
exemple alors qu'il propose une
performance qui est tout à fait
convenable pour la plupart des tâches
que vous faites au quotidien. Ce modèle
coûte donc 14 centimes par million de
tokens d'input et 28 centimes par
million de tokens d'output. Ce qui en
fait donc le moins cher du marché à ce
rapport qualité- prix. inégalé par aucun
provider, par aucun modèle nulle part
dans le monde. Les points ont bien sûr
été publiés en open source. Donc vous
avez deux possibilités. Soit l'utiliser
par l'hébergeur d'IC en lui-même, donc
les données vont en Chine, soit le
prendre au même prix chez un provider
américain ou européen qui vont vous
proposer un ZDR z0 data rétention. Donc
c'est un modèle qui est extrêmement
puissant et qui vous permet d'avoir une
vie privée parfaite parce qu'il est
proposé par les hébergeurs qui proposent
une très bonne vie privée. Une autre
chose à noter sur ce modèle, c'est qu'il
est devenu assez facile de le faire
tourner sur du matériel grand public.
Alors évidemment, ça reste un budget en
milliers d'euros, mais on n'est pas dans
un budget à centaines de milliers
d'euros comme par le passé pour avoir ce
type de performance. Juste ici, par
exemple, si on prend simplement un Apple
M5 Max, donc un MacBook Pro de 128 Go de
RAM, on se rend compte que la version 2
bit peut tourner de manière assez
confortable. Et donc face à cette
compression de l'intelligence, des
modèles plus petits deviennent super
intelligents, je pense que il y a une
heuristique réelle pour les boîtes qui
commencent à émerger, surtout sur des
boîtes de plus de euh 100 employés
disons, où du coup les quya commencent à
devenir assez significatifs euh dans la
bottom line. En gros, sans utilisateur,
on peut les servir à peu près en
simultané sur un hardware autour de
40000 € pour ce modèle. Voilà, c'est une
grosse estimation. Mais donc on voit
très vite que le matériel est amorti
extrêmement rapidement surtout si la
nuit on commence à proposer des usages
agentiques de Lia où tu as des agents de
veille de concurrence de création de MVP
et cetera qui peuvent tourner la nuit
pour continuer à optimiser le hardware
ou bien qui peuvent être mis à
disposition sur des réseaux de comput
distribués et donc on peut avoir
commencer à avoir en plus un rendement
avec son hardware. Il y a vraiment un
monde dans lequel petit à petit le
hardware pour faire tourner des modèles
devient de moins en moins cher. Et quand
on commence à avoir de la concurrence de
10 15 20 utilisateurs qui utilise la
même machine pour faire tourner un
modèle, on commence à vraiment avoir des
belles économies pour des boîtes et un
vrai intérêt parce que les données ne
partent nulle part sur aucun serveur. Il
y a plus d'enjeu de RGPD qui serait
compliqué à être compliorit
très rapidement un matériel qui nous
permet d'avoir un edge sur le marché
assez énorme parce qu'on peut faire
tourner des modèles quasiment
gratuitement la nuit en recherche en RD
des agents de recherche et autres. Et
d'ailleurs pour ma part, j'ai aussi
envie de m'engager sur ces boîtes
d'infrastructure parce que je pense que
c'est un énorme besoin pour les
entreprises queêtes souverain sur le
compute qui produit l'IA. C'est un
excellent investissement pour une boîte
parce que ça amortit rapidement et ça
apporte beaucoup de valeur ajoutée parce
que ça ouvre de nouveaux usages du fine
tuning et autres. Cependant, je pense
qu'il faut attendre un petit peu
justement pour que les modèles soient
plus matures pour pouvoir proposer des
prestations qui font vraiment sens sur
un amortissement rapide et sur un
hardware qui va pas se déprécier trop
vite parce qu'on a payé beaucoup trop
cher en terme de multiple parce que la
demande sur le marché est trop grande.
Je vous prépare une petite démo de ce
modèle et d'ailleurs de tous les autres
que je présente juste après dans la
vidéo. Donc restez bien pour voir ce que
ce modèle donne concrètement.
Modèle suivant, il s'agit de Incling
Small. La semaine dernière, on a parlé
dans les actuak, un modèle donc open
source qui a été publié par une nouvelle
boîte Thinking Machine qui a été créée
par la condatrice de Open AI qui s'est
séparé d'open AI pour aller plus vers
des usages corporate de ce type. Et ils
ont publié du coup un nouveau modèle
Inkling Small, la même approche à peu
près que Inkling. Ce qui est assez
intéressant à noter, c'est donc que
effectivement il a à peu près la même
taille de dipsic. Il offre des
performances un peu moindres si on
regarde les benchmarks globaux. Si on
prend Inkling mode juste ici, on voit
qu'il soit à peu près pareil que le gros
modèle, ce qui est assez impressionnant.
Mais cependant qu'il est encore au
niveau de l'anciensi V4 flash qui éit
déjà très bon globalement aujourd'hui en
terme de vous votreuristique vous avez
pas à l'utiliser concrètement si vous
voulez mettre de l'IA dans des
automatisations pour pas cher et autres
utiliser Dipsic V4 flash si vous voulez
créer des gros projets continuez à
utiliser clos des chat GPT ça il y a pas
de changement inling ce qui est assez
intéressant c'est donc que c'est un
modèle open source qui vient des
États-Unis qui s'adresse vraiment aux
entreprises et qui a été pensé pour être
fine cuné c'est-à-dire légèrement
transformé pour s'adapter parfaitement à
des usages par exemple le New York Times
va avoir un agent de rédaction dans
l'arton of voice il pourrait faire tuner
ce modèle et le faire tourner sur leur
propre hardware. Eting machines font des
millions d'euros de cash par par
seconde, j'ai l'impression, simplement
avec ses offre aux entreprises parce que
c'est parfaitement ce qu'elles veulent.
Donc ici, ce qui est assez intéressant,
c'est qu'on se rend compte que bon
honnêtement il est pas extrêmement
impressionnant sur les les différents
benchmark. Il est assez moyen mais ce
qui est déjà assez impressionnant parce
que c'est leur premier modèle qui
sortent. Cependant, ce qui est assez
intéressant à noter, c'est que c'est un
modèle ultra multimodal dans le sens où
il intègre également la voie. Voilà, on
voit que juste ici par exemple le audio
MC, on voit que bah dipsic évidemment ne
le prend pas en compte, que GPT 5.6 ne
prend pas en compte l'audio. Tandis que
là, c'est un modèle qui prend en compte
l'audio, ce qui peut être assez
intéressant pour des usages multimodo.
Typiquement pour un journaliste qui
voudrait analyser plusieurs pistes et
permettre que le modèle puisse faire
tout sans faire d'appel à pay externe
sur de la transcription ou autre. Ce
modèle est dès aujourd'hui disponible en
open source et vous pouvez trouver des
versions compressées que vous pourrez
faire tourner sur des appareils aux
alentours de 5000 € que vous pourrez
trouver tels que des Mac Studio et
autres.
Et pour finir, on termine par la grosse
bestiole de la semaine qui est Kimika3
qui est un monstre de paramètres. Il
fait 2,8 trillions de paramètres. On a
jamais eu un modèle open source aussi
gros. Il y a énormément d'innovations
techniques derrière ce modèle. Ils ont
publié un papier qui le présente. J'en
ferai peut-être une vidéo, mais il y a
vraiment des belles innovations pour
permettre que le modèle justement soit
assez restreint en terme de de coût
d'inférence et de coût de compute quand
bien même c'est impossible de le faire
tourner. À moins de de mettre 500000 à 1
million en infrastructure et encore ce
sera pas très rapide. Donc Kimika 3 a
que dire sur ce dernier ? Et bien après
les premiers retours des utilisateurs
sur le web, on se rend compte que en
terme de agent arena, il est juste ici
5e. Donc c'est évidemment le premier des
open sources, mais il est vraiment pas
derrière GPT 5.6 et autres en terme de
qualité de benchmark. Mais là oui,
l'Excel, c'est surtout sur le
développement web full stack, c'estàd
qu'il est capable de créer des sites
extraordinaires rapidement. Et donc on
voit que juste ici donc c'est un
benchmark communautaire qui reflète un
petit peu mieux la qualité concrète du
modèle plutôt que simplement sa
performance sur des benchmarks
arbitraires. Et ici on voit que Kimika 3
est le préféré de la communauté en ce
moment ce qui est assez dingue parce que
c'est un modèle encore une fois qui est
comme on peut le voir juste ici beaucoup
moins cher que Fable 5. Pourtant il est
devant certains usages et donc très
clairement il y a une vraie heuristique
à utiliser Kimika 3 dans certains cas
d'autant qu'on peut le faire tourner sur
des providers qui proposent donc une
bonne politique de confidentialité. Par
exemple, si on regarde ici les providers
qui proposent Kimika 3, on se rend
compte que juste si on a par exemple
Fireworks, Wfer ou autres qui vous
propose Kimika 3 avec ZDR, donc zéro
data rétention, ce qui rendra complient,
RGPD et cetera. Donc vous pouvez avoir
un énorme modèle qui est super puissant
avec une vie privée qui est parfaite.
C'est surtout ça qui est intéressant
avec Kimika 3. Si vous êtes intéressé
par le machine learning et je vous
recommande vraiment de lire le papier
scientifique Kimika 3 qu'ils ont publié
qui reprend pas mal des papiers qu'ils
ont publié ces derniers mois mais qui
présente l'entièreté de l'architecture.
Les deux innovations principales qu'ils
ont eu, c'est le KDA qui permet d'avoir
une attention donc un nombre de gigacté
de RAM nécessaire pour stocker
l'historique de conversation qui
n'explose pas de manière linéaire avec
les tokens. Ce qui permet d'avoir un
gros modèle et une grosse fenêtre de
contexte. C'est quelque chose qu'ils ont
vraiment inventé qui est qui est super
pertinent. C'est plus des produits
scalaires qui sont vraiment utilisés.
Ils font vraiment des fonctions
d'activation à chaque fois. Ce qui
permett de garder l'intelligence tout en
enlevant le bruit et la quantité de
données. Et ici la Mystery of Expert été
légèrement modifiée pour avoir une
qualité supérieure. On a énormément
d'experts, c'est assez impressionnant.
Ils ont vraiment poussé le
l'architecture de Deepsic extrêmement
loin ici. Donc voilà, c'est supers
innovation et je vous recommande de vous
informer là-dessus si vous souhaitez.
Bien bien bien mais tout ça c'est
beaucoup de blabla et très peu de démo.
Donc je vous propose qu'on regarde
comment performe les quatre modèles sur
la même tâche. Donc ici on a Deepsic V4
flash l'ancienne version, la nouvelle
version Kimika 3 et puis Inkling Small
sur la même tâche pour voir comment
est-ce qu'il performe comparativement.
Donc évidemment c'est pas une vraie
démo, mais je voulais trouver une
manière de vous proposer une tâche que
je ferai au quotidien et donc j'ai pris
un use case qui était assez compliqué
mais c'est une tâche qui tire partie de
mon contexte du harness dans lequel je
suis et cetera. Donc à partir de cette
vidéo qui est une vidéo YouTube qu'on a
réalisé sur cette chaîne, je veux que tu
fasses une présentation autoportante
pour présenter avec beaucoup plus de
clarté, une belle structure le contenu
de tout ce qui a dit dans la vidéo. Je
veux un rendu dans autre DA. Tu
trouveras les skills pour te guider. À
toi de structurer la meilleure structure
pour présenter le contenu et expliquer à
une entreprise de manière structurer
notre proposition et nos valeurs. Je
veux un format HTML super beau et bien
structuré. Tu peux générer des images
avec le MCP Fas. C'est un outil qui lui
est connecté pour générer des images et
des schémas HTML pour améliorer. Je veux
une présentation impressionnante
visuellement. Enregistre ici. Ne me pose
aucune question, produit le résultat
d'un seul coup la meilleure qualité
possible. Voilà le promte qui a été
donné à chacun des modèles. Donc chacun
on réfléchit. Ce qui est assez
intéressant, c'est de voir le coût par
résultat. Donc ici sur un Deepsic V4
flash ancienne génération, on est à 11
centimes. 11 centimes aussi pour le
nouveau avec un nombre de token utilisé
qui est d'ailleurs le double sur
l'ancienne version. On est sur le même
provider à chaque fois donc c'est
vraiment à Armégal en quelque sorte.
Kimika 3, il a utilisé 2,84 € pour la
présentation. Donc là qu'on voit
vraiment les cartes de prix. Alors
évidemment pour un individu, c'est pas
énorme, mais si on prend à l'échelle
d'une boîte, il y a vraiment vraiment un
enjeu à router correctement les demandes
des utilisateurs vers les bons modèles.
C'est un énorme besoin sur le marché si
vous voulez créer une start-up
là-dedans, c'est assez pertinent. Et
puis Inkling Small, du coup, les quatre
modèles ont été en réflexion max.
Inkling Small a aussi coûté 12 centimes
mais demandé beaucoup moins de token
parce qu'évidemment, il est plus cher.
Bien, voyons voir les rendus de ces
quatre présentations. Commençons par
deeps V4 Flash Old, donc c'est
l'ancienne version. Voilà à quoi il
ressemble. Et les images qui sont été
générées ont donc été générées par
d'autres modèles. Faut pas générer sur
la qualité des images, mais plutôt sur
l'intention du prompte, la structure du
contenu et cetera. Donc voyons voir deux
narratifs qui paralysent les dirigeants.
Très bien. Concrètement ce sur quoi faut
se concentrer. On voit que la
présentation est pas bien, mais par
contre c'est vraiment l'introduction
qu'il faut avoir, c'est vous êtes
peut-être paralysé entre ça et ça et
voilà ce qui est réel derrière. Le
framework, les cas pratiques. OK, pour
mettre un exemple directement pour
mettre en lumière, on voit qu'il y a des
petits problèmes ici de structuration
sur le le HTML. Donc il y a des petites
spill de partout mais honnêtement tout
est propre. La présentation elle est
elle est quasiment chipable. Le contexte
effectivement, c'est ce qui fait la
différence. L'humain dans la boucle
effectivement, on voit qu'il y a des
problèmes d'espacement. C'est pas
correct ça. Ici, bon, l'image est dégueu
mais limite c'est pas forcément le le
but. Ici, par contre, on a des problèmes
de de smiley et de lisibilité. Donc, on
voit que Li ne s'est pas relu. Ici, on a
un problème de contraste aussi. Donc,
client ne s'est pas relu non plus. Ce
qu'on apporte à vos autres entreprises,
l'équation qui change tout. Là, c'est
dégueulasse. Prêt ? OK. Bon,
globalement, je noterai cette
présentation, un 5/10 avec le niveau de
d'intention que je lui ai donné,
honnêtement, elle s'en est bien sorti.
Donc maintenant, comparons directement
V4 flash, le nouvelle version qui est
sortie euh il y a 2 jours. Euh donc ici,
on se rend compte qu'on a dès le début
un problème de de couleur juste ici sur
le titre. Je pense que c'est lié au fait
que donc c'est un modèle d'SIC V4 Flash,
le nouveau ou l'ancien qui n'ont pas de
vision, pas d'audio, donc ils ont pas de
de de paramètres liés à ça dans leur
dans leur dans leur construction et donc
ils peuvent pas par exemple voir une
image ou voir un visuel. Et donc à mon
avis, c'est pour ça aussi qu'il manque
de visibilité sur ce qui se passe dans
sa slide. Et donc c'est pour ça
probablement qu'il y a eu un problème de
contraste ici parce qu'il sait pas que
l'image est noire derrière. Donc il sait
pas qu'il devrait mettre ça en en blanc
concrètement. Donc il faudrait lui dire
ou il faudrait lui donner accès à un
autre modèle. Honnêtement, s'il avait
pas généré des images, il y aurait pas
eu ce ce problème. Donc c'est vraiment
une contrainte technique plus que un une
erreur en quelque sorte. OK. Le constat
de récit, un dirigeant coincé entre les
deux. Effectivement, c'est ce qu'on dit.
Lia ne tient pas. Voilà pourquoi
effectivement c'est les trois points
qu'on aborde. On voit qu'il y a du du
design un peu qui a été mis ici et je
trouve ça assez cool en réalité.
Pourquoi il y a échou en entreprise ?
Une seule question qui remplace tous les
discours effectivement chercher le
goulot pas le projet. Effectivement,
c'est la manière de cadrer le truc. Le
vrai game changer, c'est 80 % du
travail. Effectivement, pour le coup, on
se rend compte que l'intelligence de
réflexion est bien meilleure parce que
là, la présentation qui a été donnée
profondément, elle fait de l'empathie
avec le dirigeant. Elle comprend ce
qu'on va devoir lui dire, les croyances
à lui riframer pour qu'il achète notre
prestation. Ça lui fait comprendre un
peu tous les choix qu'il va devoir
faire, le processus de décision par
lequel il doit passer. C'est à mon avis
assez brillant. C'est une présentation
qui est aussi beaucoup plus longue,
beaucoup plus holistique et donc qui a
beaucoup mieux respecté ma consigne. Le
dérouler, honnêtement, les graphiques se
tiennent. simplement encore une fois on
a ce problème de couleur mais ils se
tiennent plutôt bien. Il y aurait
quelques petites modifications à faire
mais on est vraiment sur un niveau de
qualité qui est qui est aux alentours de
de disons 9/ 10 de ce que j'attendrais
parce que le contenu est beaucoup mieux
structuré. On a un HTML qui se tient
globalement. Hormis ce problème d'image
c'est vraiment un 9/10. OK, si vous le
voulez bien, passons maintenant à Kimi
K3 qui est donc le plus gros modèle.
Encore une fois, c'est une présentation
qui nous a coûté la 10 centimes pour les
précédentes. Cette fois-ci quasiment 3
€. Donc on est sur un rapport de x 30
quasiment par rapport à l'autre. le vrai
problème de lien en entreprise que les
coachs et consultants cachent. Donc là,
il part sur une approche plus
storytelling en l'occurrence. Euh, OK.
Oh, on voit que le visuel qu'il a généré
est beaucoup mieux. L'intention, la
clarté d'intention pour générer cette
image était parfaite. Il a mieux utilisé
le MCP, il l'a mieux intégré. On voit
qu'il a de la vision et que c'est un
modèle qui est extrêmement fort en
vision Kimi. Et donc c'est pour ça que
là pour le coup, les slides sont
vraiment magnifiques. Effectivement, la
bonne question c'est celle-ci et c'est
pas effectivement les deux narratives
par les parmi lesquelles les dirigeants
se battent. Donc là, pour le coup, la
l'introduction, ils ont tous fait la
même chose. L'équation qui résume
effectivement, ça rajoute de la clarté.
Le modèle est une voilà, on voit où est
la valeur justement. Qu'est-ce qui vous
empêche de croître effectivement ? Pour
vous donner un exemple d'un process, le
contexte holistique, comment est-ce que
c'est structuré le endof pour donner un
exemple de à 6 semaines, un contexte qui
se maintient tout seul, du savoir tribal
au savoir explicite et enfin la partie
souveraineté. Le bon modèle pour chaque
tâche. Le graphique est absolument
magnifique à cet endroit-là. Top down ou
bottom up, c'est effectivement nos deux
approches, nos valeurs qui sont
effectivement listées juste ici qui
était aussi ma demande. Notre méthode
pour le déployer effectivement, c'est
les quatre phases et c'est parfaitement
bien fait. Par où commencer ? Écoutez,
là je donnerai un 10/ 10 à la
présentation. Honnêtement, j'ai rien à
redire. Il y a des trucs que j'aime pas.
Par exemple, j'ai rajouté des choses
d'après l'échange machin serait des
trucs qui seraient en réalité plutôt à
garder en interne plutôt qu'à à mettre
sur la présentation finale pour le
client. Mais je trouve ça extrêmement
satisfaisant. Là, c'est une présentation
que je pourrais mettre en prod
directement. Passons directement au
dernier modèle Inklink. Donc là, on a un
gros problème, c'est que déjà il a pas
su trouver le skill qui contenait en
fait les les guidelines de présentation.
Donc là, on est sur un énorme problème.
Il y a rien de cohérent. Ici, on a un
problème de lisibilité. Les polices,
elles sont absolument dégueulasses. Ici,
basé sur la vidéo, présentation
autoportante, il met ses propres
consignes à l'intérieur de la
présentation livrable qu'on voit
simplement bah qu'il est juste beaucoup
moins intelligent en fait que les autres
modèles. C'est vraiment là-dessus qu'on
se rend compte qu'il y a des modèles qui
sont parfaits pour les tâches du secteur
tertiaire de nous qui faisons des powerp
qui vont un peu de l'intelligence brute.
Typiquement, le nouveau dipsic V4 flash
est parfait pour pas cher. Kiming K3 est
surperformant là-dessus et même trop
performant pour ce type de tâche. Là en
l'occurrence, on voit que ce type de
modèle est vraiment pas haut niveau.
C'est un niveau je sais pas GPT3 quoi.
Les images générées ont rien à voir. Par
contre, on voit qu'elles sont bien
intégrées parce que le modèle a
effectivement de la vision. La slide est
vraiment pas dégueu. Il y a rien qui
casse à part ces petites flèches et
c'est un truc qui est beaucoup trop
bateau. Là, on voit vraiment que c'est
du AI slop. Alors que sur les
précédents, sur le Deepsic V4 flash
nouvelle génération et sur le Kimika 3,
on se rend compte que c'est vraiment pas
du Slop. Il y a de l'intelligence et de
la pertinence de réflexion marketing.
Donc ça, évidemment, je mettrai un 1/ ou
0/ 10 si je pouvais parce que c'est pas
un truc que je pourrais livrer. Je
devrais tout reprendre de zéro. Là, je
pense qu'en deux trois prompes, on
arrive au résultat final. Là, en une
seule modif, on arrive aussi au
résultat. Et sur Kimi, pareil, une seule
modif. Encore une fois, je rappelle que
leuristic pour utiliser ces modèles,
c'est si vous avez une boîte qui est
soumise à RGPD, ce qui est le cas si
vous êtes en Europe ou que vous adressez
des clients européens, vous n'avez pas
le droit d'utiliser avec les données
clients des modèles type open cloud ou
autre. Et donc, il vous faut avoir des
modèles open source qui sont hébergés
sur des providers qui ont du ZDR et un
DPA. Et donc concrètement, vous avez le
choix parmi ces modèles là. GLM 5.2,
Dipsic, V4, Flash nouvelle génération,
Kimica 3, ce sera votre gamme. Pour tout
ce qui est agentique, vous pouvez
utiliser agentique autonome, vous pouvez
utiliser Dipsic V4 Flash. tout ce qui
est vos salariés qui font des rendus
Dips V flash ou GM 5.2 et tout ce qui
est de la production de vos développeurs
et autres Kimica 3. Pour moi, c'est ça
leuristique à avoir aujourd'hui dans
l'open source. Et puis si vous en foutez
du si vous voulez dans l'illégalité,
disons d'un point de vue du de données
et tout donner au gouvernement
américain, dans ce cas-là, vous pouvez
aller évidemment sur cloud ou Open AI,
mais dans la plupart des cas, en tant
qu'Européens qui avons un business,
c'est même pas une option en réalité
pour nous et on le voit trop souvent
comme une option alors que ça l'est pas.
Hop ! Je me permets de couper cette
vidéo rapidement pour vous dire que si
vous voulez apprendre à utiliser Lien
dans un contexte agentique comme je le
fais juste ici, vous voyez qu'en un seul
prompte, il a compris qui j'étais, quel
était mon business, quels outils étaient
à sa disposition et il a eu beaucoup
plus de capacité que vous avez peut-être
vous à l'intérieur de votre cloud ou
chat GPT ou autre. Bref, si vous voulez
apprendre à créer un système profond et
personnel autour de l'IA, alors je vous
propose de regarder une masterclass
gratuite d' 1h30 dans laquelle je vous
présente l'entièreté du second cerveau
numérique, le système justement que j'ai
créé. Grâce à cette vidéo, vous
comprendrez tous les principes de base
que j'ai utilisé pour le construire,
mais surtout vous saurez le mettre en
place directement chez vous. Alors si ça
vous intéresse, le lien est en première
ligne de description. C'est gratuit et
nous reprenons la vidéo avec les
actualités vidéo. Mais cette semaine, on
a aussi été énormément gâté au niveau de
la vidéo. En effet, on a le meilleur
générateur vidéo jamais fait qui a été
publié, un nouveau modèle de génération
de vidéos open source avec du son et un
nouvel outil Netflix qui est super
intéressant. Vous allez voir ce dont il
s'agit.
Première grosse actu au niveau de la
vidéo, c'est S Dens 2.5 qui est sorti
concrètement le meilleur modèle du
marché par le passé. C'était déjà Seed
Dance 2 qui était le meilleur.
Aujourd'hui, c'est S dance donc 2.5 qui
est créé par la compagnie chinoise B
dance. Ils sont relativement peu chers
par rapport à la concurrence et
maintenant on a vraiment des vidéos qui
sont quasi exploitables en prod. C'est
plus vraiment le es lop qu'on voyait
avant. Je trouve qu'on a vraiment passé
un un un palier surtout pour les vidéos
qui sont réalistes. Donc je vais vous
mettre des exemples à l'écran pour que
vous puissiez juger par vous-même. Mais
globalement ce qu'il faut retenir c'est
que déjà on augmente la durée de
génération. On passe à 30 secondes par
clip vs 15 secondes 20 secondes pour les
autres. Le second point, c'est qu'on
peut aller beaucoup plus loin dans le
multimodal en donnant jusqu'à 50
références. Donc, on peut donner de
l'audio, de l'image, des vidéos et en
fait le modèle va réussir à combiner
tout ça dans un seul plan cohérent qui
garde de la fidélité par rapport aux
images de référence. Vous avez aussi un
mode qui vous permet de passer d'un
storyboard à une vidéo complète. Vous
mettez quelques images qui s'enchaînent
et c'est comment aller d'une scène à
l'autre et de faire les transitions. Il
y a un très bon test pour benchmarker
les modèles, c'est les scènes de combat.
Là où la plupart des autres modèles
cassent, ici, on arrive à avoir un
excellent résultat. Cependant, c'est
très cher. Il faut dire que c'est 4,60 à
peu près pour 10 secondes de génération.
Donc, on est sur vraiment de la haute
qualité qui est à utilisé en prod
uniquement. Pour tout ce qui est petit
essai et petite production, évidemment,
ça va être hors budget pour la plupart
d'entre vous. Et justement, ça nous
amène au modèle suivant.
Désormais, tu peux générer une vidéo en
deux cas avec du son stéréonatif et le
modèle va être open source. C'est une
petite révolution. En effet, il s'agit
de Mini Max H3, donc une boîte qui
s'appelait avant Awall, qu'ils ont
rebrandé pour l'appeler donc Minix H
pour l'intégrer dans leur gamme de
produits en natif. Donc concrètement les
caractéristiques de ce modèle, je vous
mettrai des exemples à l'écran pour vous
puissiez en juger par vous-même de la
qualité, c'est qu'on peut générer donc
du 2K 15 secondes de clip par 15
secondes avec un son stéréo natif, ce
qui était précédemment du jamais vu de
combiner les deux dans un modèle open
source. Vous pouvez commencer à jouer
avec directement sur la plateforme Luo
AI. vous avez des crédits gratuits pour
commencer à générer. Globalement, ça va
vous coûter 1,20 € pour 10 secondes.
Donc c'est à peu près trois fois moins
cher que site danse pour en réalité pour
la plupart des US case des résultats qui
seront largement suffisants. Si on
regarde par exemple la qualité de rendu
de ce lézard, on se rend compte que
vraiment on a passé un step sur un
modèle open source. Franchement, c'est
le modèle à utiliser si vous voulez
faire tourner ça sur votre infra. Donc
on sait pas encore combien de poids il
va faire mais à mon avis ce sera
possible de le faire tourner sur une
infrastructure souveraine.
Netflix a sorti cette semaine un modèle
vidéo super intéressant qui vous permet
de changer le style d'une vidéo entière
en modifiant une seule frame. L'idée est
très simple, vous prenez une vidéo de
référence, vous changez une image et
ensuite le nouveau style se propage à
toute la vidéo. Ça vous permet par
exemple de tourner dans un décor X et
ensuite de vous retrouver transporté
dans un décor Y. Alors évidemment, c'est
super cool pour des youtubeurs et
autres, mais ça peut être génial pour
des plus petites productions de film qui
veulent directement faire beaucoup
d'effets sans avoir à passer par
beaucoup d'heures de post-production.
Simplement avec un seul outil, on arrive
à changer tout le style d'une vidéo en
un clic. Alors pour l'instant, c'est
uniquement disponible en 720p, mais à
mon avis, ça va continuer à s'améliorer
parce que c'est open source et donc
c'est un excellent outil à utiliser si
vous êtes producteur de court-métrage et
autres.
Tout ça c'est au-dessus de la surface
mais en réalité on y a ce qui bouge
chaque semaine c'est surtout la
recherche et on a un modèle justement
qui s'appelle F zéro qui sort d'une
nouvelle recherche théorique sur les
world model et je vais vous le présenter
maintenant. Ce qui est assez
impressionnant c'est que c'est un modèle
de 4 milliards de paramètres qui base
Sora 2 sur la compréhension de la
physique. Sora 2 étant un des modèles de
génération vidéo les plus chers et les
meilleurs du marché. Vous avez peut-être
déjà entendu parler du concept de world
model par Yan Lequin qui est notre star
française nationale. En effet, il s'agit
donc d'un modèle qui ne fait pas que
prédire les pixel de l'image suivante
qu'on aimerait voir, qui fait ce qu'on
appelle de la diffusion. Là non, il
passe pour sa génération par une
génération de compréhension de la
physique qui ensuite a un impact sur
l'image générée, ce qui lui permet de
jamais faire d'erreur. Par exemple, on a
des images de super grande qualité avec
Sora, avec Sidens et autres. Par contre,
les personnages passent à travers les
murs, ils donnent un coup de pied, ça
passe, ça déforme complètement la tête.
Et pour contrer ça, on surentraîne sur
des milliers d'images de références
justement de corps et cetera qui
bougent, de mouvement, de physique. Là,
c'est un peu différent parce que
justement on passe par un modèle de
prédiction de la physique pour entraîner
justement la génération de la vidéo euh
derrière qui passe encore par de la
diffusion. Donc, on n'est pas sur une
architecture JPA parfaite comme décrit
par Yan Lequin, mais on s'y rapproche
vraiment et c'est la première fois qu'on
a des rendus aussi beaux, c'est que vous
pouvez par exemple donner une image
d'origine et ensuite le modèle va
prédire la physique donc de cette image
et ensuite vous pourrez vous déplacer
dans l'image comme affiché à l'écran.
C'est aussi un modèle donc qui est donc
super utile pour les voitures autonomes,
pour les robots et autres. Si ça vous
intéresse, je vous invite vraiment à
lire le papier f z0 et si vous voulez le
modèle, vous pouvez déjà commencer à
l'utiliser parce que le code est rendu
open source dès maintenant. Et voilà,
c'est tout pour cette vidéo. Je suis
super heureux que cette semaine ce soit
l'open source qui soit mis à l'honneur
avec Deepsic. L'équipe, c'est l'équipe
de la de la baleine, vous savez, c'est
le logo de Dipsic. Ils sortent assez peu
souvent de de la mer. Par contre, quand
ils sortent, c'est pour faire une grosse
annonce comme les baleines. Et je trouve
qu'ils ont vraiment frappé fort encore
une fois aujourd'hui. Kimika 3 est
extrêmement impressionnant également. Ça
me réjouit beaucoup et ça devrait vous
réjouir aussi surtout pour nous
européens. Si vous êtes une boîte,
franchement, commencez à penser aux
nouvelles heuristiques de posséder
l'infrastructure de vos tokens. Et quant
à moi, je vous souhaite une excellente
semaine. On se rejoint la semaine
prochaine pour les actualités, même
jour, même heure.
Ask follow-up questions or revisit key timestamps.
Cette semaine a été marquée par des avancées majeures dans le monde de l'intelligence artificielle open source, avec une tendance claire vers la compression de l'intelligence dans des modèles plus petits et accessibles. Les modèles comme DeepSeek V4 Flash, Inkling Small et Kimika 3 redéfinissent les standards en matière de coût et de performance. Parallèlement, le secteur de la génération vidéo connaît une révolution avec des outils comme Mini Max H3, offrant des capacités multimodales impressionnantes en open source, tandis que de nouvelles recherches théoriques comme F0 ouvrent la voie à une meilleure compréhension de la physique par les modèles.
Videos recently processed by our community