Go back

🖥️ Comment révolutionner le compute en IA | La vision de ZML par Steeve Morin

89m 34s

🖥️ Comment révolutionner le compute en IA | La vision de ZML par Steeve Morin

Le podcast présente Steve Morin, fondateur de ZDML, qui explique les concepts clés de l’IA générative. Le *training* est comparé aux cours : on fournit au modèle des entrées et sorties attendues, et il ajuste ses poids. L’*inférence* est l’interrogation du modèle entraîné sur de nouvelles données, utilisée massivement en production (ex. ChatGPT). Steve note que l’inférence consomme bien plus de calcul que le training, car un modèle déployé sert des millions d’utilisateurs. La discussion aborde ensuite DeepSeek, un modèle chinois surprenant : entraîné avec 10 fois moins de ressources (5,5 millions de dollars), il atteint des performances équivalentes à GPT-4 ou Claude 3.5, grâce à un raisonnement profond. Cela est d’autant plus remarquable que la Chine est limitée aux GPU A100 (interdiction des H100 américains). Steve évoque aussi l’évolution des GPU Nvidia : des A100 (révolution IA) aux H100 (meilleur pour le training), puis aux Blackwell B200 (deux puces assemblées, mais problèmes de physique et de rendement). Enfin, ZDML, start-up parisienne soutenue par New Wave, développe une stack open source pour l’inférence haute performance en production, validée par Yann LeCun. Steve insiste sur l’importance de l’open source et de l’écosystème IA français.

Transcription

13063 Words, 72047 Characters

French
Alors déjà qu'est ce qu'on appelle le training et l'inférence pour prendre une analogie un petit peu simple, le training c'est les cours et l'inférence c'est l'intero. L'inférence c'est l'intero. L'inférence c'est l'inférence. On entrain le modèle, on lui dit voilà ce que tu as en entrée, voilà ce que j'aimerais que tu es en sortie. Et à force, il se corrige, il se corrige, il se corrige et à la fin on obtient ce qu'on appelle un des poids. Et ces poids, alors ces poids combinés, ce qu'on appelle une architecture, ça donne un modèle. Donc on peut décorrer les poids de l'architecture, on peut un peu bricoler, mais grosso modo quand on entraîne, on entraîne une architecture pour générer des poids. Une fois qu'on a ces poids, quand on le met en prod ou quand on lui pose des questions, on le fait ce qu'on appelle de l'inférence, donc on lui demande d'inférer le résultat par rapport à une entrée donnée qui globalement n'est pas dans son sède d'entraînement. Ça c'est la première chose. Mais un assistive et là franchement c'est parfait. Un des plus grands experts techniques que je reçois sur le podcast et c'est toi qui m'a fait la définition la plus simple ou propre. Il demande souvent un hgpt explique moi comme si j'avais 15 ans là tu ne pouvais pas mieux faire. Ça s'appelle DeepSync mais il peut DeepSync et donc penser profondément. Donc un modèle extraordinaire sur ses performances et après par contre là où on dit que t'es marrant quand on lui demande ou qu'il est ou comment il a été entraîné, souvent il nous fait des petites allusions en tout cas à gpt4. Comment est-ce que t'as vu ce modèle arriver toi stimes, est-ce que tu tiens attendé? Ah bah moi j'ai mon pop corne, je suis au premier rang, j'adore avant d'ailleurs DeepSync qui a vu Gwen aussi. C'est vrai c'est vrai. L'Ibaba, clairement l'inférence va écraser le training en termes de compuques de très très très très loin. Ça c'était avant le reasoning. Le reasoning, je ne crois pas encore plus les cartes mais même avant qu'on parle de reasoning simplement parce que c'est le besoin universelle et une fois que moi elle a été entraîné on le déploie un moment plus de fois qu'on le entraîne. Salut Stive. Salut. Et bien Stive Morin, fondateur de ZDML, nous sommes le 3 janvier 2020. Et je pense que j'ai hérstif que c'est l'occasion de souhaiter une bonne année pleine de succès, de santé à nos auditeurs de comptoiria. Et oui, il y avait une bonne année surtout, une bonne année pour tout le monde et comme tu dis surtout la bonne santé pour vous et vos proches. Et parce que de l'autre côté sur l'IA on sait que ça va être une année qui va être folle, non, ça avant d'avoir commencé le podcast. Je pense que t'es d'accord avec moi non? Le feu y ton continue. On a beaucoup de choses à faire, on a un premier trimestre en tout cas en ce qui nous concerne très très très chargé. Magnifique. Donc Stive, tu es le fondateur de ZDML, tu as su visant par cours depuis longtemps parce que t'étais aussi le VP Engineering de ZDL. Une magnifique successory française avec Arachat par Snap, Snapchat peut-être même à l'époque. Et donc là j'ai vu que tu t'étais lancé sur ZDML. Tu vas nous dire ce que ça veut dire ZDML. J'ai eu le plaisir de te croiser à l'inocuration des bureaux, la soirée du bureau parisien de OpenAI. Je pense que avec ce qui se passe en ce moment, un discours, une vision bien particulière, passionnante pour nos éditeurs. Donc merci d'être là pour nous en dire un peu plus sur ton superbe projet et nous partager un petit peu ta vision de l'IA. Merci, noire, ce voir. Encore une fois bonne année. ZDML, on dirait ce que ça veut dire, ZDML pas grand chose. En fait, je trouvais que le nom sonait bien. Et ça m'a plu, je voulais quelque chose de cours. ZDML est écrit dans le temps de la gase qui s'appelle ZDML. J'ai aimé bien, j'ai toujours aimé ASMR aussi pour ce qui fombe, pour le nom. Bien sûr, j'étais dans le train et ça m'a plu. Et je me suis dit que si c'est ça, il y avait envie d'appeler à l'époque le projet, qui n'était pas encore une boîte. Et ce qu'on fait, on fait tout un. Des outils, en tout cas un ensemble, une stack, on appelle ça. Un ensemble d'outils pour faire de l'inférence à très haute performance pour de la production, donc vraiment quand je parle de production, je parle de système style à l'échelle opénaïe, par exemple. Pour des modèles, donc d'IA, donc pas que d'ALLM, mais pas que des modèles de langue, mais entre autres, du manière générale, des modèles d'IA au sens large. Donc c'est un ensemble d'outils qui. L'inférence aussi peut-être si tu as envie que je creuse un peu ce que c'est, mais l'inférence, on dit souvent que c'est par opposition aux training. Donc le training, c'est qu'on entraîne le modèle, l'inférence, c'est qu'on lui pose des questions. Quand on le fait tourner, quand on utilise cette GPT ou anthropique ou d'ypsi, etc. C'est l'inférence, on fait l'inférence en permanence. Les opérations calculées. Exactement, nous voilà, c'est un ensemble d'outils pour déployer en prod des modèles à en dire de manière professionnelle. Bonne fixation, Steve. Tu vas nous en dire plus dans une seconde. Tising, juste avant, y'a une lequin quand même, y'a peut-être deux mois sans que ce soit motivé de demander par vous, de lui-même, y'a quand même présenté ZDML, avec un petit tweet en disant une solution d'inférence de haute performance, qui peut le parler lisé. Et donc faire rener des systèmes de deep learning sur plein de hardware différents. Il nous dit, ça sort du styles mod. C'est très impressionnant et c'est Open Source. Un tweet de Yann, qui a dû bien tomber au moment de votre release. J'ai beaucoup d'admiration pour ce que Yann fait, ce que Yann a fait, et qui il est. Donc ça a été un peu la surprise, mais c'est très chouette, c'est validant. C'est validant, c'est dire qu'en fait une boîte, on a quand même eu une vue du monde qu'on essaye de développer. C'est chouette de se dire que celui qui a 110 % du contexte du sujet dans sa tête est plutôt d'accord avec ce qu'on fait. Au-delà de la publicité, etc, sur le point de vue, la réalité des choses, c'était une très très belle surprise et au-delà de ça, c'est quelqu'un que j'ai eu la chance de rencontrer, qui est absolument incroyable, qui est vraiment loin des hyperboles, et quelqu'un du manement très chouette. C'est vraiment du bonheur. C'est pas tombé à Noël, mais c'est un bon petit cadeau, un bon petit cadeau quand même. Et j'ai eu la chance aussi de le croiser. C'est vrai que c'est assez extraordinaire, de la part d'un des pertes du Diploding, avec la position qu'il a sur meta aujourd'hui et l'open source. Pour Steve, les deux ans qui viennent de se passer dans l'illatient générative, pour toi, c'était une folie, c'est quelque chose à laquelle tu te s'attendais déjà cette période, tu l'as vu venir, ou comment t'as vu ça? Moi, c'est une folie, peut-être un petit peu, mais moi j'ai un passif, j'ai travaillé cinq ans dans les voitures autonomes au début des années 2000, à l'inria, à rock en cours. Et ce qui est très chouette, à l'époque, on pensait que mettre des raisons de neurone appelée ça, c'était un ego, peut-être par un ego technique, mais en tout cas un ego, parce qu'on ne pouvait pas expliquer le comportement. Donc déjà, j'étais très contente de voir les développements qui se sont passés dans les années fin 2010, on va dire 2017, 2019. Sur ces sujets-là, et puis après, sur la partie génération, clairement, Chad GPT a été une grande surprise, même j'étais au courant de GPT, etc. Mais ça a été vraiment un beau tournant. Ça a été très intéressant aussi de voir l'asper un petit peu plus, si je peux dire humain, parce qu'on a eu finalement des discussions quelque part très humaines, parce que la machine s'est mise à nous répondre. Et bien évidemment, on a entre au pommort physique, quoi. ça très très intéressant donc je sais pas si c'est une folie je trouve ça très chouette manifestement voilà on peut partir aussi maintenant de la course et donc je trouve ça très chouette je pense pas que la correction si de y en avoir une elle sera forte en tout cas pas sur ce que ça peut apporter évidemment comme comme beaucoup de choses qui excite beaucoup de gens des gens expérimentent on découvre plein de choses mais je suis surtout très content de voir en plus ce qui se passe sur ce sujet-là à Paris donc on a quand même eu la chance de voir des choses extrêmement extrêmement chouette ce passe ici donc c'est aussi ça aussi motivé motivé la création de Z&ML déjà le projet et puis après la boîte quoi donc moi je suis très très content de tout ce qui se passe magnifique je suis très très compte aussi c'est franchement c'est extraordinaire de vivre ça de vivre de l'intérieur avec des entreprennes comme toi je vous êtes combien je faisais d'aimelles aujourd'hui on est 8 ok vous êtes 8 et j'imagine que vous avez fait une levée de fond peut-être avec New Wave par exemple oui on a la chance d'avoir d'avoir New Wave à retenir et historique un peu pour toi oui oui oui parce que ça fait 10 ans que j'ai la chance de connaître de connaître de gens mais à l'époque de de ce famille parce que 10 ans bientôt et puis après avec Zenny etc mais ce n'était pas vraiment pour le côté historique c'était juste que je considérais que pour ce que je voulais faire c'était la meilleure personne pour nous accompagner et donc je suis très content là dessus on s'est trouvé et puis on se trouvait en tout cas sur ce aussi sur ce sujet là et donc je suis très très content bien sûr et tu es aussi tu dis tu es aussi ici oui une fille qui a su un peu fond superbe fond modèle un petit peu pour moi je ne peux pas de cast exactement oui je comprends oui bah pareil avec Ari et qui rane en l'occurrence on c'est très bien entendu ils étaient très chouettes et voilà on peut changer de les compter comme nos investisseurs magnifique Steve une des rubriques les préférés par nos auditeurs sur podcast l'outil y a que tu utilises le plus et est-ce que tu as un usage un peu secré ou hyper pratique à nous révélés moi clairement de par dans mon quotidien c'est pour pilot pour le side je la chambre de faire partie des utilisateurs on va dire privé en tout cas de poule salle tout finalement du meilleur général tous les l'élèm pour le code clairement c'est donc c'est une petite partie des gens j'imagine mais enfin en tout cas versus le reste mais ça c'est clairement mon arm secret je suis pas trop encore passé sur les agences style curse sort etc. globalement je considère que l'anglais est pas un très bon langage de programmation il y a beaucoup de contexte en fait dans ce que je fais et donc du coup j'aime bien que des fois il sache ce que je fais donc je m'en sers beaucoup pour cette reclare mais toi t'es taut des tèves à la base pure non enfin t'as fait l'épitain enfin oui t'as bien joué t'as quand même ça dans ta dans ta manière de réplex quoi ouais je suis je suis et je restaurais un ingénieur de formation déjà puis de cœur de goût c'est ce que j'ai étudié par choix et et je passe une bonne partie de mon temps devant interminale et dans un éditeur donc oui je code la phrase de aiseau aiseau compte de de pulsade entre à temps il y a une tesse un petit peu alors je vais un peu loin dans un peu plus sur la fin du podcast il a une tesse qui est assez intéressante qui est tu sais l'edji a y vendra certainement du code le code étant un langage assez mathématique structuré peut-être que c'est l'addessus en fait qu'on arrivera grosso modo à voir le plus de progrès et si on avance très vite là-dessus peut-être ensuite on pouvoir arriver à développer cet et dji enfin ça ça te parle ce ce ce résoudement de aiseau ça me parle beaucoup dans le cas de aiseau parce que ils ont leur tesse c'est de dire que bon bah voilà on a il y a un site de données qui a été faite par les humains qui y est même si on peut imaginer qu'il y en a encore une partie qui n'est pas adressée en tout cas fini la tesse de pulsade c'est de dire qu'ils vont pouvoir finalement générer de la donnée par l'exécution du code ça c'est quand même très avant garde-diste très frontière mais ça tient la route et donc dans ce qu'à là évidemment bah voilà le jeu de données il est infinie il y a un précédent à ça c'est alphago où quand ils ont entraîné finalement alphago sur des matchs existants d'être humains le modèle était bon mais il était globalement moyen quoi et c'est vraiment quand ils se sont mis à synthétiser des matchs que là le modèle a vraiment explosé en en capacité donc la tesse de pulsade et c'est aussi probablement ce qui motive leur dernière levée de fonce c'est de dire bah voilà on va prendre du code l'exécuté et entraîner un modèle sur ce que le code devrait sortir et donc en fait si on sait bah voilà de résultats de ce qui est écrit on peut mieux prédire ce qu'on veut écrire ensuite c'est sûr avec évidemment dans ce qu'à là il n'y a pas de limite en fait il n'y a pas de limite à ce qu'on peut faire donc c'est très très ambitieux après ils ont les clairement les bonnes personnes pour le faire donc co-founder de github oui jason je pense à aussi piree vadim jo tous ces gens là chez eux Warren si il m'entend tous ces gens là chez eux qui sont très fort et puis voilà hezo il a une il a une vue extrêmement extrêmement clair de ce qui peut faire jason c'est pareil à sure clairement ils sont bien équipés je pense que hezo a une bonne vue aussi pour en avoir déjà parlé avec certains de ses investisseurs aussi sur la manière aussi de de générer du du business je pense des gros contrats avec des des gros acteurs en fait qui qui est bien sûr en fait toutes les boîtes les plus importants américaines par exemple qui qui sont capables de payer quelques des plusieurs millions de dollars c'est vrai que ça c'est quelque chose pour ce type de solution c'est des clients qui sont très intéressants surtout que bonne partie de l'équipe qui a fait le goutte-market de github et parti chez poule-side c'est des anciens je pense à Paul c'est des anciens c'est eux qu'on fait le zéro à 100 millions de github ou quoi clairement ils sont ils sont ils sont non ils sont très très bien équipés pour ça magnifique alors dans une seconde on va y revenir parce que j'ai envie de faire le lien entre zml et et et et poule-side pardon mais juste avant Steve quand même pendant les où tout début des vacances de noël on a vu on a vu apparaître un modèle un petit peu en tout cas que moi je ne connaissais pas alors je pense que pour alors que l'équipe n'est pas un connu c'est donc le modèle chinois d'ypsique qui est sorti et qui nous a sorti des performances assez extraordinaires on parle d'un modèle équivalent en performance en tout cas sur les principaux benchmark à gpt4 ou clôte 3.5 ce n'est on nous dit qu'il était entraîné avec 10 fois moins de computes que le coup de l'entraînement c'était 5,5 millions de dollars donc là en fait on divise quasiment par 100 aussi par rapport au modèle équivalent donc c'était une énorme surprise et en plus ce modèle il y a aussi des capacités de de raisonnement donc il s'appelle d'ypsique mais il peut d'ypsinquer donc penser profondément à l'usion on le rappelle à donc digblou donc Big Blue de IBM et le digpsinking du guide du voyage intergalactique évidemment donc un modèle extraordinaire sur ses performances et après par contre là où on dit que t'es marrant quand c'est quand on lui demande ou qu'il est ou comment il a été entraîné souvent ben il nous fait des petits d'allusion en tout cas gpt4 comment est ce que t'as vu ce modèle arriver toi stime est ce que tu t'y attendais ah ben moi j'ai mon pop corn je suis au premier an j'adore avant d'ailleurs d'ypsique il y a vu quen aussi c'est vrai c'est vrai liba bas au pan source d'ypsique c'est pareil c'est je suis très content en fait c'est finalement Il y a plusieurs choses. La première, c'est que grosso modo la Chine est retard d'à peu près 5 ans sur le CD-Cone. Il faut savoir que les H-10 ont interdit en Chine. En fait les USA-1 n'ont pas le droit d'exporter leur H-10. Alors bon, il y en a qui se débrouillent par avec des circuits un peu gris pour en avoir, mais globalement les chips, dans tout cas le CD-Cone et d'ailleurs la capacité de calcul qui en Chine s'est arrêtée à peu près autour du A-10. Donc c'est à dire la génération N-2 du coup si on parle de Blackwell de Nvidia. Plus ou moins sorti mais pas tout à fait. Donc à qui il est sorti, il doit sortir depuis six mois. Mais ce qui est intéressant c'est que ça. On a des auditeurs qui est donc les A-10 en effet. Oui, pardon, plus fortement de la Chine. Ensuite les A-10. Alors, Nvidia a sorti les A-10 qui a fait la révolution de l'IA. C'est ce qui a fait ChatGPT, c'est ce qui a fait. L'IA tel que l'on l'a vu explosé, c'est fait sur les A-10. Donc c'est un chip de Nvidia. D'ailleurs ils ont fait les A-10. Donc ça c'est ce qui a créé la freinesie d'achat et les cluster à 100 000 etc. Pour lequel se sont battus. Et puis, bien, vous avez vu qu'ils réalisent des lundemasques. Voilà. En organisant des déjeuner avec Gensen, quoi, faire. Exactement, parce que tout le monde fait la gueule. Un personne est content, on passe ça. Parce que une video-lise, c'est des livries pour pas avoir des quarteurs qui font des pics. Donc ça c'est les A-10 et donc la nouvelle. Après il y a eu une variation qui s'appelle les A-200 mais les A-200, pardon. Mais la nouvelle génération, on entend parler depuis des derniers, c'est ce qu'on appelle les B- Blackwell. Donc H comme Hopper, A comme Amper, B comme Blackwell. Qui doit sortir après-demain depuis la rentrée de septembre. Ils ont eu des soucis fondamentaux de physique. Donc c'est décalé, mais ça c'est la génération. Qui arrive, quoi, qui est là dans les mois qui arrivent. Ça c'est les B-200, c'est ça, non? Oui, ou B-100. B-100? Ça s'appelle les B-200 maintenant. Ça s'appelle les B-200. Et j'ai cru comprendre dans un podcast excellent dont on parlait juste avant. Donc B-G-2 de Bill Gourlet et Brad recevait donc Dylan Patel de Semiannalysis. À un moment, il disait que Dylan disait que c'est B-Blackwell, c'était pas juste un GPU, que c'était plutôt un rack, enfin plusieurs GPU, non? Oui, alors en fait, tu peux les acheter que en rack, tu peux pas acheter un GPU. Mais déjà B-Blackwell, on lui-même, c'est l'association de 2 GPU en un seul. Donc le problème, alors, pour prendre un peut-être un pas en arrière rapidement, Nvidia est dans une course depuis le Ascent à la verticalité. Ils font plus de plus de plus de plus de ce qu'il peut faire encore plus. Donc ça peut à un moment donné poser des problèmes de scaling, en particulier. Donc on a vu ça avec le H-100. Versus le Ascent, le H-100 était pas écouter 5 fois plus cher, mais était que deux fois plus rapide en inférence. Alors, je parle pour l'inférence, pour le training, le H-100 a des très bons arguments. Mais bon, tout le monde fait des trainings, donc c'était plutôt une bonne nouvelle. Sur B-Blackwell, ils ont eu un problème assez chiant. Ils ont déjà skélé la taille du silicone le plus qu'ils pouvaient. Ça, ça génère ce qu'on appelle des problèmes de hile, puisque les silicone ont des problèmes les chips, sont imprimés. Et donc, si il y a un petit truc qui est mal fait, tout le chip va la poubelle. Et quand on dit que ça grand-deal, non, j'ai peut-être vu ça. Alors voilà, alors on peut faire le chose. Il y a la taille du chip. Donc à un moment donné, il ne pouvait pas aller faire plus gros. Donc ce qu'ils ont fait, c'est qu'ils ont fait quelque chose qu'on fait. En tout cas, ce qu'on vraiment poussait ça, c'est AMD à l'époque de l'architecture Zen. C'est-à-dire faire ce qu'on appelle des chips, et on les assemble avec un substra silicone en dessous. On a trois couches, deux chips et une couche de connexion. Donc c'est ce qu'ils ont fait sur Blackwell. Ils ont mis deux chips côte-côte. Donc on voit bien quand vous regardez les photos. Vous voyez bien qu'il y en a deux avec un substra d'interconnect derrière. Le problème, et avec une technique aussi de packaging, c'est-à-dire quand on met la puce, le silicone dans son boitier, si je puis dire, qui est un peu pionnière chez TSMC, le problème étant que Nvidia est en d'une course vertical, le chip consomme énormément d'énergie. On parle dans le cas de Blackwell de 1000 watts. Ce qui fait que à 1000 watts, on ne peut plus le refroidir de manière par l'air. Il faut le refroidir par l'eau. Mais factorisez ça avec la taille, la surface du chip. Ça a créé, et du coup, les différences de densité et de pureté du matériau, des matériaux, ça a fait que le chip gondolait. Et donc ça, c'est ce qui a motivé, est ce qu'il est appart, ce qui est si moins bon. Ce qui n'est pas bon. Non. Comme on dit pas mal d'investisseurs de gens du milieu, on dit "dissais a pretty big fucking problem". Et donc en fait, le chip gondolait, et en fait, ce faisant, les points de contact avec le matériau de refroidissement, en fait, sont encore moins bons, ce qui fait qu'il gondole encore plus, qu'il n'arrive pas à evacuer sa chaleur. C'est ce qui a expliqué en grande partie les retard du coup de livraison de Blackwell, les gens qui ont eu des versions de Blackwell ou les chips étaient ralenties exprètes pour pas qu'ils poussent trop l'angle optimique. C'est pour ça qu'on dit, génération courante, on dit encore un peu floue en ce moment, parce que Blackwell doit sortir depuis six mois. On pense qu'ils ont plus ou moins reglé le problème. Mais voilà, ils sont dans une course à d'averticalité, et ce qui a créé ce qui a bénéficiat tout le monde, mais dans le cas de la Chine, il se sort trouvé un peu coincé et donc ils ont dû faire avec les moyens du bord. Et, ils ont fait avec les moyens du bord. Donc la contrainte, comme souvent, la contrainte, a créé l'innovation. Est-ce qu'ils ont fait de la distillation, c'est-à-dire prendre les sorties d'un modèle pour les mettre dans un autre, donc c'est-à-dire avoir une sorte de modèle tutor, avec lesquels ils entraînent leur modèle à eux. On ne saura jamais vraiment, comme on entendait une modèle, indépendamment de ski public. Toujours est-il qu'ils ont fait avec les moyens du bord et ils ont bien faits. Et donc, on est attendre voir comment ça va. Ce que ça va augurer pour les suivants. - Oui, complètement. Chers Steve, revenons un petit peu à ZDML. Et je veux vraiment que. Donc, ce que tu nous présentes de la manière la plus simple pour nos éditeurs, donc on en face bien la différence entre le training et l'inférence, même si tu nous la déviens un petit peu en intro. Et en fait que tu nous fasses comprendre le rôle crucial que tu comptes jouer, la suite, donc à la fois entre ce dont tu viens nous parler, en fait, c'est limite physique, un petit peu de ces plus, de production, les limites économiques en fait de cette guerre, Nvidia, AMD et de tous les autres producteurs. Et comment est-ce qu'elle est la solution que ZDML vient apporter par rapport à ça? - Alors, déjà, qu'est-ce qu'on appelle le training et l'inférence? Pour prendre une analogie un petit peu simple, le training, c'est les cours et l'inférence, c'est l'intero. - L'inférence? - L'inférence et on entraîne le modèle. On lui dit, voilà ce que tu as en entrée, voilà ce que j'aimerais que tu es en sortie. Et à force, il se corrige, il se corrige, il se corrige. Et à la fin, on obtient ce qu'on appelle un des poids. Et ces poids combinaient ce qu'on appelle une architecture, ça donne un modèle. Donc on peut décorrer les poids de l'architecture, on peut un peu bricoler, mais grosso modo, quand on entraîne, on entraîne une architecture pour générer des poids. Une fois qu'on a ces poids, quand on le met en prod, ou quand on lui pose des questions, on le fait ce qu'on appelle de l'inférence, donc on lui demande d'inférer le résultat par rapport à une entrée donnée qui globalement n'est pas dans son sède d'entraînement. Ça c'est le premier chose. Mais insistive et là franchement c'est parfait. Un des plus grands experts techniques que je reçois sur le podcast, et c'est toi qui m'a fait la définition la plus. Ou prenez deux mois de souvent un hgpt explique moi comme si j'avais 15 ans, là tu ne pouvais pas mieux faire. Donc là on est. En fait l'inférence est le problème universelle. C'est à dire peu importe que vous soyez sophistiqués ou non dans le sujet, vous allez toucher de l'inférence. Quand vous ouvrez de chat de gpt, ce avec quoi vous interagissez, c'est de l'inférence. Quand vous déployez un modèle au Penet source, c'est de l'inférence. L'inférence c'est le besoin universelle. de l'IA. Le training est réservé à peu, d'autant qu'on voit une convergence, finalement, dans les capacités, parce qu'à mon donné, il n'y a pas de la donner infinie. Donc on voit une convergence dans les capacités des modèles. L'inférence, c'est vraiment le besoin universelle. Le problème fondamental qu'on a aujourd'hui dans l'IA, c'est le prix, finalement, de générer ces réponses. Ce qu'on appelle du compute. Donc on met dans un mot un petit peu global qui s'appelle le compute. Et l'économie de l'IA aujourd'hui est dictée par le prix du compute. Vous avez en bas de l'échelle, on va dire, TSMC, si on démarre TSMC. Donc TSMC, c'est ce qui fabrique les chips. D'accord, qui est fabrique physiquement. NVIDIA les design, si on prend l'exemple d'NVIDIA, les designs, TSMC les fabriques, pour faire simple. TSMC vont à peu près entre 40 et 60 % de marge. Par dessus, vous avez NVIDIA, si on prend les données, parce que c'est une boîte publique, si on prend les données publiques, vend à 64 % de marge. Par dessus, vous prenez Amazon, par exemple, ou Google Cloud, parce que le clouder qui va vous vendre à peu près entre 30 et 40 % de marge. Et par dessus ça, vous allez essayer de vendre de vendre votre produit. Et donc, on se retrouve dans une situation où l'unité économique de l'IA aujourd'hui, quand je parle du liage, je vais parler plutôt d'LLM, parce que c'est ça qui concentre beaucoup de l'attention, des modèles de langues. Aujourd'hui, l'unité économique de l'IA, c'est ce qu'on appelle le token. Donc c'est le bout de texte qui est généré. Pour chaque bout de texte, on appelle ça un token. Alors, ça a taille variable. Et en fait, finalement, ce token, c'est une passe de calcul d'un GPU ou d'un accélérateur, ou en tout cas, de toute la stack d'inférence que vous utilisez. Le problème dans l'économie de token, c'est que, en fait, on essaie de jouer sur finalement au dessus d'une marge, au dessus de 60, plus 64, plus 30% de marge. Et on essaie de marger à la rayanère par dessus, parce que finalement, le gros du gâteau est mangé par, simplement, le calcul, la machine, les GPU et tout ça. Ça, c'est en grande partie, c'est un problème assez fondamental, mais c'est en grande partie un problème du fait que Nvidia a une sorte de monopole un peu de circonstance sur la partie calcul finalement, sur la partie GPU, puisque c'est ça qui fait le gros travail. Or, il se trouve que sur le marché, on peut parler du sens large des accélérateurs pour l'IA, donc on peut parler des GPUs, mais il n'y a pas que les GPUs. Les GPUs s'appliquent bien à l'IA, mais les GPUs ne sont pas nativement faits pour l'IA. Même si ils sont spécialisés pour, ça marche bien, parce que les GPUs opèrent sur des pixels d'un écran, et ils opèrent en parallèle sur plein de pixels d'un écran. Il se trouve qu'un des pixels d'un écran, ça peut être aussi des données d'une matrice, et donc, bref. Si on parle des accélérateurs en général, on va dire un avantage de circonstance, mais il n'y a pas de problème d'offre sur le marché. On a des accélérateurs concurrents, on peut prendre les accélérateurs de AMD, par exemple les M300, qui, sur le papier, sont sortis un mois avant l'IA 100 de MVIDIA, sont 30% plus rapides. Écoute, écoute, 30% moins cher. Donc, on va dire qu'il y a une dicotomie à résoudre, entre ben, il y a de l'offre, mais pourtant, tout le monde s'en fout, on parle des MVIDIA, on achète que du MVIDIA. Et là-dessus, notre thèse fondamentale, le CDML, c'est dire que, c'est par simplement parce que la partie accélérateur n'a pas été, qu'on appelle "commodificé", c'est-à-dire abstrait. Attentive, et je me permets juste accélérateur. Tu peux me revenir dessus, j'ai vu. - Tiens, je vois le type 8. - Avec l'accélérateur. - L'accélérateur, c'est le terme un peu plus par appui pour dire les GPU. - D'accord. - Il y a plein de termes qu'on implore un petit peu de manière interchangeable, mais on va dire d'un côté, il y a les GPUs dans les accélérateurs. Donc, ça accélère le rendu graphique, l'IA, etc. Et puis, on va dire que les CPUs sont des plus d'un côté de l'autre. Il y a ce qu'on appelle les plus d'aider d'IA. Donc là-dessus, le précurseur, c'est clairement Google, avec ce que l'ETPU, les TPU, exactement. Tensore Processing Unit. Mais TPU étant une marque, il y a eu un terme qui est sorti qui s'appelle les NPU, l'idée c'est que ce sont des plus qui sont L, D, D, D, et L, donc ce sont pas des plus graphiques qu'on a détourné pour faire de l'IA, ou spécialiser pour faire de l'IA. Même si elles sont très bien spécialisées pour un, mais ça reste quand même des plus qui est à la base au perçus des architectures qui sert à faire du graphique. La vague, on va dire d'accélérateur D, D, D, du coup avec l'angouement, ils commencent à arriver sur le marché. Mais il y a toujours eu une offert de disponible à commencer si on prend le concurrent numéro 1 de Nvidia, qui est sur ce sujet, qui est AMD. Mais aussi dans les chips des D, D, D, les TPU s'affaient depuis à peu près 2017 qu'on peut les louer sur Google Cloud. Amazon est arrivé il y a quelques temps avec leur fameux Trainium, donc l'or chip a eux aussi, et vient d'annoncer, on était à Rhin20, la Las Vegas, ils viennent d'annoncer Trainium 2, donc une deuxième génération. Google pour info, on est à sa 6ème génération, et vient d'annoncer la 6ème génération. Notre fondamental, c'est de dire qu'on ne peut pas, c'est un jeu perdant que d'essayer d'entrentre en compétition, par dessus, démarche aussi grosse. En moment donné, je ne peux pas faire une marche de 1,2% là où celui juste en dessous de moi, il a 30 et encore 64 et puis encore 60. Donc le seul moyen mécanique de démocratiser ça, c'est de faire fleschir, finalement, cette part du gâteau. Et comment on fait flescher cette part du gâteau avec l'outil le plus vieux du capitalisme, qui est la compétition? Et pour faire de la compétition, il faut que le coup du changement, et ça c'est la mission de Zadamel, c'est que le coup du changement soit égal à 0. Ça veut dire que je m'en fiche de ce sur quoi ça tourne, il faut que ça tourne, c'est tout. Et donc si j'ai deux accélérateurs de GPU, par exemple, à performance différente, je vais choisir celui qui a la performance la plus intéressante pour moi. Si le coup du changement pour moi est transparent, j'ai aucun d'intérêt à prendre l'accélérateur, le moins efficace. À noter, un petit précision que ça savaut pour l'inférence. Pour le training, le jeu se situe àilleurs, ce situe, ce qu'on appelle sur l'interconnect. Donc tu développes une couche d'abstraction par dessus, par dessus la machine, quoi, grosse modo, pour que ce soit équivalent, d'utiliser du Nvidia ou du AMD ou du Intel, je ne sais pas. Ou du Intel ou du Visora ou du Furiosa ou du TenStorrent ou du Trainium. L'idée, ça commence par là, si tu veux. Ça commence par là, parce que tu dis attends, si je devais faire les choses déjà pour 2/0, c'est quoi la première chose que j'y irai adresser? Et la première chose qu'on irai adresser, c'est ça, parce qu'il y a d'autres silicones sur le marché. Certains, plus performants, moins chers. Alors comment ça se fait qu'on ne s'en sert pas? Pourquoi? Et donc, c'est un sujet logiciel. Et ça, il se trouve qu'on sait faire. Donc en fait, on dit souvent, peut-être que j'ai une vision trop simple, mais on parle souvent de l'avantage aussi de Nvidia, en tant que Dragon à trois têtes entre le hardware, le logiciel, les économiques. Voilà, mais que c'est ce coup d'un, donc leur couche logiciel. Mais donc, est-ce que toi, en fait, d'une certaine manière, tu essayes de déplacer cette avantage de coup d'un? Alors, c'est un point très intéressant. Il y a un fondamental qui ne faut jamais oublier, quand on parle de hardware et de software, etc. C'est que dans les boîtes hardware, structuruellement, le software est un peu, je ne sais pas dire, le parempauvre, mais est en aval du hardware, ce qui, dans la réalité, le cas, clairement. Mais on voit, quand on le voit sur les structures de boîtes, etc. Globalement, les boîtes hardware ont une approche, un petit peu aval du software. Il y a deux exceptions à ça. Aujourd'hui, c'est. Apple et Nvidia. C'est pas ça fait depuis 10 ans qu'on dit ça, ça a pas changé. Il se trouve que dans l'IA, pour des raisons historiques, en parle de ça, ça remonte à plus de 20 ans, pour être très clair. Nvidia sortit coup d'un, c'est ça que les gens se sont mis à utiliser. Donc je parle de ça en 2010, même dès 2003, on bricolait des trucs déjà. C'était pas coup d'âme, on bricolait des trucs sur les GPU à l'époque. On sortit coup d'un et coup d'un, c'est un peu là où les gens ont investi. Donc il faut savoir avec coup d'un, c'est que c'est la stack la moins pire, mais c'est pas la meilleure. C'est la moins pire parce que la communauté a fait énormément de travail pour rendre ça un petit peu plus digeste et puis c'est le FirstMoverAdventage. Maintenant, les autres stack, et maintenant je peux parler des éléments, dans notre cas, on supporte quand même 4 stack, puisqu'on supporte Nvidia, Cuda, AMD, Rekem, Google TPU et Amazon, AWS, Trainium. Les autres stack fonctionnent. Donc par contre, est-ce que il y a des problèmes à régler, bien sûr, mais tout en des problèmes à régler. Et donc il y a un gros travail d'intégration extrêmement difficile, et après c'est notre raison d'être aussi. Mais l'avantage si tu veux de Cuda, en tout cas sur les workloads d'inférence, nous, il y a des choses qui sont chouettes, mais on ne voit pas de fondament aussi tu veux. Par contre, clairement, on le sent quand on touche à d'autres stack, bah oui, il y a beaucoup de choses à rattraper. Mais bon, les jambos, les jambos, ça marche. Et, écoute, je reviens donc sur mon dragon à trois têtes, c'est software, hardware, and networking, la mise en relation de ces plus. Et par rapport à ce que tu dis estiv à l'instant, ce que j'ai vu, c'est que vous avez lancé une démo récemment. Des breus et des vels que vous avez fait tourner justement sur ces trois, sur quatre GPUs différents. Ah oui, ouais. C'était assez marrant visuellement, justement, de voir un petit peu une petite inférence sur chacun des différents TPUs et avec ZDML quoi. Oui, bah, c'était. Alors, est-ce que ça sert à quelque chose? J'annonce, ça sert absolument à rien, mais en fait, c'était un me seul flex, c'est-à-dire, c'est-à-dire une manière de dire on peut le faire, de faire tourner, non, c'est un seul modèle qui est ce qu'on appelle diviser, on se qu'on appelle tenses, pardon, pipeline, parallelisme. C'est-à-dire on a un bout du modèle qui tourne un endroit, un bout, un autre, etc. L'idée, c'était de montrer qu'on pouvait faire tourner du coup, donc le modèle, il s'appelle Lama. Lama sur trois accélérateurs différents, donc 2 GPUs, un Nvidia, un AMD, et un TPU de chez Google, de manière complètement, c'est le même code. Donc en fait, c'était un peu pour montrer la promesse de ZDML, dire, bah, voyez, le même code tourne sur en même temps, sur trois accélérateurs différents, à notre connaissance personne avait fait ça, donc on trouvait sa chouette de faire une petite démo, en plus c'est visuel, donc c'était très cool, avec rajouter par dessus le fait que, un DGPU était dans la chambre d'un de nos ingé, un DGPU était derrière moi dans les bureaux ZDML, et puis un autre TPU était en haus-lande. Donc il y avait un côté un peu aussi un peu marrant, voilà, sur la topologie, mais c'est avant tout pour montrer, voilà, c'est le même modèle, c'est le même code, ces trois accélérateurs qui sont très différents, qui ont des trade-offs qui sont très différents, qui sont des trois dispos sur le marché, et sont librement interchangeables avec la stack ZDML. Excellent. Récemment, donc, il y a Amazon qui a investi à nouveau l'ourdemand en tropique. Quand j'ai vu ça, j'ai vu qu'ils avaient donc une sorte d'accord d'exclusivité, où en tropique doit entraîner ces modèles sur les plus traignomes de Amazon, et certainement faire son inférence, peut-être sur d'autres plus inférantir, non, c'est pas ça, de. C'est un petit peu différent, mais c'est la même architecture. Et en fait, je me demandais en voyant ça, est-ce que, au final, bah tu vois, ça risque pas. C'est pas un problème, par exemple, pour en tropique, qui est une peu plus passée par du Nvidia, tu vois, dans ce modo, toi, ton. Bon, après, bien, la différence que tu viens de nous expliquer entre l'entraînement et l'inférence, mais tu penses qu'on va quand même que le problème, il va se déplacer qu'on va être à un autre niveau dans les années qui viennent. Clairement l'inférence va écraser le training en termes de compute de très très très très loin, ça c'était avant le reasoning, je crois pas encore plus les cartes, mais même avant qu'on parle de reasoning, simplement parce que c'est le besoin universelle, une fois que le modèle a été entraîné, on le déploie un moment plus de fois que l'entraînement. Ça, c'est le premier, le problème de l'optionalité, finalement, que tu soulèves pour en tropique, on ne j'ai pas metté à le place entropique et je suppose qu'ils ont breté le senteur et le truc, mais c'est une question qu'on oppose souvent et nous, c'est quelque chose qu'on remarque, qui est un frein à l'adoption d'architecture tiers. Si je prends l'exemple pour être très clair, la stack et le chip le plus aboutit performant tout ce que tu peux imaginer de très loin, c'est l'étépéu de chez Google, de très très loin. Est-ce que c'est un succès? Non, tout le monde s'en fout. Il y a que Google, par Google. Mais avec succès, j'en rappelle que Google ils ont les produits aussi, dans lesquels de déployer Google, c'est le géant qu'il dort. Les produits déployés et tu veux dire à ce moment-là, à la fois le search, liat du search et j'ai j'ai même n'y aussi. En fait, un triptique, c'est-à-dire que tu as un ensemble de choses, tu as l'édonné, la capacité à entraîner les modèles et ceux d'en quoi les déployer. T'as deux approches, si tu veux sur liat, tu as les approches verticales, c'est-à-dire, je te mets un chatbot, chat GPT. Bon, ça, on sait que ça commence à perdre de la vitesse, auquel le novelty factor, ce qu'on appelle le facteur de nouveauté, est en train de chuter. Donc ce qu'on voit beaucoup, c'est une horizontalisation des usages, soit par la multimodalité, donc c'est-à-dire de la vidéo, de l'image, de la compréhension, du voice, tout voice, etc. soit de l'autre côté, par du sous-poudrage, un peu partout, de liat. L'idée, c'est de dire que liat va devenir un accélérateur ou un ingrédient pour faire des produits. Encore faut-il des avoirs. Et aujourd'hui, si on garde un peu le marché, les gens, en tout cas, à ma connaissance, les seuls qui ont à la fois les données, la capacité à entraîner des modèles, donc c'est-à-dire à avoir des puces extrèmement, ils font que faites pour l'entraînement avec ce qu'on appelle un interconnex, c'est-à-dire la connexion entre les puces qui est très élevée. Et en plus, les produisent dans lesquels sous-poudré ou déployé ces modèles-là, c'est Google. Microsoft n'a pas ces puces. Amazon n'a pas les produits. Et OpenAI n'a pas son compiote. C'est pour ça que c'est un peu le, comme je dis souvent, le géant qu'il dort et c'est vraiment de eux qui faussent mes fiers. Si ils arrivent parce qu'ils passent leur temps à faire des reorganisations en interne, mais ils vont se faire passer votre ça. Ils font du bon boulot. Le point, c'est que tu vois, la stack, la plumature, les objets et les plus matures ne sont pas forcément ceux qui gagnent. Si non, TPU serait de loin, tu vois le numéro un. Maintenant, dans le cas du training, ce qui fait vraiment la différence et la connexion entre les chips, et Nvidia a acheté pour ça une boîte qui s'appelle toujours Mélanox. Et c'est clairement ce qu'il leur a donné, la vantage. Et ça, en training, c'est clairement l'avantage compétitive d' Nvidia, c'est l'interconnect. C'est un avantage qui va réduire dans le temps, au profit d'autres architectures. Le produit de Mélanox en particulier s'appelle Infini Band. C'est la connexion entre les machines. Il y a eu des technologies, alternative à Rocky, par exemple. Mais qui n'était pas aussi mature, ça pète tout le temps et tout. Mais qui sont en train de maturer, on voit des changements. Les cluster, par exemple de X-ci ne sont pas de l'un de mesques. Ce n'est pas en plus que le sus. Voilà, ne sont pas en infinibanes, ils sont en éternet. Donc, ça change, le marché change, là-dessus, sur le network Nvidia encore une égemonie, pour combien de temps, c'est dur à dire, sur le chip design, si je puis dire, pour moi, ça fait longtemps qu'ils en ont plus, mais le marché en partie à cause du grâce du mariage un petit peu, un peu de PyTorch et Kudah. Alors, laisse encore une égemonie parce que PyTorch est clairement branché avec Kudah, c'est un spaghetti dans tous les sens, c'est extrêmement difficile. Et dans ces choses-là, d'ailleurs, le diable est dans les détails. Parce que le problème, c'est pas de faire marcher. C'est la dizaine de tous petits problèmes que tu dois régler. Et donc, les gens, en fait, sont fiches. Donc, ce qu'on remarque pour revenir à l'attaction sur l'optinalité, c'est que les gens, en tout cas, les acteurs en qui l'on parle, ont beaucoup de mal à s'engager dans d'autres architectures, parce que ils disent, "Bah ouais, mais attends, je vais passer 6 mois à faire marcher ce truc, et puis après, j'ai les menottes." Parce que tu vois, Amazon va me dire "Bah ouais, mais on va pas rmégocier la facture." Donc, finalement, l'optinalité, le fait des soins de vidias, ça leur garantit une certaine forme de levier, quoi. C'est pour ça que, en tout cas, c'est une des raisons qui fait que ces architectures ont du mal à prendre, sauf évidemment si on en vend 100 000. Donc, ils ont des gros problèmes, c'est marché de go-to-market, puisque, il faut que tu fasses ton vendre des normaimants d'un coup, parce que évidemment, si tu en vas chettre 100 000, tu vas avoir tes ingé et tu dis, "Fais le marcher, quoi." Puis tu vas voir les ingé dans Amazon et ils vont le faire marcher, ça marche. Mais voilà, c'est un gros problème, c'est pour ça qu'on voit beaucoup de grosses annonces. Il a eu appel aussi, avec Harry Invent, qui a annoncé qu'il utilisait Traignom, anthropique, en français, on a vu un peu de drama, parce qu'ils sont partis chez Google, puis ils sont revenus chez Amazon. Alors, qu'est-ce qui s'est passé? Ils sont revenus trois mois après chez Amazon. Donc, qu'est-ce qui s'est passé? Mais bon, si tu étais chez Amazon et tu pars chez Google et que tu en viens chez Amazon, tu fais du NVIDial, quoi. Donc, peut-être après, maintenant, voilà, ils ont annoncé un par exemple avec Traignom. -Rassure. -Ça va être extrêmement intéressant. Tu dirais que moi, je crois énormément à l'optionnalité, c'est la seule moyen qu'on a de faire avancer l'innovation. -Et c'est ce qu'on peut faire avec un acteur, que ça va être vertical? -Version. Donc, pour toi, dans les années qui viennent, NVIDIA va être challenger, en tout cas. Et tu penses que, d'ailleurs, peut-être que ta solution va y participer? -Oui, oui, clairement. Je pense que si le coup du changement est égal à zéro, sur le problème universelle qui va de loin, de loin, écraser tous les autres problèmes, si le coup du changement est égal à zéro, alors NVIDIA devra compter sur finalement la seule chose qui compte, c'est-à-dire, les spécifications du chip et là-dessus. -Oui. -C'est pas les meilleurs. -Poi. -Et encore, je ne parle même pas de type courant. Si je parle, on parle avec probablement tous les acteurs qui ont des chips qui vont sortir, certains qui font 100 fois la perve de NVIDIA, c'est chip là, son réel, on les a vu, je les ai eu dans les mains, j'ai eu des mots de ces chips. Donc, ces choses-là arrivent sur le marché. On pense qu'il va y avoir un gros changement, en tout cas, il va y avoir du riffi-fifie, probablement d'ici l'été. Il y a des belles choses qui arrivent en 2025 là-dessus. -OK, super cool. Steve, j'ai. Quel question aussi. J'entends parler depuis pas longtemps. Je ne suis pas très familie avec ça, des néocludes, c'est-à-dire, corweave, nébus, quelques acteurs comme ça, qui se partage une part du marché. On m'a dit que ces acteurs-là, grosso modo, aujourd'hui, qu'est-ce qui faisait? Bon, grosso modo, il est revendé du NVIDIA, enfin, tout simplement, la puissance de calcul NVIDIA. Est-ce que tu peux me dire un peu ce que toi tu entends? Comment tu vois ces néocludes et si je comprends bien après toi? Ils sont peut-être que dans quelques mois, ils proposeront justement une infrastructure un peu différente, quoi, un peu tensiellement. C'est hyper intéressant. Clairement, ils sont une réponse à la pénurie. C'est aussi simple que ça. Dans l'univers du fait que le training, c'est un travail qui coque, qui a un début et une fin. Donc ce que tu veux quand tu traines, c'est, on va dire, maximaliser le nombre de GPU que tu utilises pour limiter le temps de training. Tu préfères traîner une semaine sur 10 000 GPU que je ne sais pas un mois sur 1000. Ce que tu veux, c'est monter le temps d'iterration, minimiser le temps d'iterration. Ce qui est très bien adapté, parce que c'est facile, tu déploie des GPU, tu donnes des interfaces qui sont extrêmement limitées, tu as besoin de très peu de primitive pour les faire marcher. Tu fais ton training, t'as peut-être épouâtre et content. La vraie question qui se pose, c'est, ce qu'on voit déjà à la peu près depuis septembre, des produits qui commencent à maturer et qui, du coup, doivent passer en prod. Et là, il y a un vrai sujet sur est-ce que je déploie sur un EO Cloud ou est-ce que je déploie sur mon cloud que je connais déjà, quoi, parce que c'est pas la même chose de faire de la prod, que de faire un entraînement qui a un début une fin. En plus, l'entraînement, c'est pendant que ça tourne mon bricol le truc. C'est vraiment une voiture dès qu'on change de laquelle on change les roues pendant qu'elle roule. Donc, le niveau de professionnalisme n'est pas le même. Donc, ce que l'on anticipe, c'est que les EO Cloud vont, en fait, finalement devenir des cloud tous en cours. On le voit, il y a beaucoup de. Donc on reprend une part du marché, par rapport aux 10/4-keller, c'est ça qu'on veut dire. Ils vont essayer, en tout cas. Par rapport aux Google Clouds à Google VLS. Exactement, ils vont essayer. Ce qu'on voit, c'est qu'on voit déjà des signes, par exemple, sans citer de nous, mais on voit y a pas mal de cloud. Ou, en fait, quand on regarde leur web page, ce qu'ils font, c'est surtout du cloud, plus que du GPU. Oui. Évidemment, ils marchent avec le GPU, mais on va dire la partie GPU, facile, etc. Et tenter un peu de reculer. C'est pas la même chose de faire un cloud professionnel pour faire de l'ébergement, de produits, en va dire, manière sérieuse, reliable, etc. Fiable, pardon. Que de faire un truc que tu fais pour un OneShot qui va durer peut-être même un mois, tu vois. Oui, bien sûr. Donc évidemment, ils sont en train tous de. Ils déplant encore des clusters pour des clients qui opèrent eux-mêmes certains. Mais clairement, ils vont y avoir un focus, ils vont devenir des cloud providers. Ils ont aussi l'avantage qu'ils font de la compétition sur le prix. Oui. Clairement, des fois, nous on voit des 4x. Entre eux, on va dire ce que va fournir un cloud provider classique et un eau cloud. Donc, ça va être intéressant de voir. Le point, par contre, c'est qu'ils vendent tous du Nvidia. On revient en même problème à la base. Quand tu regardes les coups que tu peux avoir, quand tu bouge sur des architectures dédiées, des fois, c'est plusieurs multiples types. Tu vois, c'est la guerre est ouverte. Ah oui, oui. Steve, j'ai une question très importante encore pour toi. On voit apparaître les modèles de raisonnement de plus en plus. On a eu "O1". Moi, j'ai "O1 Pro". On a vu, on a entendu parler. J'ai pas encore testé au 3 d'OPDI qui a affiché des performances records, notamment sur un test ARC-EdGI. Donc un test qui est censé être très difficile à accomplir par lLM traditionnel. Bon bref, après, on a vu un "Dip-C" aussi. Ces modèles de raisonnement qui sont donc une nouvelle direction que prend LIA, en tout cas, comment est-ce que tu les vois, Steve? Et ce que j'ai vu, et ce dont je me suis rendu compte en essayant "Dip-C" c'est que je pouvais voir un petit peu les token générés pour ces opérations de raisonnement. Et en gros, j'ai eu l'impression que ces modèles générés 10 fois plus de token que quand je m'adressais à GPT-4 ou pour faire une réponse. Qu'est-ce que tu penses de ces modèles de raisonnement Steve et qu'est l'impact que ça va avoir sur le marché? Je trouve ça très chouette, c'est une réponse un peu brute force au problème, quand même. Ca change fondamentalement de 1 des économiques, mais de 2 les modèles de compuques associés et donc les économiques. Là où c'est intéressant avec les modèles de raisonnement, c'est que la technique, si je peux dire, commence à fuiter sur le produit. Si vous utilisez "O1", par exemple, avant d'aller à "O3", si vous utilisez "O1", pendant qu'ils pensent, ça devient bichiant. 30 secondes à répondre, c'est chiant. Mais pourquoi ils m'en sont en train de faire le compte? Oui, oui. Donc, qu'est ce qu'on s'aperçoit? C'est parce que ça s'agmente énormément les questions qu'on lui pose. On se dit que ça vaut vraiment le coup. Je vais d'abord tester avec un autre. Je ne s'en parlerai du prix. Il y a vraiment ce cet aspect-là. Là où c'est intéressant avec les modèles de raisonnement, c'est un petit peu la même chose qu'on, le même, on va dire, contrainte qu'on les modèles dit "agentiques". On se dit que les modèles d'agents, des agents, c'est ce qui fait, par exemple, exécuter des actions. C'est que on est dépendant de la fin du calcul avant de faire l'étape suivante. Et donc ça, ça priorise une faillerie. C'est l'inert. C'est un filoris fondamentalement. Une autre maîtrique qui est là où aujourd'hui les GPU sont pas très bons. Donc, en fait, si tu veux, il y a des implications extrêmement fortes sur les modèles de calcul. Versus, par les étudiants, par les économies. Aujourd'hui, quand tu fais des chatbots, ce que tu veux, c'est par exemple, servir 10 personnes à 100 tokens secondes. Et donc, c'est-à-dire 1000 tokens secondes en agrégat. Tu préfères 100 fois servir 100 tokens secondes à 10 personnes que 1000 à 1. Quand tu fais de l'agentique, quand tu fais du raisonnement, c'est l'exact inverse. Tu veux 100 fois 1000 tokens secondes pour 1 personne, ce qu'on appelle single stream. Et pareil, pour l'agentique, puisque tu es obligé d'attendre la fin pour. Pour exécuter l'action, pour faire. Mais peut-être pour résoudre un gros problème, en fait. Exactement. Et là, les GPU sont pas du tout bon à ça. Tout simplement, c'est les nouvelles architectures. Je pense qu'on exemple de "Samba Nova", "C'est rébrince", "Groque", même si "Groque", c'est particulier. "Visera", "Headshed". Voilà, ça, c'est des nouvelles architectures qui, elles, arrivent à te sortir. 1000, 2000, 3000, 5000 tokens, 10 000 tokens par secondes. Donc, tout ce qu'on appelle, c'est travaux, ce qu'on appelle "limité" par la latente. Donc c'est-à-dire, linérement, je fais "A", puis "je fibais", puis "je fais "C". Bah, eux vont bénéficier énormément. Donc ça, c'est un gros, gros changement sur le marché. Donc, les GPU sont pas une bonne réponse. Gros déplacements sur l'inférence dont tu nous as parlé tout à l'heure. Et à l'intérieur de ça, les comportements résonient et agentiques. Voilà, après, c'est pour être très clair aussi, la façon dont le raisonnement est implémenté aujourd'hui, c'est une réponse, un peu brute force. Et finalement très vertical, quoi, à ce problème. Il y a d'autres, on va dire, façon de voir. Je pense à GEPA de Yann qui, en fait, reprennent le problème de manière fondamentalement différente. Mais c'est une réponse sur au-trois très chouette. Mais quand on voit le coup d'inférence qui l'a fallu pour atteindre ce résultat, aujourd'hui, économiquement, il n'y a rien qui le justifie. Donc c'est un peu. "He Chaker's Guide" de Galaxie. C'est-à-dire, on passe 1000 ans à faire la machine la plus forte. On lui pose la question. Et, au bout de 1000 ans, elle compute que c'est 42 la réponse. Et c'est un petit peu. Et nous dit que la question a été mal reformulée, où elle nous remue la question. Et il faut encore attendre 1000 ans ou 1 million d'années. Mais cela dit, c'est très encourageant, parce que ça ouvre une frontière. Et on a besoin. C'est pas pareil de découvrir l'inconnu que de savoir que maintenant ça a été fait. Il y a eu une trace dans le sable et on sait que ce futur là est atteignable. Après, ça change d'un moment le paysage du computer. Nous, on est très contents parce que c'est encore plus validant. Et puis, on travaille avec tous les prochaines architectures qui vont pouvoir rendre ça de manière viable. Et puis, si on enlève l'aspect technique, purement, etc. Aujourd'hui, il y a un sujet qui est coup. La leçon de GPT4, le premier, c'est que le coup n'était pas justifié. Bien sûr. Il a beaucoup baissé par 4 haut. Et au PNI, au Rizontalys, ils ont fait des modèles plus efficaces. C'est le coup de la leçon de GPT3, 5 versus 4. GPT4, quand même, c'était coup de la leçon de GPT3, 5 sur bords. C'est que, bah, c'était pas justeifié. Ils ont fait des modèles plus petits, plus efficaces, moins gourmand, du coup moins cher. Donc, il y a vraiment un suite spot du marché à trouver. Après, encore une fois, on opère dans tout ça, dans l'écosystème, où on facture finalement le compute, quoi. Donc, on facture le token. Steve, j'ai encore quelques questions. On déborde un petit peu sur l'épisode, mais j'ai encore quelques questions. J'espère que tu veux bien nous donner encore une petite dizaine de minutes, parce que j'ai des questions. Oui, avec les gens. On va pas trop à poser. Par rapport à ce que tu viens de dire, j'ai vu une tweet de François Cholé pendant les vacances. Par rapport exactement ce que tu viens de dire sur le compute, qui nous dit que, grosso modo, bien, sur les 100 prochaines années, la tendance la plus predictable, c'est que l'humanité va avoir besoin de plus en plus de computer, d'année après année. Et en gros, il nous dit, bon, bah, il faudrait même lancer un ETF sur le sujet. Donc, un petit indice qui nous regroupe, toutes les valeurs compiotes, Nvidia, mais pas que Nvidia, Nvidia, AMD, les data center, le nucléaire, pour permettre plus de computer. Ça, c'est ta vision, Steve, de plus en plus de computer dans les années qui viennent. Oui, bien sûr, oui, oui. Après, il va y avoir, je pense, des surceaux. La contrainte est bonne. Il faut pas qu'on te contrainte, mais il faut un peu de contrainte. La contrainte, tu le dis dans la part de l'innovation. Exactement. Avec les chinois et nos coins, c'est le bon exemple. Et avec Nvidia, par rapport à ce que tu fais, au niveau libre. Absolument. Donc, il va y avoir des scaling linéaires et des surceaux et ensuite. Et puis, ce que j'appelle souvent, moi, l'échelle. Et puis, on l'échelle contre le soquantique. Il va y avoir des soquantiques et puis on va voir de l'échelle. On va voir un peu des deux. Et te dire quand. C'est pas clair. En tout cas, une chose est sûre. C'est que sur la partie cheap, on en a encore beaucoup sous le pied. Nous, en tout cas, on le voit. On a quand même des constructeurs qui nous montrent des puces qui font 100x Nvidia. Ils font des puces qui font 100x Nvidia. Je pense qu'il va y avoir, en tout cas, pour les 10 prochaines années, clairement, une course à l'énergie. On a la chance d'avoir une source d'énergie. On a encore beaucoup sous le pied. Donc, évidemment, qu'elle va être mis à profire. En tout cas, moi, je me réjouis. On parle du nucléaire. Oui, pardon. Oui, pardon. Oui. Non, mais, tu as quitté. Bien sûr. Bien sûr. Je me réjouis. Bien sûr. Bien sûr. Bien sûr. En tout cas, entre ce que peut fournir l'énergie, et la façon dont on s'en sert. Donc, je me réjouis de. Voilà. de voir une renaissance du nucléaire, poussé grâce à ça. En tout cas, je préfère ça à Bitcoin, mon avis. Et donc, ça me réjouit. - Vous allez vous dire, vous allez miner de l'intelligence plutôt que du stockage de valeur, quoi. - Mais après, te dire ce qui relève du fantasme ou de la réalité, parce qu'il y a quand même beaucoup de. Voilà, des faits d'annonce, il ne faut pas non plus m'achat. En tout cas, là-dessus, moi, je suis extrêmement enthousiaste parce qu'il se passe en France, parce que simplement, voilà, on a des très très très très très belles choses déjà faites, puis dans les paniers et dans les cerveaux. Donc, de là, te dire à ce qu'on va faire des centrales, je pense que, en France, c'est pas trop l'idée. Pour ça, pardon, c'est pas trop l'idée parce que simplement, voilà, tu prends en été, on a 50 gigawatts d'énergie, entre guillemets, entre autres, quoi. - Oui. - Entre guillemets, bien sûr. Donc, on aurait largement de quoi en prendre un ou deux à droite à gauche. Surtout dans les cas de training où on connaît le début la fin, donc, tu vois, voilà. - Ah, tu as dit qu'on a 50 gigawatts, alors que je vois même les plans américains sur "Edgey" et quoi, grosse pause. C'est d'aller chercher cinq gigawatts, tu sais, sur des. - Pour les. - Et bien, en cette note-là. - La production de françaises, c'est de l'ordre, on va dire, je sais pas ce que j'ai pointi, il me faire torpiller, froide ou orbite, mais c'est d'endola centaine, peut-être 110 gigawatts, à peu près, tout confondure. Je te parle. - Oui. - Voilà, il y a 50 directeurs aujourd'hui. - Ah. - Quelque chose comme ça. - On est, je suis. - On est, je suis. - On est, je suis. - On produit 110 gigawatts en hiver, en tout cas, on consomme par bon, entre 110 et 120 gigawatts en hiver, et on consomme à peu près entre 50 et 60 gigawatts en été. Bon, bah, tu fais le calcul, là. - Oui. - Ouais, c'est vite fait, le Delta. Donc, tu te dis, bah voilà, cette énergie, on l'a, on a un des rares pays qui a cette avantage structurelle. Je sais pas, je vais pas parler de compétitif, mais en tout cas, structurelle. Donc, clairement, il y a des choses à faire là-dessus. - Et donc, tu vas mettre des mégas d'atta-center en France? - Voilà. - Après, des distances énergétiques? - Je pense, je sais pas si investir à fond dans les clusters de training, brancher des centrales, c'est un projet qui mérite 10 ans d'investissement, c'est quelque chose qui va tenir. Je sais, par contre, ce serait, je pense que ce serait quand même assez élégant d'utiliser la capacité inutilisée de nos centrales nucléaires, en haut de partie aussi pour les rentabiliser. Après, je ne pense pas que ce soit légal, en tout cas avec l'arrêt, etc. mais ce serait bien que ça soit fait parce que structuruellement, on a la capacité de production. On a les delta-cibe-soin, te dire, est-ce que voilà, on a les connexions fibres, etc. On est en centre de pays. On a de la base latente sur tout l'Europe. Donc, ouais, non, non, on a des. - Non, mais on est un peu. - Il y a normalies. - Il faut le dire. Il faut le dire. Il y a quand même des points très positifs. Et je pense qu'il faut en effet en parler de cette infrastructure pour la mettre le plus en valeur possible et essayer d'en profiter aujourd'hui. - Quand tu vois ce qu'on sort le kilowatt, le prix du kilowatt, du megawatt, pardon. Du megawatt, du megawatt sur le nucléaire historique, j'ai plein de gens qui font des clusters, qui ont des éputains. Mais si j'avais ne serait-ce que deux fois ce prix-là, mais je suis refait. Donc, plein de gens qui font des clusters, on parle de cluster en 10,2 milliers de GPU. Donc, on a des belles choses. Donc, je sais pas si on verra ces data-sempteurs. Pour être honnête, je sais même pas si c'est un bon investissement de faire ce genre de choses. Mais clairement, aujourd'hui, c'est un sujet sur lequel on a un avantage d'octurale. Donc, ce serait cool d'en profiter. - Clairement, c'est une ou la dizou t'ailleur. C'est une des dimensions de l'IA, cette énergie. Et on est bien positionné par rapport à ça. Steve, ta vision sur la course sur l'IA, sur les grands acteurs, les OpenAI, meta, la main, anthropique, bistrale. Est-ce que tu penses qu'il y a un gagnant dans les années qui viennent? Que le marché va se consolider encore? Qui sont les acteurs les mieux placés? Tu nous as parlé de Google tout à l'heure avec Gemini? - Moi, mon analyse, je peux dire, c'est que. Celui dont il faut se méfier ces Google. - Ok. - Alors, après, on peut troller sur Twitter. - Interfacts immutiles de âme. - Oui, voilà. - Je rappelle quand même que Google, ils ont quand même mis Gemini dans les développeurs tous de Chrome. Donc, on parle d'un truc qui est quand même très profond. Il peuvent se permettre ça quand même. Là où tout le monde est cette gravité, il n'y a pas trop faire de compuques. J'ai quelqu'un qui m'a dit qu'il fait des gros cluster, qui m'a dit, écoute, nous on voit ça comme un peu les constructeurs automobiles. Est-ce qu'il y a un clair gagnant? C'est pas clair. J'aime bien l'anologie. Je ne sais pas si il ne marchait pas à se consolider. En tout cas, je pense que. C'est une bonne chose. Je suis très content que Mistral soit estimé à sa juste valeur. Je rappelle quand même que Lama est inventé à Paris. - Oui. - Gemma aussi. Gemma, qui est la version en peine source de Gemini, qui est concrètement le moteur de Gemini. Donc, c'est fait à Paris aussi. Donc, il y a des belles choses. Je pense que oui, je pense à la rester quand même. En tout cas, je pense qu'on a un intérêt en consommateur. Est-ce que ce soit quelque chose, une course globale? J'espère que ça se consolidera pas trop encore. Et en particulier aussi, parce que l'Iaroba les cartes. C'est-à-dire qu'on peut apparaître sur la carte immédiatement. Je prends l'exemple de TTI avec Falcon. TTI, c'est Abu Dhabi. Instantainément, il sort un modèle. Tout le monde se dit, mais qu'est-ce qu'il se parle-à-la. Ça y est, Abu Dhabi est sur la carte. Qui maintenant, font le faire AI 7T1. Il y a un avantage compétitif, enfin il y a un avantage compétitif, sur l'engineering, à les chercher. Et il y a une possibilité de faire fier un peu si tu veux du passé ou on peut apparaître du jour au lendemain. Il peut y avoir des effets de rebond ou de saut technologique. -Pour dire sûr. -Vous le pensez que. Il sort de 10 cycles. -Claro. -Pour les deux prochaines semaines, tu vois. -Mais comme une autre manière différente. Parce que tu vois comme ça, tu vois sur la Chine. Mais après, Elon Musk avec XAI, ça s'est passé à coup de meiger investissement et meiger en recrutement. Mais six mois plus tôt, il était dans les choux. -Ben, XAI, c'est à l'américaine. -Je fais plus. Les cartes peuvent être obattus, mais pas contre les comptants qui est beaucoup de modèle, en tout cas, sur le marché. -Les cartes peuvent être obattus. Il y aura des soquantiques qui vont se faire. Te dire, "Douille viendront, quelle forme, ils auront." -D'accord. -Je ne pourrais pas. Quand je suis en mesure un peu trop, mais clairement, les cartes vont être souvent obattus. En tout cas, ça fait deux ans qu'elles passent leur temps à être obattus. Tu sais, dans ce domaine, on se dit, "Quand est premier?" On se dit combien de temps, quoi. -Bien sûr. -Elle est une isstrale et s'entlande en modèle. Bim, ils sont premier instantanément. Et puis après, ce que voilà, les jambos, hein, on boss. -Stive, nos dernières questions. La robotique, cette. -Oui. -M'arrête à beaucoup d'attentes là-dessus. Je trouve ça incroyable. Je ne suis pas très. Pas fan, mais je ne crois pas trop osuminoid d'un point de vue utilité. Je crois. J'aime bien, par contre, le geek en moi, évidemment. -Bien, voilà, attention. -Bien sûr. -Mais. Ça me fascine, en fait. Là-dessus, "GinFace", ils font des choses extrêmement belles. J'étais insalué quand une boîte française. -T'es ma wolf, le robo, le robo. -Oui, là. Ce que je t'en fascinante dans l'arbre-bautique avec Lilla, c'est que. On l'a eu, ne lui dit pas. Tiens, prends. prends la pomme. Tu vois. Ce que les modèles dit à sorte, c'est les codes. des moteurs directement, le courant pour faire tourner les moteurs. Donc on est vraiment d'un bout à l'autre, c'est-à-dire c'est les pixels en entrée et en sortie c'est le courant qui fait marcher les moteurs. On a presque même pas de concept de ferme la main. C'est juste, ça me fascine, je trouve ça incroyable que ça puisse se généraliser comme ça. Évidemment, il y a en travailler cinq ans dans la voiture autonome très entouilliste aussi de ce qui se passe là-dessus. Même si dans quelle voiture autonome la barre est très très très très haute. Il y a vraiment un diminution des retours pour pas faire d'un anglicisme, mais la barre est extrêmement haute parce que la tente est extrêmement forte. Disons que tu descendes vite dans le cringe. C'est un peu comme tu sais les avatars. C'est chouette et puis ça devient vite un peu "ah non c'est naze" C'est ce qu'on appelle la "un cannyvalet". C'est-à-dire que c'est trop réaliste et ça devient du coup, on le rejette. Voilà, merci de la valeur des tranches. Je suis très enthousiaste de ce qui se passe sur la robotique. En tout cas, le fonctionnement me fascine. Je suis ça avec intérêt. Est-ce que je crois au robot qui va plier mon âge? Je ne sais pas. En tout cas, moi en tant qu'ingénieur, avoir un robot qui marche, ça me paraît un peu inutile. Ça me paraît un peu inefficace. Je préférais qu'il ait des outils spécialisés un peu pour ça. Mais voilà, c'est mieux de voir où ça va. Après, là-dessus, il y a des très belles choses qui se font, pas forcément là où il y a le plus de projecteurs. Merci Steve. Notre dernière question. La timeline pour HGIA, ou super intelligence. Je ne sais pas. Je ne sais pas parce que le terme veut dire tout et son contraire. Je ne pourrais pas te dire, j'espère le plus vite possible quelques années. Je ne veux pas te dire exactement ce que j'attends. D'ailleurs, ce terme, c'est extrêmement flou pour moi. Parce que ça armait en question plein de choses aussi. Quand la machine te répond, je suis vivant et que c'est HGIA. Il me manque des sites, c'est pas qu'un modèle est HGIA. Par exemple, et qu'il te répond, je suis vivant. Bonsoir. Quand tu vois, comme on a réagi, quand on a machine, tu vois les doumeurs, etc. Comme on a réagi, quand la machine, c'est mise à nos répons, de manière bête. Imagine si elle nous répond, de manière intelligente. Je pense à un dit plus sur nous que sur la machine. Donc, je espère très vite, peut-être, avant mes 50 ans, genre des 40. Avant mes 50. Merci Steve. Je pense que le pression, on va se faire une des plus précises et définition de HGIA et de ce que ça veut dire. Sur 2025, ça va être un sujet intéressant. Si tu pouvais avoir une question avec une hi-a du futur Steve, quels seraient ta première question? Alors, c'était une très bonne question. Je pense que je lui demande à rien. Moi, je serais un peu terrataire, en fait. Je lui demanderais pas la question qui m'ausé une heure d'autre. Peut-être que, d'un autre qui me vient d'exprimer en tout cas, c'est comment on peut atteindre les autres formes de vie dans le univers? Peut-être moi qui est un peu peut-être humain de me dire, j'ai pas d'autre sur le fait que y a de la vie dans le résolue univers. La question, c'est ce que j'aimerais, c'est pour voir interagir après de ça pas. Mais finir, mais voilà. C'est moi-dessus. Je suis en train de lire en ce moment sur un bouquin qui est extraordinaire qui s'appelle "Projet d'Harniaire Chance" de l'auteur de "Sole sur Mars". Et ça parle un petit peu de ça. Je te le conseille, c'est super bien. Je suis pas du genre, c'est les gens qui disent quand tu as 3 vaux au génie et ton milieu vue, c'est d'avoir plus de vue. Tu vas avoir un 4ème, un 4ème. Je suis un peu trop bonne élève là-dessus. Mais je comprends, en fait, si tu veux, ce que je veux dire, c'est que ce sera plutôt une question avec une fin. Parce que. Les utilités, quoi, en fait. Parce que j'aime bien. Je pense qu'il y a une. Peut-être parce que l'infinie me fait peur et que je pense que les plus belles choses sont aussi belles parce qu'elle finisse. Donc je ne te m'en verrai pas quelque chose de fuite en avant. D'assure. Mais peut-être que évidemment, le question je pourrais, c'est "OK, comme on fait une intelligence plus un. Mais c'est le fameux singularité, c'est comme on fait une intelligence plus élevé avec la tienne et puis. Il y a une phrase, il y a une blague qui dit, c'est quoi les derniers mots de l'humanité et d'un moment de réalité, c'est bon, qu'est-ce qui peut se passer et vas-y en me rendre. Tu vois. Il se passe pas ça. C'est ce qui regarde. Voilà. Et voilà. Je la connaissais pas. Et très bien. Steve, ton livre au film de "Science Fiction" préférait. Ah, moi clairement, contact. Contact, excellent. Et très loin. De très loin parce que si on passe la "Science Fiction", c'est la réponse humaine qui me. C'est un très américain, mais humaine qui me fascine et je suis absolument fan de Carl Sagan. Carl Sagan, c'est envie de. Pour certains, je l'ai voisinir. Mais clairement, contact. J'ai lu quelque part sur X que contact avait inspiré les premiers chercheurs sur les ALM, sur le transformer. Ah. Et qu'en gros, tu vois, en voyant le film, tu vois, il s'est. C'est la réfrédité de penser un petit peu au papier sur les transformer, ce qui est quand même très très lourd. C'est bien le cas. Ce qui est beau, dans ce film, pour moi, en tout cas, c'est toute la façon dont c'est déroulée et exapart de zéro. Et finalement, voilà, le langage universiel qui est mathématique, dans le cas de contact. J'ai envie de tout le monde regarder ce film, de 97 avec "Jody Foster", qui est l'éroïne. C'est une des. Et la réponse aussi. Voilà, humaine. Ça m'étonne pas. En vrai, ça m'étonne pas, parce qu'il y a une forme de. Tu sais, il y a des gens qui, des fois, voilà, apprennent les équations des transformer et disent, "Voilà, c'est des questions." C'est comme ça que tu sais, la pierre, c'est entendu le CD-Cone, pense. Je trouve ça. C'est poétique. Bon, je ne suis pas partite. C'est des cultistes de l'AGI, mais il y a une forme de poésie, clairement. Et complètement, faire penser le sable. Faire penser le sable, merci, c'est ça. Exactement. Magnifique. Steve, on a fait l'épisode record, 1h25, épisode record de la Vache, de Poirilla. Et BST, c'était passionnant. Ce soir que les gens se sont pas trop endormis quand même, est-ce qu'une en 25 je vous l'ai tenueur quand même? Non, je ne pense pas. Je pense qu'ils ont adoré, démarré l'année comme ça avec toi. C'est un édent 25 qui va être riche, en y'a. Pour ceux qui le souhaitent aussi, vous pouvez aller prendre des informations sur un ZML, même sur le GitHub de ZML. Oui, c'est vrai. C'est Open Source. Pas tout et Open Source, mais une grande partie est Open Source. Essayez-le avec plaisir. Si vous avez des bugs ou des trucs qui ne marchent pas, faites nous chier. On les corrigerait, il n'y a pas tout ce qu'il y a. Steve, merci beaucoup. C'était passionnant. Salut. Bravo. Vous avez écouté cet épisode de Controir Yajuskobou. Pour ne soutenir, merci de le partager à deux amis ou de le relaient sur les réseaux sociaux et de le noter ça qui est toi, avec le commentaire sur Spotify ou Apple Podcast. Pour finir, si vous voulez échanger sur l'illégénérative et ses applications, contactez-moi directement sur LinkedIn ou venez simplement au Meet Up mensuel Controir Yajuskobou. À bientôt.

Podcast Summary

Key Points:

  1. Le *training* (entraînement) correspond aux « cours » et l’*inférence* à l’« interro » : le modèle apprend sur des données pour générer des poids, puis on l’interroge sur des entrées inédites.
  2. L’inférence en production (ex. ChatGPT) consomme bien plus de calcul que le training, car un modèle entraîné est utilisé des millions de fois.
  3. DeepSeek (modèle chinois) rivalise avec GPT-4 et Claude 3.5 tout en ayant été entraîné avec 10 fois moins de *compute* (coût d’environ 5,5 millions de dollars), grâce à un raisonnement profond (« deep thinking »).
  4. Les GPU Nvidia évoluent
  5. La Chine est limitée aux GPU A100 (interdiction des H100), ce qui freine sa capacité de calcul, mais DeepSeek montre des performances élevées malgré cette contrainte.
  6. ZDML (start-up de Steve Morin) développe une stack open source d’outils pour l’inférence à haute performance en production, validée par Yann LeCun.

Summary:

Le podcast présente Steve Morin, fondateur de ZDML, qui explique les concepts clés de l’IA générative. Le *training* est comparé aux cours : on fournit au modèle des entrées et sorties attendues, et il ajuste ses poids. L’*inférence* est l’interrogation du modèle entraîné sur de nouvelles données, utilisée massivement en production (ex.

ChatGPT). Steve note que l’inférence consomme bien plus de calcul que le training, car un modèle déployé sert des millions d’utilisateurs. 5, grâce à un raisonnement profond.

Cela est d’autant plus remarquable que la Chine est limitée aux GPU A100 (interdiction des H100 américains). Steve évoque aussi l’évolution des GPU Nvidia : des A100 (révolution IA) aux H100 (meilleur pour le training), puis aux Blackwell B200 (deux puces assemblées, mais problèmes de physique et de rendement). Enfin, ZDML, start-up parisienne soutenue par New Wave, développe une stack open source pour l’inférence haute performance en production, validée par Yann LeCun.

Steve insiste sur l’importance de l’open source et de l’écosystème IA français.

FAQs

Le training, c'est comme les cours : on entraîne un modèle avec des entrées et sorties pour qu'il apprenne et génère des poids. L'inférence, c'est l'interrogation : on utilise le modèle entraîné pour répondre à de nouvelles questions.

ZDML fournit une stack d'outils open source pour faire de l'inférence à très haute performance en production, pour des modèles d'IA comme les LLM, à l'échelle de systèmes comme OpenAI.

DeepSync est un modèle chinois avec des capacités de raisonnement, aux performances comparables à GPT-4 ou Claude 3.5, mais entraîné avec 10 fois moins de calculs, pour un coût d'environ 5,5 millions de dollars.

L'A100 a révolutionné l'IA, le H100 est plus rapide en entraînement, et le B200 (Blackwell) assemble deux GPU en un pour gagner en puissance, mais il est vendu en rack et a eu des problèmes de fabrication.

Les exportations de GPU comme le H100 sont interdites en Chine, limitant les capacités aux A100 (génération N-2), ce qui retarde leur développement d'environ 5 ans par rapport aux États-Unis.

L'inférence écrase le training en volume de calcul, car une fois le modèle entraîné, il est déployé et interrogé bien plus souvent qu'il n'est entraîné.

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.