Go back

ChatGPT ne devrait pas pouvoir faire ça — Fabien Vauchelles

31m 51s

ChatGPT ne devrait pas pouvoir faire ça — Fabien Vauchelles

La transcription explore le monde du scraping de données et la guerre technologique entre les robots collecteurs d'informations et les systèmes de protection des sites web. Elle explique que le scraping, qui consiste à automatiser la collecte de données sur le web (comme les prix des vols), est une pratique répandue, notamment parmi les grandes entreprises pour surveiller la concurrence. En réponse, les sites ont développé des anti-bots sophistiqués analysant les adresses IP (pour bloquer celles des centres de données), l'empreinte du navigateur, et même le comportement de l'utilisateur (mouvements de souris, vitesse de navigation). Pour contourner ces défenses, les scrapers utilisent des réseaux de proxys, souvent issus d'appareils personnels (comme des smartphones ou Smart TV) via des applications, afin de masquer leur origine et imiter un trafic humain. Cette course à l'innovation crée un équilibre précaire, où chaque avancée défensive entraîne une nouvelle tactique offensive, soulignant l'importance économique et stratégique de l'accès aux données en temps réel.

Transcription

6154 Words, 34672 Characters

French
Il y a un truc que personne réalise, c'est que ChatGPT ne devrait pas fonctionner. Vous savez quand il va chercher des infos sur internet, sur Reddit ou LinkedIn? Eh bien, tous ces sites ont normalement mis en place des protections sophistiquées pour empêcher les robots d'y accéder. Et pourtant, ChatGPT arrive quand même à l'élire. Si ils arrivent, c'est probablement parce qu'ils ont des équipes de accueur qui ressemble à notre invité. Ce n'est pas une blague trouver des stratagèmes pour contourner ces systèmes antibots. C'est le métier sulfurieux de notre invité Fabien. Il est au premier loge d'une véritable guerre de la donnée qui ferrages sur internet. Une sorte de course à l'armement technologique pour distinguer humains et machines. Les sites analysent maintenant jusqu'à votre façon de bouger la souris, le temps entre vos clics même votre niveau de batterie pour démasquer les robots. Et aujourd'hui Fabien nous a préparé des démos pour nous présenter son arsenal parfois surprenant et nous plonger dans un chante-batay caché d'internet que personne ne connaît. Pourquoi déjà le scrapping le concept? Et pourquoi, en fait, même si on ne connaît pas forcément le terme, arrêtait tout le monde en fait, toutes les grandes entreprises en fond. D'où ça vient ce truc? De scrapping c'est la récupération de données. C'est collecté des informations sur un site web, les rambes de manière structurée pour pouvoir les utiliser. Je sais pas si tu t'aimes à faire des prédictions sur ce que tu veux. Où ça peut être pour ton business, typiquement, pour aller surveiller les prix, faire un comparateur de prix. Un comparateur de prix, en fait, il va les regarder tous les prix de tous les sites, dit commerce ou même de magasins physiques, que tu peux trouver sur internet. Et derrière, ils vont te dire "Vas dans tel magasin", parce que c'est le moins cher pour tel produit, etc. C'est un humain qui le fait, donc il vous sent à une table, il va les regarder, il va les regarder le prix, il va le noter dans un Excel, par exemple. A dessus du moment, tu dis "Ok, maintenant, on veut que ce soit automatique". Puisque notre système, c'est un comparateur de vol automatique, par exemple. - Oui. - Donc, quoi ça consiste d'automatiser le fait d'aller sur un site? - En gros, c'est tu vas aller reproduire le comportement de ton humain qui va aller regarder le prix, mais avec une machine pour le mettre, comme tu disais, dans un tableau Excel, ce genre de choses. Tu vas aller créer un programme, peu importe dans quelle language, qui va aller se connecter sur le site web, comme ferait l'humain et récupérer l'information. Sachant que le site web, généralement, il est prévu pour un humain. Donc, ce n'est pas forcément évident quand tu vas regarder le code, en fait, de la page, qui est, si tu regardes, comme le ferait une machine, c'est du HTML, c'est du CSS. Des fois, on va avoir du JavaScript, parce que, comme dire, la formation sera différée ce genre de choses. Donc, ce n'est pas évident. Et donc, la machine va essayer de récupérer l'information ou aller. - À l'origine, ça commence justement avec des premiers bottes de scrapping qui te permette à l'effaclement de. je te regarde et le code HTML, c'est qu'il bouge pas trop souvent. Et donc, tu peux repérer ouer le prix du vol. - Toujours même en droit. Et tu récupères l'information et ensuite, tu peux comparer avec différents sites. Et ça te fait au lieu d'aller à la main. Tu vas avoir même en droit, tes 15, biais d'avion, tu vas passer celui-là le moins cher. Je ne suis pas lié directement commenter sur le site. - Et rapidement, il commence à y avoir un problème. C'est que le site sur lequel il y a les vols, par exemple, ça peut le faire chier que tu récupères si donné en temps réel. Et donc, il peut commencer à essayer de se défendre. Donc ça, ça me le concept de l'antibote. - C'est ça. - Est-ce que tu peux nous expliquer en quoi ça consiste du coup? - En fait, ton exemple est super bien parce que je suis bossé dans une boîte qui fait exactement ça. Faut savoir que toutes les compagnies aériennes se protègent en fait des bottes. Mais aussi, en interne, une équipe qui va les récupérer les prix de la concurrence. Donc globalement, quand il y a une équipe scrapping, il y a une équipe en discrepping. - Tipe bleu et tipe rojet. - Exactement, dans la même boîte, il se parle en général. Par exemple, si tu connais le prix de la concurrence, tu as un pari Marseille qui va être, je sais pas, à 55 euros, tu as pu qu'elle proposer à 54 euros, puisque tu sais, tu l'as vu. Et à peu d'un heure qu'il suit, tu mets à jour en automatique, et donc l'autre du coup, il voit ce prix, il peut aller jusqu'à 53 euros. Bon, ça ne va pas descendre jusqu'à 0. On va dire, mais ça va effectivement pouvoir automatiquement baisser, sans qu'il y ait d'intervention humaine. Si tu bloques, cette récupération de prix, elle peut plus ajuster. Donc du coup, tu as reste concurrenciel sur le marché. Donc c'est vraiment un problème purement monopolisthique, en fait. C'est vraiment, je veux protéger mes prix, je vais éviter que l'autre, face moins cher que moi, donc je vais l'empêcher de scraper. En exemple, un technique différente. - Et donc, comment on empêche de scraper, par exemple? - Alors, c'est une grande avance sur, au début, quand on scraper, on pouvait directement se connecter, en fait, sur le site web. Alors, on peut récupérer l'information. Ensuite, ils ont commencé à regarder un petit peu comment ça se passait. Ils sont dit, "Ah, on va essayer de les bloquer les gens". Donc en général, les bots, ils tournaient sur des data-centeurs, effectivement sur des serveurs, tu as été scripte-pittons, tu as un serveur. Donc ça provenait du data-centeur, de l'adresse-y-pé, en fait, du data-centeur. Donc, si tu voyais une adresse-y-pé qui venaient, pas, en fait, une connexion ADSL, une connexion fibre, ou mobile maintenant, dans data-centeur, tu te dis techniquement, c'est pas un humain. Donc, il y a de grandes chances que tu bloques la personne. Donc, il y a des bases de données, en fait, qui te permettent de savoir, un tel adresse-y-pé, ça vient dans data-centeur, ou ça vient, en fait, d'une connexion fibre, etc. Et donc, je suis fait d'avoir ça. Tu peux coder rapidement dans un tibot de basique, et tu peux bloquer les gens. Donc, les premiers antibots, si ils ont commencé, pas regarder, tout est venu. Il y a des grosses guerres, par exemple, au Brésil, sur les sites de transport. Si tu viens pas du Brésil, c'est à pas une adresse-y-pé qui vient du Brésil, parce que tu peux géolocaliser l'adresse-y-pé, en fait. Tu ne pourras pas que c'est d'où c'est, ou à peut-être, une page blanche qui s'affiche. Donc, du coup, il te faut un endroit au Brésil pour faire croire au site que tu viens du Brésil, si tu veux récupérer les infos. Imagine de 20, tu es vendre des informations à un client qui va regarder ces concurrents au Brésil, et il va falloir que, depuis la France, que tu es des adresse-y-pé au Brésil pour pouvoir récupérer ça. Et ça, on appelle ça des proxies. C'est la première étape, ça a été de mettre en place des relais qui vont. Masquer la provenance du robot. Exactement. Et marxer la provenance du robot. Un proxie, les gens connaissent le concept du VPN, par exemple. Vous avez une pub dans VPN, le truc, et sans s'il vous téléporter, dans notre endroit, pour que vous puissiez accéder la Netflix. C'est la même chose. Mais, fois, 10, 100 000 par exemple, tu pourrais dire à chaque adresse, à chaque requête que je fais sur le site, je change d'adresse-y-pé. Un VPN, tu vas avoir une porte de sortie, peut-être 10 maximum, mais tu dois la changer à la main. Un proxie, tu peux carrément avoir un million d'adresse, en fait. Et tu peux, à chaque requête, changer d'adresse. Imagine, tu prends toutes tes adresses au Brésil, si tu utilises un VPN, en fait, le site va peut-être voir un million de requêtes qui viennent de la même adresse-y-pé, c'est-à-dire un VPN, ce genre de choses. Toi, tu vas pas faire ça, tu vas plutôt utiliser des millions d'adresse-y-pé qui vont se baser dans toute la zone, et derrière, en fait, le site va voir. Il y a plein de gens qui se connectent à mon site, qui font très peu de requêtes. De son point de vue, ça ressemble à beaucoup d'utilisateurs. Exactement. Quand il y a même, il se pose des questions parce qu'il vaut que ça y a un pic quand même, il ne peut pas tirer quelque part, il ne peut pas blaclyster une adresse-y-pé, parce qu'en fait, il est risquerait de blaclyster un client. Des vraies utilisateurs, en fait, le faux positif, c'est hyper dangereux. Dans les systèmes anti-bots, tu peux bloquer des vrais clients. Et donc, tu perds des ventes et c'est dommage. Le système allergénial de la. Les sains de DP qui lui attaquent le server, mais elle vient d'où, ces IP, c'est quoi, en fait? Parce que tu le tombais, tu l'as dit, si c'est une IP de data center, ça va être détectée. Elle est détectée. Donc, elle vient d'ailleurs. Alors, ça, c'est le point très intéressant. Il y a globalement une 10-12 ans. Les adresse-y-pé, les fournisseurs, c'était un peu obscure. Depuis, ça s'est vraiment clarifié, c'était clairement des botnettes. On va pas se le réé, les gens infectaient des machines, donc des PC, c'est des botnettes. Il y a eu des très, très grosses affaires, toutes ces sociétés elles ont fermées. Maintenant, parce que fournisseurs de proxy, ils vendent un SDK, souvent, où une application, il y a deux manières. En fait, la première, donc, le SDK, tu l'installe dans une application de jeu, etc. Et donc, l'utilisateur, quand il accepte de jouer gratuitement dans toutes les conditions générales, il y a un jeu, partage, ma connexion. Donc, frérattention à un, quand on installe ce type d'application, on liera toutes les conditions et on liera tous les droits, mais il y a potentiellement ce type de SDK. Donc, légalement, on a accepté. Ça, et ta la deuxième partie, c'est carrément des applications, en fait, que tu mets, tu installes, et tu volontairement vas partager, en fait, à bon de passante, contre des euros. Donc, tu vas dire, voilà, le. - L'outa connexion. - Tu l'outa connexion, voilà, pour 500 cm de gigabit, tu vas avoir effectivement. tu vas être rémunéré de l'autre côté, ils vont revendre ce gigabit 20, 30, 40, 7 dollars, en fonction, en fait, des applications. Donc, t'as deux manières. On va dire que c'est un petit peu équilibré en termes de sourcing d'adresse IP. - Ok, déjà, c'est hyper mort, parce que on ne se doute pas que derrière les bots pour qu'ils soient indétectés. Ça va passer par des millions de petits appareils qui sont peut-être des gamins en train de jouer à des jeux vidéo, ou des j'imagine tout ce qui est adouert, donc les. - Ça va. - En tant que stade, c'est les toolbar ou les trucs comme ça, j'imagine que c'est. - Smart TV, aussi, maintenant. - Les Smart TV. - Voilà, bien, toutes les Smart TV, package-ac des applications par défaut, hein. - Ça y a? - Voilà, t'as. Il y a des fournisseurs de proxils, leur réseau principal, la principesse, c'est des Smart TV. - Mais qui sont des Smart TV pas chers, et au-du-coup, dans les conditions, il y a marqué qu'on peut utiliser d'acquanication. - Non, c'est que t'as des applications, parce que c'est de l'endroïd. Donc, du coup, - C'est énormément d'applications qui sont dessus et derrière, ça tourne en fond et tu as du partage de collection. - C'est ouf. - Non, non, c'est une fois que tu t'en comptes, bon, tu fais attention à ce que tu installes sur ton téléphone. - C'est très ouf. - Ça permet de contourner un premier blocage qui est le blocage par IP. Qu'est-ce qu'il y a d'autres comme blocages possible de l'autre côté? Maintenant, attaque défense. - C'est super intéressant parce qu'en fait, l'adresse IP ne fait pas tout. - C'est-à-dire ensuite, t'as plein de choses. Il va regarder en fait exactement comment l'information arrive jusqu'au serveur. Quand tu vas les récupérer une page web, en fait, il faut vraiment partir de la base au niveau des protocoles réseaux. Ensuite, on va avoir tout ce qui est protocole de chiffrement. Le petit cadenat d'encreme, la connexion de l'escalier, ensuite on va avoir le protocole qui envoie la page HTML, le protocole HTTP. Et ensuite, on va avoir l'exécution du Java script. Et ensuite, on va regarder comment l'utilisateur se comporte sur le site web. Parce que si sur Amazon, tu connais par cœur les URLs des produits, c'est pas possible. - Si le serveur, il voit que tu demandes 150 pages différentes avec chaque fois, c'est le produit direct. C'est plus bizarre que tu es le catalogue d'ont-à-tête quand même. - Exactement. Et puis, c'est pareil. Tu fais ta recherche. Tu regardes tous les produits qui existent. Tu ferais un site du quand même. - C'est typiquement ce genre de warning. - En fait, exactement. - Exactement, comportemento. Et si tu reviens sur les couches réseaux, la partie chiffrement, c'est super intéressant. Quand tu utilises le protocole, donc TLS, le petit cadenat d'encreme, tu vas envoyer plein d'informations directement au serveur. Et en fait, la manière où tu vas chiffrer ta connexion, en gros, tu vas envoyer tous les protocoles de chiffrement que tu supportes. Et cette liste, c'est très bête. Ça correspond à l'implementation de ton navigateur. Donc, Chrome, la dernière version de Chrome, n'envoie pas la même liste que la version d'avant. Et ainsi, tu suites pareil pour Firefox, pareil pour Internet Explorer, pareil pour Safari. Donc, tu sais, en fait, si ces creux qui viennent, quelle version, c'est, à peu près. Tu peux détecter ça. - Pour comprendre un peu le langueux, la tous les bottes dont on a parlé des scripts pitons, les tout comme ça, ils ne utilisent pas un navigateur. Il veut dire que eux, ils se place à une couche d'ondes sous. - C'est ça. - Ça paraît être un peu overkill, en fait, quand ils pensent. Donc, ils se place à la couche d'ondes sous. Ils envoient tout simplement la même requête, une enquête identique, est-ce que feraient un utilisateur qui scrolls sur Amazon? Et ils récupèrent comme ça, la page HTML, ils ne la fiche pas. Ils n'ont pas besoin de la fiche, puisque c'est une machine. Donc, ils la partent, ils récupèrent les infos, ou ça. Donc, ça, c'est ce qui se faisait. - Alors, si je reviens sur les parties réseaux, en fait, tu vas regarder tous les signaux, pareil, le protocole HTTP, et tu vas vérifier que tout est cohérent. C'est bizarre, en fait, d'avoir une signature d'un. Comment dire, d'un crôme sur l'inux. Et quand tu vas regarder en JavaScript, va dire, bah, c'est du Windows ou autre chose. - Un des incoherences, en fait. - Exactement, c'est des inco, en fait. C'est des incoherences, c'est bizarre. Voilà. Quand je regarde vraiment avec du JavaScript, ce qui peut être un peu plus compliqué, en fait, à imiter, j'ai du Linux, alors qu'ils m'ont envoyé une signature de chiffrement, de Windows, de quelqu'un qui essaie de se envoyer une fausse signature. Donc, du coup, ça va allumer, en fait, une alerte et ainsi de suite. Et t'es jamais bloqué directement. C'est-à-dire que c'est une petite alerte, plus une autre, plus une autre, et en fait, c'est un score chez les Antibots. Ce qui fait que, la somme de tout ça, fraque, tu seras bloqué, on va t'envoyer un captur, à vérifier, etc., etc., etc. Effectivement, ensuite, à la partie comportementale, en JavaScript, tu vas regarder comment ils bougent la souris, c'est magnifique. Tu peux voir, est-ce que la personne, elle a des mouvements linéaires, personne ne bouge sa souris de manière linéaire, un bot fait ça, en fait, un humain, il va plutôt avoir des arrondis, ce qu'on appelle des courbes de baisier. Donc, je regarde si les captures de point de souris intervalles réguliers suivent une courbe. Sinon, petit alerte, plus en suite, est-ce que tu détèques des signes d'automatisation? Est-ce que, par exemple, la navigation dans les pages, il légèrement trop rapide et ainsi tu es donc ça, plus ça, plus ça, plus ça, à la fin, t'es bloqué. Et donc, tout cet ingénierie qu'il y a du côté des protecteurs de la défense, on la retrouve aussi, donc nécessairement, comme vous vous en doutez, du côté des attaquants. Bah oui, c'est pas drôle, sinon. Voilà, donc le grand jeu est dévité de comprendre ce système, déjà, d'une certaine merde, de le rétron ingénierie, et de comprendre comment baisser son score. Ouais. Et donc, c'est quoi les techniques pour éviter tout ce que tu viens de montrer? Mais c'est possible évidemment. C'est possible, il y a des petites démon. Ça fait ça. Ça fait ça. En fait, il faut expliquer que tu as fabriqué, enfin tu vas nous expliquer, tu as fabriqué un faux site pour les besoins des démon, justement pour éviter des problèmes légaux, évidemment. Mais tu as fabriqué un faux site, donc tu fais présent le nou. Alors, c'est globalement un site où tu as un peu un trip of theizer, tu vas avoir un moteur de recherche, quand tu clique sur le bouton de recherche, tu vas avoir une liste d'hôtels. Bon, voilà, il y a 50 hôtels à récupérer sur Paris. Et notre but, ça va être de capturer, en fait, tous les commentaires sur ce site, sur chacun des hôtels. Imaginons qu'on va entraîner à un bot, plutôt à un algorithme, pour écrire des reviews, et pour analyser aussi si un hôtel est bien ou il est pas bien. Ou est-ce que je vais partir en vacances? - Oui, ok. - Alors évidemment, c'est en HTML, donc on va utiliser, en fait, un framework. Un framework, un des frameworks les plus utilisés, c'est le framework scrappy. Ça sert, en fait, à faire les requêtes, à gérer, à recommencer les requêtes, si elles ne marchent pas, à faire aussi l'extraction des données, parce que dans le HTML, c'est un certain nombre de places, en fait, la donnée. Et on va utiliser ce qu'on appelle des parsœurs CSS, des parsœurs, des expressions régulières, genre de choses, que tout le monde adore. Et ça, en fait, tu vas pouvoir localiser l'information et autant de manière automatique. En gros, toute la galère est abstractisée dans ce framework, open source. - Et donc là, on a la possibilité d'aller facilement récupérer ces informations. Maintenant, avec tout ce que tu as dit, on imagine qu'il y a un antibody. - C'est ça. - Qui fait donc du finger printing, puisque c'est le mot de. - Exactement. -. à y va comprendre les toutes les correlations et établir un score, etc. - Comment on fait, nous, attaquons? - Alors, la première chose qui va regarder, c'est ce que je parlais, pour faire cette finger print, vous regardez l'adresse IP. En gros, on va connecter notre scrapper. Donc là, voilà, on a le scrapper qui impitons, c'est pas très compliqué, en fait. Il va aller parcer la liste des hôtels. Une fois qu'il allait liens, en fait, de tous les hôtels, il va se connecter à chacun des hôtels, il va extraire le nom, l'imail et le commentaire. Donc là, on est bloqués par une protection basique, sur l'adresse IP, on va vérifier qu'on ne va pas trop le requête à partir cette adresse IP. Donc un classique limite du nombre d'oracles. On se rend à faire, on va démarrer plein de proxies aux États-Unis. Donc là, j'ai un outil qui permet de démarrer et de gérer le trafic sur ces proxies. Donc on a démarré une centaine aux États-Unis et on va connecter le scrapper sur cet outil. Et maintenant, en fait, le trafic, il va passer par ça. Voilà, là, en 5-line de code, je connecte l'outil aux scrappers existants. Donc tu touche à rien, ça c'est cool. Et on va router tout le trafic en passant par les États-Unis. Ça a un peu plus long, mais ça va passer par les connexions. Et là, effectivement, le saveur ne brosse plus. Exactement, donc tu récupères ça. Les requêtes fonctionnent, tu n'es plus bloqués parce que tu vas faire très peu de requête par adresse IP. Donc ça, c'est la première protection basique auquel on discuter. Ok. Là, maintenant, on active un antibody. C'est ça. Et c'est ce qu'on appelle la partie finger print. Donc c'est le même site, mais avec cette protection plus avancée. C'est ce qu'on va retrouver globalement maintenant sur les sites WAM. On va retrouver sur Google. Typiquement, maintenant, Google a changé la manière de faire des recherches. Il faut exécuter du Gavre-Script. Donc là, c'est ce qui met l'antibote. Il y a attention. Je trouve pas ta finger print. Donc faire des requêtes basiques, ça marche plus. Donc maintenant, on va devoir demander à ce scrapper de démarrer des crômes et de se connecter comme un vrai site web. Parce qu'en fait, on le voit là. En fait, un site web, quand tu vas se connecter aussi, il va charger le HTML, mais aussi le CSS, les images, le Gavre-Script. Il va exécuter Gavre-Script. Et là, ce qu'on voit, c'est qu'il ne fait pas que récupérer l'information. Il faut aussi en envoyer régulièrement un interval. Par exemple, là, c'est toutes les 10 secondes. Il en voit ce qu'on appelle une empreinte digitale. Donc là, il en voit la vraie timezone, le vrai user agent. Donc si on en a mis un faux dans des coups chants de sous, il va regarder, il va nous bloquer. Là, ce qu'on a dit, c'est que, finalement, le plus simple, pour ressembler un humain, il dise "cromb", c'est de. Utilisez "cromb", aussi, en fait. C'est ça, mais sauf que c'est le robot qui va utiliser "cromb". Voilà. Et donc, on le démarre et on va le piloter, le de manière automatique, et quoi. Tu cliques là, tu rentres là dans ce chandre-chère. Tu récupères cette information, s'il y a ça, tu vas cliquer là, comme frais, en fait, un humain. On pourrait se dire aussi, mais ouais, c'est super intéressant. Je pourrais faire ça par défaut au lieu de corner directement des requêtes, sauf que "démarrer cromb" à chaque fois, et on démarre pas dix, mais imaginez que tu veux récupérer un million de données en 10 minutes. Tu vas démarrer un million de cromb. Donc, tu vas démarrer ça sur des serveurs. Tu vas en démarrer, je sais pas, 10. 12 par serveur, tu vas démarrer 100 000 serveurs, donc 100 000 serveurs ça coûte. Et ensuite, donc aussi, c'est une question de coup. Donc c'est ça aussi qui est très intéressant, en fait, dans la partie "bot" en "t-bot", c'est-à-dire qu'ils vont pas forcément s'il nous bloquer, mais ils vont essayer ce que le coup à la requête pour le "bot" soit de plus en plus élevé. De main, toi, si tu veux faire Google, parce que Google a bien commencé à indexer le "web" un jour. Donc indexer, en fait, quand un moteur de recherche, indexer le "web", c'est se craper ce "web". C'est se craper, bien sûr. Donc si demain, tu veux créer un moteur de recherche, et bien les niveaux de protection, les niveaux d'investissement, en fait, c'est plus les mêmes, de 15 ans, il y a 20 ans. Donc du coup, c'est pas possible, en fait. Google ne serait plus possible dans les conditions de aujourd'hui, et donc typiquement, dans les gens qui sont devenus très bons, en se crapping, et je ne vous imagine que je suis open et high, chez anthropiques, chez Google et les compagnies, par exemple, eux-mêmes sont prendre des experts du scrapping, parce qu'ils doivent avaler tout-ui, qu'ils ont avalé tout-ui qui pédia, on sait que, enfin, on se doute fortement que OpenAI pour entraîner Whisper à avaler tout YouTube, ou globalement, c'est super. Et on le sait, notamment, parce qu'il y a des hallucinations du modèle qui a rajouté des "abonne-toi". Donc là, tu sais, d'où la donner vient. Pour ces la. Voilà, les OpenAI anthropiques. Ça ne sait que ces coeurs, donc, de leur fonctionnement même de leur travail, à la fois, au début, faire un date des dates à cette d'entraînement. Ils ont des équipes interne, en fait. Et à la fois, on en a un peu parlé, mais derrière, dans le produit en lui-même, des confets des recherches web, il y a aussi du scrapping qui a lieu, en fait. Tu te le mets en fait, comment, quand tu fais une recherche sur ChatGPT, ou sur Cloud, il arrive à se connecter à LinkedIn, qui est très bien protégé. Donc, tu sais très bien que, soit LinkedIn a autorisé des passages, j'ai vraiment un doute. Soit effectivement, ils sont des bonnes équipes de bots, disparaît pour Reddit, Reddit, depuis que les LLM ont à se pire et Reddit, en fait, maintenant, c'est très compliqué de récupérer les données sur Reddit. Enfin, ils sont rajoutés pas mal de protection, mais les LLM arrive toujours à s'y connecter. Donc, ils ont aussi des équipes en interne qui ont joué au jeu du Sharia et de la soirée. On s'en rend pas du tout compte. C'est à dire qu'on s'en part évident que, la ChatGPT s'est accédée à Reddit et LinkedIn. Mais quand tu le dis, il y a un truc qui s'est produit que tout le monde n'a pas forcément sui, c'est que, à l'air du coup, où la donnée est devenue, elle était déjà précieuse. Mais sa valeur sur le marché a été décuplée depuis les LLM. Et bien, toutes ces sociétés-là ont fermé leurs portes. Donc, typiquement, Reddit avant, c'était assez facile de récupérer les données. Ils se battaient pas beaucoup contre les bots. Et bien, aussi, à le moteur de recherche, en fait, il y a une grosse révolution. Ce qu'on appelle les "Serve API", les "Search Engine API". En fait, tu vas te connecter pour faire des centaines de recherches. Parce que tu peux pas le faire toi-même sur Google, il va te bloquer. Donc, il y a des gens qui étaient spécialisés là-dedans pendant des sociétés qui te vendaient des crédits pour pouvoir faire des recherches sur Google. Et Google, du coup, jour au lendemain, en fait, au lieu de faire des simples requêtes sur le moteur de recherche et d'avoir un antibot très basique, et passer en mode "Exécution de Java Script", donc il faut démarrer un Chrome, etc. Avec un antibot assez poussé. Et donc, toutes ces sociétés du jour au lendemain, ils n'ont pas pu répondre en fait à leurs clients. Et donc, il y en a beaucoup qui sont en train de fermer et d'autres qui saient de surmonter, en fait, cette vague, parce qu'ils peuvent plus faire autant de requêtes, en fait. Parce que évidemment, ils sont dans une course contre-openaïaïe, contre les autres aussi. Les outils qui ont pour contrer, c'est. Ok, notre savoir-faire sur la recherche. Donc, on vous dépendait. On le ferme. Maintenant, il est derrière des portes. Après, on a toujours dans ce fameux jeu du chat de la souris, la possibilité d'en regarder comment ils font derrière, et toujours aller. Le jeu du chat de la souris n'est pas mort. Non, il est pas mort. Et ça qui est drôle, parce que ça se embêtrait. Une excellente transition. Puisque, justement dans ce temps, ce nouvel era, on a parlé de ces stratagèmes, et c'est pour ça que j'aime bien l'esprit du hacker, ce qui a toujours un espoir à la fin. Tu peux toujours douiller le chat. Et il y a une douille. Et typiquement, on a parlé des systèmes de défense les plus avancés. Par exemple, ou au pied, là-t'a carrément un navigateur. Donc, tu te dis que c'est fini. Et en fait, non, ils font du comportemental. Ils vont vérifier comment tu te déplace avec des lias potentiellement, qui vont vous voir si tu es humanoïde ou pas trop. Et bien, même ça, il existe des techniques pour les contourner. Exactement. Et en fait, on peut utiliser de lias, même même, peut-être, pour bypasser les lias. Ça, c'est très intéressant. En fait, il y a plein de techniques qui permettent de modifier le comportement, et le rendre de plus en plus difficile à lire et limite de manière invisible. En fait, là, par exemple, on va injecter, en fait, on a une affectation de variable à égal dix. Et bien, on va rajouter plein de codes qui sert à rien, ce qu'on appelle du code mort. Alors là, c'est un tout petit exemple, mais on pourrait le faire, fois 1000, fois 100. Donc, ce qui veut dire avoir un paragraphe entier et en fait, ou juste trois caractères servent. Mais tu sais pas lesquels. Et donc, du coup, tu combine ça avec plein de dôres techniques et quand tu vas ouvrir ton code, et bah, wow, tu comprends rien. Après, mon grand adat, c'est de prendre tout le code de l'antibote et de le mettre dans le class sonnet. J'ai pris un antibote commercial, récent, de y avoir globalement un mois, la version d'un mois. Tu le codes, tu m'apprends, qui te demandent de déopfisquer d'expliquer ce que le code veut faire. Et là, si tu prends cette version de Claude Sonnet, il te dit, "Ah, bah, je peux pas, c'est une protection commerciale." Parce qu'ils ont implementé des barrières. Parce que oui, anthropique a décidé que le reverse globalement ne serait pas bien. C'est mal. Et il faut pas faire du reverse. Comme eux, ils font. Exactement, c'est clair. Donc, c'est. Du coup, on va dire des notes techniques. On va dire, c'est plutôt Windsorfe, qui permet d'utiliser le modèle que tu veux. Donc, on va toujours utiliser Claude, mais je pense qu'ils ont pas de barrières. C'est un point d'accélérer, mais là, globalement, l'idée, c'est le prompt. C'est un point un peu complexe. Il lui fait créer un rapport descriptif de comment c'est opposé. Quelles sont les signaux qui capturent les techniques d'analyse de la souris ce genre de choses? Donc, j'ai découvert plein de trucs là-dessus. Comment ils se protègent de sites en train de faire du reverse engineering? Ce qu'on appelle l'antit "temporing". Donc, live, tu peux injecter des choses et détecter que tu en train de faire de les personnes génériques. Et ensuite, et là, j'ai 15 minutes, j'ai un rapport sur un antiboute commercial du marché. Donc, en gros, une semaine, tu as analysé tout le marché, on va dire. Et qu'est-ce que tu as découvert en analysant justement ces systèmes antibotes de façon de faire qui sont super intelligentes? On parlait des mouvements de la souris. Ces bouls conceptes de le dire, faut analyser, que ça suit des cours, etc. Mais mathématiquement, comment tu l'implémentes? Et là, tu vois comment ça me plémentait. J'ai découvert aussi des nouveaux signaux. C'est-à-dire que tu vas dans un canne 20, petit bout de page web, mais caché invisible à l'utilisateur, tu vas dessiner en fait des cartes et des émotigiles, des ronds superposés, des formes 3D. Et donc, en fonction du modèle de ta carte graphique, il ne va pas dessiner la même chose. Donc, si tu regardes ensuite bit-à-bit, en fait, ce qu'est fait, tu fais une signature de ça, mais en fonction de sites soulignus, que tu utilises à une video, tu utilises à un intel, c'est de toute cette combine, ce sera différent. Tu peux détecter le GPU, qui est typiquement ce que tu utilises sur un serveur, il n'y a pas de cartes graphiques. Donc, tu penses que j'avas cripement, c'est quoi le modèle de ta carte graphique? Et donc, tu peux fêquer ça et dire à la place de renvoyer rien, renvoyer un Nvidia GTX, ma chinchose, etc. Ok, très bien, tu m'as dit que tu avais ça. Maintenant, je suis une signature printe. Et bien derrière, j'ai rien du tout. La flague. C'est même aussi, qui rend le développement d'antibot, plus facile, etc. Toit-et aussi du côté scripting, pour aller péter les plus gros solutions du marché, potentiellement tout seul, juste parce que tu as un clod de super pouvoir qui t'aide. Et comment, du coup, c'est quoi les tables d'après, de ton point de vue sur le contournement, sur le. C'est en fait dans le scrapping, en général, les sociétés ne le scrappent pas ainsi, de sites, elles ont scrap des centaines, en même temps, parce qu'ils récupèrent à fond des comparaisons, ce genre de choses. Et même des fois, à les sociétés, ils ont 1 000, 2 000 scrappers qui t'ont tous les jours, et ils ont une équipe pour maintenir ça, parce que les sites changent, voilà, tu changes, en fait, des balises, les sites rajoutent des protections d'ibot, et ainsi de suite, ou alors, on des versions différentes du site. C'est-à-dire qu'ils ont une version A, quand ils détectent un bot, ils mettent une version B, ce genre de choses, c'est plus la même. Ils ont une version C, et tu peux défouir avoir 10 versions de sites, en fait. Et donc ça, en fait, ça prend un temps fou à ces équipes, de ces gens que tu payes, et en fait, c'est le gros problème du scrapping, c'est l'intens. Et c'est ça qui est magnifique, c'est que c'est un énorme problème lié au scrapping, qui coûte beaucoup d'argent et qui est très compliqué. Et en train, être résolu, c'est ça, par l'IA, en fait. C'est ça, le système, il va se comporter comme un humain à un développeur. Ça dit, il va débugger le site, il va débugger le programme. Il va regarder où ça pète, il va regarder pourquoi ça pète, et il va appliquer un correctif, il va tester si le correctif marche, si ça marche pas échange, et ainsi, tu es jusqu'à ce que ça marche. Donc là, par exemple, on en train de charger un site, le site APT, parce qu'ils ont rajouté une colonne dans un tableau, il a récupé un plan de donner, etc. Donc là, je vais en mettre un prompt, qui va lui dire d'utiliser un serveur MCP et de récupérer tout en temps d'instruction pour faire du debugging. Donc, prompt assez gros, mais surtout d'utiliser ce qu'on appelle un inspecteur, qui va organiser les requêtes. Donc en fait, c'est une sorte de proxie qui s'installe en lequel qui va s'injecter dans le scrapper, qui va organiser les requêtes. En fait, il fait ton job. - Bah, la fin, le programme va automatiquement corriger, trouver les erreurs. Et en fait, t'as un programme qui va se corriger tout seul. Donc, imagine, t'as un système qui analyse. Enfin, le fonctionnement du scrapper de monitoring, qui va. Bah, celui-là, il a casé automatiquement, t'envoie un GitHub Actions, qui va lancer ça, qui va corriger, qui va modifier code, qui va faire une pouvaier-coise sur GitHub, et qui va dire développeur, "Ah, ça pété juste revois, stop play." Et puis, ça va être mergé et limite. C'est un score de confiance suffisamment haut, bah tu merges automatiquement quoi. - Et en fait, c'est ça qui est beau si on rique la pétule un petit peu. Quand on reprend par exemple l'exemple du tout début sur le comparateur de vol, où tu vois là-dessus, vous voulez. - Au début, on s'est dit comment on fait pour limiter un humain le plus fidèlement possible qui ouvre un englet qui va retrouver le prix, etc. Et bah, les modèles de l'aujourd'hui, si on a fait la boucle complète, soit capable de faire littéralement comme l'humain, c'est-à-dire, est-à-pas un trouver ou est le moteur d'enverses, faire la couririe à l'intérieur, trouver le bouton, cliquer sur le litème et récupérer le prix. L'avenir, c'est aussi peut-être que la partie botte est vachement plus résiliente et intelligente entre guillemets. Donc un peu d'espoir pour les boteurs, finalement. Si ça vous a intéressé, je vous conseille vivement notre interview d'une chercheuse Anya qui nous a présenté une question assez peu abordée et pourtant préoccupante de l'auto-empoisonnement des IA et de ce qui pourrait arriver dans quelques années. C'était dans cette vidéo.

Podcast Summary

Key Points:

  1. Le scraping de données est une pratique courante pour collecter automatiquement des informations sur des sites web, utilisée par exemple pour des comparateurs de prix.
  2. Les sites mettent en place des systèmes anti-bots sophistiqués (analyse d'adresses IP, empreintes numériques, comportements de navigation) pour bloquer l'accès aux robots.
  3. Pour contourner ces protections, les scrapers utilisent des techniques comme les proxys (masquant l'origine des requêtes) et l'imitation du comportement humain (mouvements de souris, navigation réaliste).
  4. Il existe une véritable "course aux armements" entre les scrapers et les défenseurs de sites, avec des enjeux économiques majeurs, notamment dans des secteurs comme l'aviation.

Summary:

La transcription explore le monde du scraping de données et la guerre technologique entre les robots collecteurs d'informations et les systèmes de protection des sites web. Elle explique que le scraping, qui consiste à automatiser la collecte de données sur le web (comme les prix des vols), est une pratique répandue, notamment parmi les grandes entreprises pour surveiller la concurrence. En réponse, les sites ont développé des anti-bots sophistiqués analysant les adresses IP (pour bloquer celles des centres de données), l'empreinte du navigateur, et même le comportement de l'utilisateur (mouvements de souris, vitesse de navigation).

Pour contourner ces défenses, les scrapers utilisent des réseaux de proxys, souvent issus d'appareils personnels (comme des smartphones ou Smart TV) via des applications, afin de masquer leur origine et imiter un trafic humain. Cette course à l'innovation crée un équilibre précaire, où chaque avancée défensive entraîne une nouvelle tactique offensive, soulignant l'importance économique et stratégique de l'accès aux données en temps réel.

FAQs

Le scraping est la récupération automatisée d'informations sur un site web, structurées pour être utilisées, par exemple pour surveiller des prix ou créer un comparateur.

Les sites utilisent des protections pour empêcher le scraping, souvent pour des raisons concurrentielles, comme éviter que des concurrents ajustent leurs prix en fonction des données récupérées.

Ils utilisent des réseaux de proxies avec des millions d'adresses IP, souvent issues d'appareils personnels comme des smartphones ou Smart TV, pour masquer leur provenance et imiter des utilisateurs humains.

Ils analysent des signaux comme la signature de chiffrement TLS, le comportement de navigation (mouvements de souris, vitesse de clics), et la cohérence entre les couches réseau pour attribuer un score de risque.

Le fingerprinting consiste à collecter des données uniques sur un navigateur ou une connexion (comme la version du logiciel ou les protocoles supportés) pour identifier et bloquer les robots.

Ils utilisent des frameworks comme Scrapy pour automatiser le scraping, intègrent des proxies pour éviter les blocages IP, et ajustent leur comportement pour imiter des humains, par exemple en simulant des mouvements de souris réalistes.

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.