LJB a écrit :
Il n'est pas si souple que cela. Il me demande de lui fournir d'abord le texte des 1007 pages, car il ne peut pas l'extraire directement et intégralement du forum à ma place. J'ai essayé de passer par un aspirateur. Le problème est qu'il aspire tout et que cela devient vite monstrueux.
Je continue à chercher.
Tu es sous Windows je suppose ? Tu peux utiliser dans le terminal (cmd.exe) une ligne de commande de ce style :
for /l %i in (1,1,1007) do curl https:--www.guitariste.com/forums/groupe-artiste,le-rock-japonais-feminin-essentiellement,510679,%i0.html -o %i.html
et pour la première page :
curl https:--www.guitariste.com/forums/groupe-artiste,le-rock-japonais-feminin-essentiellement,510679.html -o 0.html
Ca télécharge toutes les pages html du topic sans les images dans un fichier par page, suivant un compteur de 1 à 1007. La première page étant nommée différemment, il y a une commande différente. Attention le nommage des pages html commence à 0, 1007 est donc la page 1008.
Attention le forum met en forme les liens, il faut remplacer -- par //.
Ensuite pour faire manger ça à une IA je ne sais pas, trop moderne pour moi
Zukyun! Bakyun! Dokyun! Wow! Moe! Moe! Kyuuuuuuuuun!