F FileShrink

Convertir un HTML en TXT — retirer les balises et garder juste le contenu

Déposez un fichier HTML ci-dessous et obtenez un fichier texte brut propre. Le parseur DOM intégré du navigateur extrait uniquement le contenu lisible. Tout reste sur votre appareil.

Votre fichier est traité entièrement dans votre navigateur. Rien n'est envoyé.

Les fichiers HTML sont géniaux pour l'affichage mais horribles pour le traitement de texte. Si vous voulez passer un article à un modèle de langage, compter les mots d'une page web, indexer une archive avec grep, ou copier du contenu dans un éditeur texte, les balises HTML gênent. La conversion HTML-vers-TXT retire le markup et retourne juste le contenu lisible — les mots qu'un lecteur verrait vraiment s'il ouvrait la page dans un navigateur — comme un fichier .txt pur prêt pour n'importe quel outil texte.

Notre convertisseur utilise le DOMParser intégré au navigateur pour parser votre HTML, puis clone le body dans un élément caché et lit son innerText. innerText est plus intelligent que juste retirer les balises : il respecte les frontières block-level en insérant des sauts de ligne, ignore les éléments cachés, et décode les entités HTML automatiquement. Le résultat est le même texte que vous verriez en sélectionnant tout et en copiant depuis une fenêtre de navigateur. Pas d'upload, pas d'aller-retour serveur, pas de service d'analyse externe.

Comment convertir un HTML en TXT en 4 étapes

  1. 1

    Sélectionnez votre fichier HTML

    Déposez le .html ou .htm dans la zone ou cliquez pour parcourir. Tout document HTML standard est accepté.

  2. 2

    Laissez le DOMParser extraire le contenu

    L'outil parse le HTML en DOM, isole le body, et lit l'innerText rendu — le même texte qu'un lecteur verrait sur la page.

  3. 3

    Vérifiez le résultat

    Le panneau de résultat affiche la taille de la sortie texte. Elle devrait être une fraction minuscule du HTML d'origine parce que tout le markup est parti.

  4. 4

    Téléchargez le fichier TXT

    Sauvegardez le .txt sur votre appareil. Passez-le à un script, copiez-le dans un éditeur, ou archivez-le dans un dossier grep-able.

HTML vs TXT : document rendu contre contenu brut

Le HTML est un format de document rendu — ses fichiers contiennent du markup qui dit au navigateur comment afficher la structure, les liens, les images, les styles et l'interactivité. Un fichier texte brut n'est que le contenu lisible sans structure au-delà des sauts de ligne. Convertir HTML en TXT est l'opération de jeter tout ce que le navigateur rendrait visuellement et de garder uniquement les mots, dans à peu près le même ordre de lecture. C'est une conversion avec perte dans le sens où vous perdez les liens, les images, les titres (comme éléments stylés) et tout ce qui dépend du rendu visuel. Mais pour les workflows de traitement de texte — analyse, recherche, alimentation d'un autre outil — cette perte est exactement ce qu'on veut.

Quand convertir un HTML en TXT ?

Alimenter un article web à un modèle de langage

La plupart des modèles de langage veulent du texte brut, pas du HTML mélangé avec des balises. Convertir d'abord donne une entrée propre que le modèle gère correctement sans tokeniser des fragments de balises.

Faire tourner de l'analyse de texte sur une page web

Comptage de mots, analyse de sentiment, extraction de mots-clés et scores de lisibilité marchent tous sur du texte brut. Retirez d'abord le HTML et l'analyse tourne proprement sur le contenu réel.

Indexer un dossier d'archives HTML avec grep

grep et ripgrep travaillent sur du texte brut. Convertir une archive HTML en .txt vous donne un corpus cherchable sans modifier les originaux.

Copier le contenu d'un article dans un éditeur texte

Parfois vous voulez juste le texte sans que le HTML gêne. Une version .txt est prête à coller dans n'importe quel éditeur, script ou app de prise de notes.

Questions fréquentes

Pourquoi innerText plutôt que textContent ?
textContent retourne chaque caractère de chaque nœud texte sans aucune structure — y compris le contenu des balises <script> et <style>, qui est généralement du bruit. innerText simule ce qu'un utilisateur copierait s'il sélectionnait tout sur la page rendue : il respecte les frontières block-level (en insérant des sauts de ligne entre paragraphes), ignore les éléments cachés, et décode les entités HTML. Le résultat est bien plus lisible.
Les images et liens sont-ils gérés ?
Les images sont entièrement supprimées — il n'y a pas moyen de les représenter en texte brut. Les liens perdent leur balise <a> mais le texte d'ancre est préservé. Si vous avez besoin des URLs, utilisez plutôt la conversion HTML-vers-Markdown (quand on la livrera).
Quel encodage utilise la sortie ?
UTF-8 sans BOM. Les entités HTML comme &amp;, &lt; et &#233; sont décodées en leurs caractères réels. Le contenu non-ASCII se rend correctement dans n'importe quel éditeur moderne.
Est-ce que ça gère les fragments HTML ou seulement les documents complets ?
Les deux. Même si votre entrée n'est qu'un fragment (un <div> sans wrappers <html> ou <body>), le DOMParser le gère correctement et extrait le texte.
Mon HTML est-il envoyé ?
Non. La conversion tourne entièrement dans votre navigateur via les APIs DOMParser et innerText intégrées. Aucune bibliothèque n'est chargée pour cet outil, aucun fichier n'est envoyé, aucun serveur n'est impliqué.

Conversions associées