fr

Extraire tableaux PDF

Détectez les tableaux d'un PDF et exportez-les en CSV, Excel (XLSX) ou JSON, avec ou sans bordures. En local dans le navigateur, sans envoi.

Traitement en local sur votre appareil ...

Format de sortie Le format cible du fichier de sortie.
  • CSV
  • Excel (XLSX)
  • JSON
Détection des tableaux
  • Automatique
  • Avec bordures (grille)
  • Sans bordures (espacements)
Séparateur
  • Virgule
  • Point-virgule
  • Tabulation

Vos fichiers

    Traitement en local sur votre appareil ...

    0%

    Mon fichier est-il envoyé ?

    Non. Tout s’exécute dans votre navigateur - votre fichier ne quitte jamais votre appareil. Comment le vérifier

    Aucun envoi100 % en local
    Vos contenus restent chez vousaucun accès par des tiers
    Hosted in GermanyGlobal Content Delivery
    Audité en externeTLS A+ · En-têtes A+

    Les chiffres restent souvent bloqués là où on ne peut pas les exploiter : dans les tableaux d'un PDF. Factures, rapports, relevés bancaires, études : pour récupérer ces valeurs dans Excel, une base de données ou un script, il fallait jusqu'ici les retaper ou se battre avec des colonnes qui se désagrègent au copier-coller. Cet outil reconnaît automatiquement les tableaux du PDF et les exporte en conservant leur structure : en CSV pour les tableurs et les imports, en classeur Excel (XLSX) avec une feuille par tableau, ou en JSON avec les coordonnées pour un traitement dans du code.

    La détection s'appuie sur les deux mêmes techniques que les outils spécialisés reconnus : les tableaux avec bordures sont détectés grâce aux lignes réellement tracées sur la page (mode grille) ; les lignes forment la trame des cellules et chaque texte est affecté à sa cellule. Les tableaux sans bordures sont détectés par l'alignement (mode espacements) : les blocs de texte placés aux mêmes positions de colonne sur plusieurs lignes forment les colonnes, et les espaces qui restent libres en marquent les limites. Le mode automatique cherche d'abord des lignes puis retombe sur l'analyse des espacements ; les deux modes peuvent aussi être imposés. Les tableaux multiples et les PDF de plusieurs pages sont pris en charge : chaque tableau détecté est exporté séparément.

    Honnête et important : la détection lit la couche de texte du PDF. Un PDF numérisé, ou composé uniquement d'images, n'a pas cette couche ; l'outil le dit alors ouvertement au lieu de produire des tableaux vides ou inventés. Convertissez d'abord les numérisations avec « PDF OCR », puis extrayez les tableaux. Les mises en page complexes ont leurs limites : cellules fusionnées ou tableaux imbriqués sont approchés, pas reconstruits au pixel près. Tout s'exécute localement dans le navigateur via pdf.js ; votre fichier ne quitte jamais votre appareil.

    Fiche technique

    Fiche technique
    Formats d'entréePDF
    Conversion automatiquePNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
    Formats de sortieCSV, XLSX, JSON
    Traitement par lotsNon
    TraitementEn local dans le navigateur (JavaScript)
    Téléversement de fichiersAucun

    En 3 étapes

    1. Déposez votre PDF.
    2. Choisissez le format de sortie et la détection.
    3. Téléchargez les tableaux en CSV, XLSX ou JSON.

    Limites: Détecte les tableaux via les lignes de bordure (grille) ou l'alignement du texte (espacements) et les exporte en CSV (un fichier par tableau, plusieurs regroupés en ZIP), XLSX (une feuille par tableau) ou JSON (avec page, cellules et positions en points PDF). Nécessite une vraie couche de texte : convertissez d'abord les PDF numérisés avec « PDF OCR ». Les cellules fusionnées et les mises en page complexes sont approchées ; dans Excel, seuls les nombres sans ambiguïté (décimale à point) deviennent des cellules numériques. Ouvrez d'abord les PDF protégés avec « Déverrouiller PDF ».

    Questions fréquentes

    Comment l'outil détecte-t-il les tableaux ?

    Avec deux techniques : pour les tableaux avec bordures, les lignes tracées forment la trame des cellules (mode grille). Pour les tableaux sans bordures, les colonnes sont reconnues par l'alignement du texte et les espaces continus (mode espacements). Le mode automatique choisit la bonne technique.

    Pourquoi ne trouve-t-il aucun tableau dans mon document numérisé ?

    Une numérisation n'est constituée que de pixels d'image, sans couche de texte lisible. Convertissez d'abord le PDF en texte avec « PDF OCR », puis extrayez les tableaux.

    Puis-je exporter plusieurs tableaux et pages à la fois ?

    Oui. Toutes les pages sont parcourues et chaque tableau détecté est exporté séparément : comme fichier CSV distinct (plusieurs regroupés en ZIP), comme feuille distincte d'un fichier Excel ou comme entrée du JSON.

    Que contient l'export JSON ?

    La structure complète : pour chaque tableau, sa page, son mode de détection et sa position ; pour chaque cellule, son texte et son cadre en points PDF (origine en bas à gauche). Idéal pour les scripts et les pipelines de données.

    Pourquoi les cellules fusionnées ne sont-elles pas exactes ?

    Une cellule fusionnée sur plusieurs colonnes n'a pas de position unique dans la trame ; son contenu atterrit dans l'une des cellules concernées et les autres restent vides. C'est une approximation honnête : même les outils de bureau spécialisés ne résolvent pas cela sans erreur.

    Mon PDF est-il envoyé sur un serveur ?

    Non. La détection et l'export s'exécutent entièrement en local dans le navigateur via pdf.js ; le fichier ne quitte jamais votre appareil.

    L'extraction de tableaux fonctionne-t-elle aussi sur smartphone ou Chromebook ?

    Oui, sur tout appareil doté d'un navigateur récent - Windows, Mac, Linux, Chromebook ou smartphone. Les très gros PDF demandent simplement plus de temps et de mémoire sur mobile.

    Outils associés

    PDF en texte · PDF OCR consultable · XLSX en CSV · CSV en XLSX · CSV en JSON · PDF en Markdown