Aller au contenu
Article

Masquer les données sensibles d'un PDF

Un rectangle noir posé sur le texte n'efface rien. Ce qui distingue vraiment les styles de caviardage, pourquoi le flou ne vaut pas suppression, et ce qu'il advient des métadonnées.

En bref : Les styles noir et blanc découpent réellement le contenu sous le rectangle : le texte couvert disparaît du fichier tandis que le reste de la page demeure du texte. Le flou ne fait que masquer et transforme en outre tout le document en images. Les métadonnées sont effacées par défaut.

Cluster

sécurité

Flux de protection, de contrôle d’accès, de masquage et de partage contrôlé.

4 articles

Outil principal

Rédiger le PDF en ligne

Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.

Ouvrir l'outil

Table des matières

Masquer des données personnelles dans un PDF pour qu'on ne puisse pas les récupérer

L'histoire se répète environ une fois par an et fait les gros titres. Une organisation publie un document où noms et adresses sont proprement recouverts de rectangles noirs. Une heure plus tard, quelqu'un sélectionne le texte à la souris, le colle dans un bloc-notes et récupère l'intégralité de ce qui était masqué.

La raison est simple, et la comprendre importe davantage que de retenir une suite de boutons.

Pourquoi un rectangle posé sur le texte ne masque rien

Un PDF est fait de couches. Le texte réside dans le contenu de la page en tant que texte, avec coordonnées et police. Un rectangle dessiné par-dessus dans un éditeur est un autre élément de contenu, tracé après et donc visible au-dessus.

Le texte ne va nulle part. Il est toujours dans le fichier, trouvé par la recherche, sélectionné à la souris et copié. Le rectangle ne le couvre que visuellement, exactement comme une feuille de papier posée sur un écran.

Le vrai caviardage procède autrement : le contenu sous la zone est d'abord découpé de la page, et ce n'est qu'ensuite qu'un aplat vient occuper l'espace libéré.

Trois styles et ce que chacun fait au contenu

StyleCe qui arrive au contenuLe document reste-t-il du texte
NoirLe contenu sous la zone est effacé, un aplat noir vient par-dessusOui, le reste de la page reste du texte
BlancIdem, avec un aplat blancOui
FlouLe document est redessiné en images et la zone est brouilléeNon, la couche de texte disparaît entièrement

Les deux premiers relèvent d'une suppression véritable. Vérifié sur un document où une ligne portant un numéro de référence a été couverte d'une zone noire : après traitement, cette ligne ne se trouve ni par recherche ni par copie, tandis que les lignes voisines se sélectionnent encore comme du texte ordinaire.

Le flou masque, il ne supprime pas

Le troisième style se tient à part, et il coûte deux fois.

D'abord : il ne supprime pas. Le flou dégrade l'image de la zone, mais l'information qu'elle contient se récupère en partie par traitement. Pour des données personnelles c'est inacceptable, et l'outil le dit franchement : choisir le flou joint au résultat un avertissement recommandant le style noir ou blanc.

Le second coût se mesure en octets et en possibilités. Le flou travaille sur une copie tramée du document entier et non d'une seule zone. Un fichier de test d'une page comportant vingt lignes de texte pesait environ un kilo-octet. Après un caviardage noir, il pesait toujours ce kilo-octet. Après le flou, il est monté à quatre-vingt-dix et a perdu la couche de texte en entier : un tel document ne se recherche plus.

Le flou a un sens dans un seul cas : masquer un visage sur une photographie ou un fragment d'image où un découpage laisserait un trou noir incongru.

Comment mener un caviardage

1. Ouvrez redact-pdf et chargez le document. 2. Marquez les zones directement sur la page : l'outil affiche le document et permet d'entourer les endroits voulus. 3. Choisissez le style. Pour des données, noir ou blanc. 4. Laissez la suppression des métadonnées activée. 5. Lancez le traitement. 6. Ouvrez le résultat, essayez de sélectionner l'endroit couvert à la souris, puis cherchez dans le document le mot supprimé.

Le point six n'est pas une formalité. C'est le seul contrôle qui distingue une suppression réelle d'un rectangle dessiné, et il prend dix secondes.

Les zones sont obligatoires

L'outil n'essaie pas de deviner ce qu'il faut masquer. Sans zone indiquée, le traitement ne démarre pas du tout et renvoie un message direct disant qu'au moins une zone est nécessaire.

C'est une décision délibérée, et la bonne. Deviner une zone dans une tâche où l'erreur signifie une fuite de données personnelles est plus dangereux qu'un refus : ayant couvert le mauvais endroit, l'outil annoncerait un succès alors que les données restent en vue.

Pour la même raison, les zones sont contrôlées : des coordonnées hors de la page ou une largeur nulle produisent une erreur au lieu d'être ignorées en silence.

Les métadonnées sont effacées par défaut

Un interrupteur distinct gouverne le nettoyage des propriétés du document, et il est activé d'origine.

Ce n'est pas un détail. Les propriétés contiennent régulièrement le nom de la personne qui a préparé le document, un titre interne de travail, parfois un chemin de dossier venu d'un disque. Un document dont le patronyme d'un client a été soigneusement découpé, mais qui garde dans ses propriétés le nom de l'auteur et un titre du type « affaire Ivanov, brouillon », ne règle pas le problème.

Si vous désactivez le nettoyage, un avertissement dédié arrive : les métadonnées d'origine sont conservées et peuvent contenir des éléments identifiant des personnes. Cela ne se produit pas en silence.

Pour un travail plus fin sur les propriétés, il y a set-pdf-metadata, où les champs ne sont pas seulement vidés mais remplis des valeurs de votre choix.

Une mention attestant du caviardage

Les paramètres comportent un champ pour une note brève inscrite dans les propriétés du fichier fini, au champ objet.

Sa vocation est administrative : le destinataire voit que le document a été caviardé volontairement et n'est pas arrivé endommagé. Des formules du genre « données personnelles supprimées » ou « retenu au titre de tel article » épargnent un aller-retour de correspondance.

La longueur est plafonnée à cinq cents caractères. Un texte plus long est tronqué et un avertissement le signale : la note ne disparaît donc pas en silence, mais elle n'arrive pas entière non plus.

Où les données se cachent en dehors du corps du texte

Un passage complet du document se fait mieux avec une liste que de mémoire. Les endroits oubliés se répètent d'un document à l'autre.

En-têtes et pieds de page. Ils se répètent sur chaque page, et si un patronyme ou un numéro de dossier y figure, il faut couvrir toutes les pages, pas seulement la première.

Signatures et tampons. Une signature est une donnée personnelle et se voit en entier sur une numérisation. Un tampon porte le nom de l'organisation et souvent son adresse.

Tableaux des annexes. Le corps du texte se lit avec attention, les annexes se feuillettent, et ce sont les annexes qui contiennent des registres de noms et de numéros de téléphone.

Versos. Dans une numérisation recto verso, les versos alternent avec les rectos, et la moitié semble vierge parce que seule l'ombre du texte se distingue sur une vignette.

Notes marginales. Résolutions manuscrites, tampons d'enregistrement, étiquettes numérotées.

Une astuce pratique : avant de commencer, ouvrez le document et cherchez-y le patronyme, le numéro de téléphone et l'adresse. La recherche montre toutes les occurrences, y compris celles que l'oeil saute.

Ce que l'outil ne fait pas

Il ne cherche pas les données personnelles à votre place. L'outil supprime ce que vous avez entouré, et rien d'autre. La responsabilité de parcourir tout le document reste humaine.

D'où une règle pratique : parcourez le document en entier, en-têtes, pieds de page, légendes sous les tableaux et versos compris. C'est exactement là que les données s'oublient, parce que l'attention va au corps du texte.

Et à part : rogner une page avec crop-pdf n'est pas caviarder. Cela change la zone visible de la feuille, tandis que le contenu au-delà reste dans le fichier et revient dès que le rognage est réinitialisé.

Si le document est une numérisation, il se peut qu'il n'y ait aucun texte sous la zone et rien à découper ; il n'y a là qu'une image. Le résultat est alors fiable pour une autre raison : un morceau d'image est supprimé. Mais si la numérisation est passée auparavant par ocr-pdf, une couche de texte est apparue sous l'image, et elle doit elle aussi être couverte par la zone.

FAQ

Un rectangle dessiné sur le texte est une couche à part, et le texte reste dessous, accessible par copie ou par recherche. Les styles noir et blanc effacent ici le contenu du fichier et peignent l'aplat sur l'espace devenu vide.
Non. Le flou dégrade une image sans la supprimer, et une partie du contenu se récupère par traitement. L'outil en avertit explicitement au choix de ce style. Une suppression réelle exige le noir ou le blanc.
Avec le noir et le blanc, oui : le texte non couvert reste du texte et le fichier change à peine de taille. Avec le flou, non : tout le document est redessiné en images et la couche de texte disparaît entièrement.
Non, le parcours de base fonctionne sans inscription.
Les fichiers ne servent qu'à l'opération choisie et sont supprimés automatiquement une fois le traitement terminé. Nous n'utilisons pas les documents chargés pour entraîner des modèles d'IA.

Plus de ce cluster

Outils associés

← Tous les outils Sécurité

Que faire ensuite

Si vous avez besoin d'une étape pratique ou d'un repère sur le service après la lecture, ouvrez ces pages.

Tous les outils

Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.

FAQ

Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.

Contact

Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.