Convertir un PDF en PDF/A pour l'archive
En bref : Pour convertir un PDF en PDF/A pour l'archivage, choisissez en général le niveau PDF/A-2b (ou PDF/A-1b si un règlement l'exige) : les polices et profils colorimétriques sont intégrés au fichier. Passez un scan par l'OCR avant conversion si la recherche compte, et compressez avant, jamais après.
Cluster
bonnes pratiques
Patrons d’exécution stables pour des opérations PDF répétables et de qualité.
Outil principal
PDF en PDF/A en ligne
Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.
Ouvrir l'outilTable des matières
Comment convertir un PDF en PDF/A pour l'archivage
L'exigence de déposer un document en PDF/A apparaît partout où un fichier doit survivre à son propre logiciel : archives publiques, systèmes judiciaires, dépôt de thèses, et gestion documentaire d'entreprise à longue durée de conservation.
Le sens du format est l'autosuffisance. Un PDF ordinaire peut renvoyer à une police installée sur le système ou s'appuyer sur le profil colorimétrique d'un écran. Dans vingt ans, ni l'un ni l'autre n'existera peut-être, et le document s'ouvrira autrement qu'il n'était. Le PDF/A interdit ces dépendances externes : tout le nécessaire se trouve dans le fichier.
Ce qui se passe pendant la conversion
La transformation est réalisée par Ghostscript, et ce n'est pas une retouche cosmétique des métadonnées.
Les polices sont intégralement incorporées au fichier, pour que le document ne dépende pas de ce qui est installé sur la machine du lecteur. Les couleurs sont ramenées à un profil décrit, et un profil colorimétrique de sortie est joint au fichier, à partir duquel on reconstitue ensuite sans ambiguïté la teinte visée. La déclaration du niveau de conformité est écrite dans les métadonnées.
Il en découle qu'après conversion, le fichier devient presque toujours plus lourd que l'original. Les polices incorporées et le profil colorimétrique prennent de la place. C'est normal, c'est le prix de l'autosuffisance et non le signe que quelque chose a mal tourné.
Quel niveau choisir
Il y a trois niveaux, et c'est l'intermédiaire qui est par défaut.
| Niveau | Fondé sur | Particularité |
|---|---|---|
| PDF/A-1b | L'ancien PDF 1.4 | Les contraintes les plus strictes, compatibilité maximale avec les systèmes de dépôt |
| PDF/A-2b | PDF 1.7 | Un équilibre raisonnable, convient à la plupart des exigences |
| PDF/A-3b | PDF 1.7 | Comme 2b, avec en plus la possibilité d'incorporer des fichiers quelconques |
Le b des trois désigne le niveau de base : le document est garanti s'afficher toujours pareil. Il existe aussi un niveau a, avec des exigences de structure et d'accessibilité, mais il demande tant au document source que la conversion automatique d'une attestation numérisée ordinaire ne l'atteint pas.
Si les exigences de l'archive nomment un niveau explicitement, prenez celui qu'elles nomment. Si elles disent simplement « PDF/A », prenez 2b. Le premier niveau se choisit en connaissance de cause : il repose sur une version ancienne de PDF et ne prend en charge ni la transparence ni les calques, un document à graphisme moderne change donc davantage à la conversion en 1b.
Le service vérifie son propre résultat
Cela mérite d'être dit à part, car tous les convertisseurs ne le font pas.
Après la transformation, le fichier est contrôlé pour les marqueurs obligatoires du PDF/A : le niveau de conformité est-il déclaré dans les métadonnées, et correspond-il à celui demandé. Le résultat n'est pas déclaré conforme au seul motif que la conversion s'est achevée sans erreur.
Si le contrôle échoue, le fichier est tout de même remis, mais honnêtement, comme un PDF ordinaire et avec une explication de ce qui a manqué. Il reste en général meilleur que l'original ; l'appeler PDF/A serait simplement faux. Les métadonnées ne sont pas non plus falsifiées : les marqueurs de conformité ne sont pas apposés sur un fichier qui a échoué au contrôle, car une telle mention induirait en erreur aussi bien une personne qu'un système de dépôt.
Ce que ce contrôle n'est pas
Ici, l'important est de ne pas surestimer la garantie.
Le contrôle regarde les marqueurs du format, il n'effectue pas une validation formelle complète selon la norme ISO 19005. La validation complète exige un outil à part, et celui qui fait autorité est veraPDF. La différence est substantielle : les marqueurs confirment que le fichier se déclare PDF/A et a été construit en conséquence, tandis que la validation formelle vérifie point par point chaque exigence de la norme.
Pour une archive interne et pour la plupart des organisations, le premier suffit. Si en revanche le document part là où la non-conformité entraîne des conséquences juridiques, passez le fichier terminé par veraPDF séparément. Le service lui-même le signale dans le message accompagnant le résultat.
Étape par étape
1. Vérifiez dans les exigences du destinataire quel niveau est demandé. 2. Ouvrez pdf-to-pdfa et importez le document. 3. Choisissez le niveau de conformité, 2b par défaut. 4. Donnez un titre de document qui ait du sens : il ira dans les métadonnées d'archive et c'est par lui qu'on cherchera le fichier. 5. Lancez la conversion et lisez le message du résultat, ne vous contentez pas de télécharger le fichier.
La cinquième étape n'est pas une formalité. C'est précisément dans ce message qu'il est dit si la conformité a été confirmée ou si le fichier est revenu en PDF ordinaire.
Pourquoi une archive peut malgré tout refuser le fichier
La conformité au format et l'acceptation dans une archive donnée sont deux choses distinctes, et la seconde est plus stricte.
Le plus souvent, la cause tient à des exigences que la norme elle-même ne contient pas. Une archive peut réclamer un niveau précis, une façon déterminée de nommer le fichier, un jeu obligatoire de champs de métadonnées ou une limite de taille. Le fichier sera un PDF/A irréprochable et reviendra tout de même.
La deuxième cause fréquente est que le document est formellement conforme mais ne contient pas ce pour quoi on le dépose. Une numérisation sans couche de texte, convertie en PDF/A, reste un ensemble d'images. L'exigence d'un « PDF/A avec recherche » n'est pas couverte par un tel fichier, même si les deux mots sur le format sont respectés.
La troisième cause est discrète : la conformité a pu ne pas être confirmée sans que personne ne le remarque. On a téléchargé le fichier, constaté qu'il s'ouvrait, et on l'a envoyé. Or le message du résultat disait que le contrôle n'était pas passé et que le fichier revenait en PDF ordinaire. C'est bien pour cela qu'il faut le lire.
Si les exigences de l'archive tiennent sur un document de plusieurs pages, il est plus sage de faire passer une fois un fichier d'essai par toute la chaîne et d'en obtenir la confirmation, plutôt que de convertir tout le fonds et d'apprendre la non-conformité un mois plus tard.
Ce qu'il faut préparer d'avance
La conversion travaille avec ce qu'on lui donne et ne corrige pas les défauts du document source.
Un document numérisé restera un ensemble d'images. Formellement il deviendra un PDF/A, mais on ne pourra pas y chercher de texte. Si l'archive attend un document avec couche de texte, passez d'abord la numérisation par ocr-pdf et convertissez ensuite.
Un document protégé par mot de passe ne se convertira pas tant que la protection à l'ouverture n'est pas levée. unlock-pdf s'en charge. Rappelez-vous au passage que le PDF/A et le chiffrement sont incompatibles selon la norme elle-même : un document d'archive doit s'ouvrir sans clé.
Le titre et les autres propriétés se mettent plus facilement en ordre avant la conversion avec set-pdf-metadata qu'après, sur un fichier déjà déclaré archivable.
Si les documents sont nombreux, ne les lancez pas en lot à l'aveugle. Le niveau de conformité et la préparation des sources varient selon le type de document : les numérisations demandent une reconnaissance, les documents avec transparence s'accommodent mal du premier niveau, les fichiers protégés ne passeront pas du tout. Il est plus raisonnable de répartir le fonds par types, de régler les paramètres sur un représentant de chacun, et seulement ensuite de lancer le reste.
FAQ
Plus de ce cluster
bonnes pratiques
Ranger et supprimer des pages PDF
Comment réordonner, faire pivoter et supprimer des pages dans un PDF sans perte de qualité : guide pas à pas de l'outil organize-pdf et erreurs courantes avec les scans et les impressions.
bonnes pratiques
Ajouter des numéros de page à un PDF
Pas à pas : numéroter les pages d'un PDF en ligne, choisir la position et le format, démarrer le compteur après le titre et ne pas chevaucher le texte des marges.
bonnes pratiques
Métadonnées PDF pour la recherche
Le titre, l'auteur et les mots-clés dans les propriétés d'un PDF décident de la façon dont le fichier se trouve et se classe dans une GED. Voici comment les définir sans casser l'encodage.
Outils associés
Compresser PDF en ligne
Réduisez la taille d'un PDF pour l'envoyer, le téléverser ou le stocker plus facilement. Particulièrement utile pour les scans et documents avec images.
Réparer PDF
Essayez de réparer un PDF si le fichier s'ouvre avec des erreurs, s'affiche mal ou échoue dans d'autres étapes de traitement.
PDF en niveaux de gris en ligne
Transformez les pages couleur en niveaux de gris et téléchargez une copie adaptée à une impression noir et blanc claire et économique. Un cas concret consiste à préparer un rapport couleur ou un scan pour une impression noir et blanc.
Supprimer les pages blanches d’un PDF
Retirez les pages blanches d’un PDF qui apparaissent souvent après des scans recto-verso et un chargeur automatique.
Que faire ensuite
Tous les outils
Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.
FAQ
Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.
Contact
Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.