Aller au contenu
Article

Convertir un PDF en PDF/A pour l'archive

Passer d'un PDF normal au PDF/A pour l'archivage : quel niveau choisir, ce que la conversion intègre et pourquoi le service vérifie son résultat.

En bref : Pour convertir un PDF en PDF/A pour l'archivage, choisissez en général le niveau PDF/A-2b (ou PDF/A-1b si un règlement l'exige) : les polices et profils colorimétriques sont intégrés au fichier. Passez un scan par l'OCR avant conversion si la recherche compte, et compressez avant, jamais après.

Cluster

bonnes pratiques

Patrons d’exécution stables pour des opérations PDF répétables et de qualité.

5 articles

Outil principal

PDF en PDF/A en ligne

Ouvrez l'outil cité dans cet article et terminez l'opération dans la locale actuelle.

Ouvrir l'outil

Table des matières

Comment convertir un PDF en PDF/A pour l'archivage

L'exigence de déposer un document en PDF/A apparaît partout où un fichier doit survivre à son propre logiciel : archives publiques, systèmes judiciaires, dépôt de thèses, et gestion documentaire d'entreprise à longue durée de conservation.

Le sens du format est l'autosuffisance. Un PDF ordinaire peut renvoyer à une police installée sur le système ou s'appuyer sur le profil colorimétrique d'un écran. Dans vingt ans, ni l'un ni l'autre n'existera peut-être, et le document s'ouvrira autrement qu'il n'était. Le PDF/A interdit ces dépendances externes : tout le nécessaire se trouve dans le fichier.

Ce qui se passe pendant la conversion

La transformation est réalisée par Ghostscript, et ce n'est pas une retouche cosmétique des métadonnées.

Les polices sont intégralement incorporées au fichier, pour que le document ne dépende pas de ce qui est installé sur la machine du lecteur. Les couleurs sont ramenées à un profil décrit, et un profil colorimétrique de sortie est joint au fichier, à partir duquel on reconstitue ensuite sans ambiguïté la teinte visée. La déclaration du niveau de conformité est écrite dans les métadonnées.

Il en découle qu'après conversion, le fichier devient presque toujours plus lourd que l'original. Les polices incorporées et le profil colorimétrique prennent de la place. C'est normal, c'est le prix de l'autosuffisance et non le signe que quelque chose a mal tourné.

Quel niveau choisir

Il y a trois niveaux, et c'est l'intermédiaire qui est par défaut.

NiveauFondé surParticularité
PDF/A-1bL'ancien PDF 1.4Les contraintes les plus strictes, compatibilité maximale avec les systèmes de dépôt
PDF/A-2bPDF 1.7Un équilibre raisonnable, convient à la plupart des exigences
PDF/A-3bPDF 1.7Comme 2b, avec en plus la possibilité d'incorporer des fichiers quelconques

Le b des trois désigne le niveau de base : le document est garanti s'afficher toujours pareil. Il existe aussi un niveau a, avec des exigences de structure et d'accessibilité, mais il demande tant au document source que la conversion automatique d'une attestation numérisée ordinaire ne l'atteint pas.

Si les exigences de l'archive nomment un niveau explicitement, prenez celui qu'elles nomment. Si elles disent simplement « PDF/A », prenez 2b. Le premier niveau se choisit en connaissance de cause : il repose sur une version ancienne de PDF et ne prend en charge ni la transparence ni les calques, un document à graphisme moderne change donc davantage à la conversion en 1b.

Le service vérifie son propre résultat

Cela mérite d'être dit à part, car tous les convertisseurs ne le font pas.

Après la transformation, le fichier est contrôlé pour les marqueurs obligatoires du PDF/A : le niveau de conformité est-il déclaré dans les métadonnées, et correspond-il à celui demandé. Le résultat n'est pas déclaré conforme au seul motif que la conversion s'est achevée sans erreur.

Si le contrôle échoue, le fichier est tout de même remis, mais honnêtement, comme un PDF ordinaire et avec une explication de ce qui a manqué. Il reste en général meilleur que l'original ; l'appeler PDF/A serait simplement faux. Les métadonnées ne sont pas non plus falsifiées : les marqueurs de conformité ne sont pas apposés sur un fichier qui a échoué au contrôle, car une telle mention induirait en erreur aussi bien une personne qu'un système de dépôt.

Ce que ce contrôle n'est pas

Ici, l'important est de ne pas surestimer la garantie.

Le contrôle regarde les marqueurs du format, il n'effectue pas une validation formelle complète selon la norme ISO 19005. La validation complète exige un outil à part, et celui qui fait autorité est veraPDF. La différence est substantielle : les marqueurs confirment que le fichier se déclare PDF/A et a été construit en conséquence, tandis que la validation formelle vérifie point par point chaque exigence de la norme.

Pour une archive interne et pour la plupart des organisations, le premier suffit. Si en revanche le document part là où la non-conformité entraîne des conséquences juridiques, passez le fichier terminé par veraPDF séparément. Le service lui-même le signale dans le message accompagnant le résultat.

Étape par étape

1. Vérifiez dans les exigences du destinataire quel niveau est demandé. 2. Ouvrez pdf-to-pdfa et importez le document. 3. Choisissez le niveau de conformité, 2b par défaut. 4. Donnez un titre de document qui ait du sens : il ira dans les métadonnées d'archive et c'est par lui qu'on cherchera le fichier. 5. Lancez la conversion et lisez le message du résultat, ne vous contentez pas de télécharger le fichier.

La cinquième étape n'est pas une formalité. C'est précisément dans ce message qu'il est dit si la conformité a été confirmée ou si le fichier est revenu en PDF ordinaire.

Pourquoi une archive peut malgré tout refuser le fichier

La conformité au format et l'acceptation dans une archive donnée sont deux choses distinctes, et la seconde est plus stricte.

Le plus souvent, la cause tient à des exigences que la norme elle-même ne contient pas. Une archive peut réclamer un niveau précis, une façon déterminée de nommer le fichier, un jeu obligatoire de champs de métadonnées ou une limite de taille. Le fichier sera un PDF/A irréprochable et reviendra tout de même.

La deuxième cause fréquente est que le document est formellement conforme mais ne contient pas ce pour quoi on le dépose. Une numérisation sans couche de texte, convertie en PDF/A, reste un ensemble d'images. L'exigence d'un « PDF/A avec recherche » n'est pas couverte par un tel fichier, même si les deux mots sur le format sont respectés.

La troisième cause est discrète : la conformité a pu ne pas être confirmée sans que personne ne le remarque. On a téléchargé le fichier, constaté qu'il s'ouvrait, et on l'a envoyé. Or le message du résultat disait que le contrôle n'était pas passé et que le fichier revenait en PDF ordinaire. C'est bien pour cela qu'il faut le lire.

Si les exigences de l'archive tiennent sur un document de plusieurs pages, il est plus sage de faire passer une fois un fichier d'essai par toute la chaîne et d'en obtenir la confirmation, plutôt que de convertir tout le fonds et d'apprendre la non-conformité un mois plus tard.

Ce qu'il faut préparer d'avance

La conversion travaille avec ce qu'on lui donne et ne corrige pas les défauts du document source.

Un document numérisé restera un ensemble d'images. Formellement il deviendra un PDF/A, mais on ne pourra pas y chercher de texte. Si l'archive attend un document avec couche de texte, passez d'abord la numérisation par ocr-pdf et convertissez ensuite.

Un document protégé par mot de passe ne se convertira pas tant que la protection à l'ouverture n'est pas levée. unlock-pdf s'en charge. Rappelez-vous au passage que le PDF/A et le chiffrement sont incompatibles selon la norme elle-même : un document d'archive doit s'ouvrir sans clé.

Le titre et les autres propriétés se mettent plus facilement en ordre avant la conversion avec set-pdf-metadata qu'après, sur un fichier déjà déclaré archivable.

Si les documents sont nombreux, ne les lancez pas en lot à l'aveugle. Le niveau de conformité et la préparation des sources varient selon le type de document : les numérisations demandent une reconnaissance, les documents avec transparence s'accommodent mal du premier niveau, les fichiers protégés ne passeront pas du tout. Il est plus raisonnable de répartir le fonds par types, de régler les paramètres sur un représentant de chacun, et seulement ensuite de lancer le reste.

FAQ

Le PDF/A est un sous-ensemble du PDF sans dépendance à des fichiers externes : toutes les polices sont intégrées, les profils colorimétriques sont inclus dans le fichier, et le JavaScript, le chiffrement et les liens vers des ressources externes sont interdits. Un tel fichier s'ouvre de la même façon, même des années plus tard.
Pour la plupart des archives, le PDF/A-2b convient : il gère la transparence, les calques et la compression JPEG2000. Prenez le PDF/A-1b si un règlement ou le système de dépôt l'exige. Le PDF/A-3 ne sert que lorsqu'il faut joindre un fichier source à l'intérieur, par exemple un XML ou un tableur.
Oui, un scan se convertit, mais sans couche de texte reconnue ce sera une image dans un PDF/A, et la recherche ne fonctionnera pas. Si la recherche dans l'archive compte, passez d'abord le document par une OCR, puis convertissez.
Le PDF/A intègre toutes les polices et tous les profils colorimétriques en entier, donc le poids augmente souvent. C'est normal pour une archive. Si la taille est critique, compressez le fichier avant la conversion, jamais après : un nouveau traitement peut rompre la conformité.
Les fichiers sont traités dans la session du navigateur et supprimés du serveur automatiquement. Aucune inscription n'est requise, et les documents ne servent pas à entraîner une IA.

Plus de ce cluster

Outils associés

← Tous les outils Convertir

Que faire ensuite

Si vous avez besoin d'une étape pratique ou d'un repère sur le service après la lecture, ouvrez ces pages.

Tous les outils

Catalogue d'outils PDF pour fusionner, compresser, diviser, convertir, pivoter, protéger et déverrouiller vos fichiers PDF en ligne.

FAQ

Réponses aux questions fréquentes sur iHatePDF : faut-il s'inscrire, comment les fichiers sont traités, où consulter les limites et la sécurité du téléversement de documents.

Contact

Contactez iHatePDF pour toute question sur les erreurs de traitement, le choix d'un outil, la sécurité, les demandes commerciales et les suggestions de nouvelles fonctionnalités.