Converting HTML to PDF looks easy on paper. You build a polished template, drop in your data, and expect a document that mirrors the web page pixel for pixel. In reality, the pipeline often turns into a daily fight against crashes, missing glyphs, and visual corruption. During a recent project, three problems kept resurfacing: iText would collapse entirely when it hit certain SVG graphics, emojis vanished into blank white squares, and subtle transparent backgrounds hardened into opaque black blocks. Each failure had a distinct cause, and fixing all three required rethinking how the application prepared content before the PDF engine ever saw it.

When SVG Breaks the Pipeline

iText ships with an internal SVG renderer for convenience, but that integration hides a critical weakness. When an SVG contains complex paths, heavy CSS styling, or certain coordinate transformations, the embedded parser does not throw a tidy exception and move on. It detonates. These are total system crashes that kill the PDF generation thread without warning, leaving you with a partial file and a stack trace pointing somewhere deep inside the vector parser.

The reliable fix is to stop asking iText to render SVG at all. Instead, move that work to Apache Batik running in standalone mode. Batik handles the same complex paths and CSS rules without the same brittleness, and keeping it separate insulates your PDF engine from graphics-related instability. The workflow is straightforward: before document assembly begins, run the SVG through Batik to produce a PNG data URL. Pass that raster image into iText rather than the raw vector markup. Standalone Batik tracks the SVG specification more closely than an embedded renderer that is bundled and frozen inside a larger library, and the isolation means a malformed graphic cannot bring down the entire document conversion.

One small detail determines whether your chart looks professional or like a bug report. SVG relies on the viewBox attribute to define its coordinate system and scaling behavior. If your conversion code ignores viewBox, a perfectly valid chart can shrink to an unreadable speck or stretch into a distorted mess. Parse the attribute explicitly and map those dimensions to your output size. Skipping this step burns hours debugging a layout problem that has nothing to do with rendering quality and everything to do with a missing coordinate declaration.

The Invisible Ink Problem

Blank squares where emojis should sit tell a simple story: the current font does not speak that language. Helvetica and the other standard PDF fonts predate widespread emoji usage. They do not include glyphs for emoji Unicode ranges, so when iText encounters those code points it renders nothing and moves on. The result is a document full of empty boxes that makes social sentiment reports or user feedback exports look broken.

You cannot rely on the client operating system to fill the gap. PDFs carry their own font resources, and what looks correct in your browser means nothing once the file is detached from your system fonts. The solution is to build an explicit font routing layer. Register a dedicated emoji-capable font such as Symbola, which provides monochrome symbols covering the emoji Unicode blocks. A black-and-white heart or warning symbol may lack the polish of a glossy color glyph set, but it communicates meaning. An empty rectangle communicates failure. Full-color emoji fonts remain difficult to render consistently inside PDF viewers, and chasing color support often introduces more compatibility problems than it solves.

iText adds a second, nastier problem through line breaking. The library can split emoji surrogate pairs at the wrong boundary, tearing a single character into two invalid halves. When that happens, the text stream corrupts and you end up with unreadable fragments where a single glyph should live. To prevent this, implement a custom ISplitCharacter that recognizes surrogate pairs and treats them as atomic units. This stops the layout engine from inserting a line break mid-emoji and preserves the integrity of the text.

When Transparency Turns Black

An SVG with a soft rgba background or a layered fill-opacity effect looks refined in a browser. Feed that same markup into iText, and the transparency frequently collapses into a solid black rectangle. The engine mishandles CSS color functions and opacity attributes, substituting opacity with full-density ink.

Le prétraitement de l'SVG avant qu'il n'atteigne le convertisseur est la seule défense fiable. Supprimez ou remplacez tout élément dépendant du mélange alpha. Convertissez les valeurs rgba() en couleurs rgb() pleines. Si vous devez conserver une certaine notion d'opacité, déplacez les valeurs hors des raccourcis CSS pour les placer dans des attributs opacity standards, bien que la suppression totale de la transparence soit l'option la plus sûre. Ces changements ressemblent à un retour en arrière pour le web design, mais le format PDF utilise un modèle d'imagerie différent qui précède la transparence CSS moderne. Le format attend des valeurs de couleur concrètes, et lui en donner de vagues invite au désastre.

Pendant que vous assainissez le marquage, vérifiez que chaque SVG porte la déclaration d'espace de noms xmlns appropriée. Le HTML généré et les moteurs de templates suppriment souvent les attributs d'espace de noms lors de la minification ou de la sérialisation du DOM. Sans cet espace de noms, l'analyseur SVG peut mal identifier les éléments ou échouer silencieusement, produisant soit une erreur d'analyse, soit des données vectorielles malformées qui n'atteignent jamais la page. C'est une vérification de base qui prend quelques secondes et permet d'économiser des heures.

Un seul template, deux mondes

La pire solution à long terme est de maintenir des templates HTML distincts pour le navigateur et le PDF. Les étiquettes dérivent, les marges changent, et bientôt le rapport exporté ne correspond plus au tableau de bord. Une architecture plus propre repose sur un template unique et bifurque la logique de rendu à l'aide d'un simple flag, du type context.isForPdf().

Lorsque ce flag est faux, le template offre l'expérience complète du navigateur. Il sert de l'SVG natif pour un zoom infini, du CSS moderne et tous les assets de couleur supportés par le navigateur. Lorsque le flag est vrai, le même template remplace les assets SVG par des PNG pré-rendus, active la pile de polices compatible avec les emojis et supprime tous les effets de transparence non supportés. Le texte et la structure restent inchangés ; seuls le pipeline d'assets et les règles de style s'adaptent au support cible.

Cette approche à double voie maintient l'intégrité de la base de code. Vous mettez à jour le contenu à un seul endroit, et la couche de routage gère les différences mécaniques entre l'écran et le papier. Cela simplifie également les tests. Vous pouvez vérifier la logique du template dans un navigateur avec les outils de développement complets, puis activer le flag PDF et confirmer que les mêmes données produisent un document propre sans faire planter le convertisseur.

La dure réalité de la génération PDF

Le PDF ne se comportera jamais comme un navigateur. Les modèles de rendu sont fondamentalement différents, et des bibliothèques comme iText font des compromis délibérés entre vitesse, taille de fichier et conformité aux spécifications. Le succès ne vient pas du fait de lutter contre le moteur en espérant le meilleur. Il vient de l'acceptation précoce des limites et de la conception du pipeline autour de celles-ci.

Convertissez vos vecteurs avant l'étape PDF. Routez vos polices explicitement pour que chaque glyphe ait une solution de repli. Supprimez la transparence pour revenir à des couleurs pleines. Donnez à vos templates le contexte dont ils ont besoin pour savoir pour quel monde ils effectuent le rendu. Faites cela de manière cohérente, et vos documents cesseront de lutter contre le moteur de rendu pour commencer à ressembler exactement à ce que vous aviez prévu.