跳至页脚内容
使用IRONPDF

用 C# 实现管理仪表盘的一键导出 PDF 功能

保持大规模HTML内容的挑战

IronPDF首页 当组织退役一个旧的CMS、内联网或面向公众的门户网站时,其上的内容并不会简单地失去意义。 一家医院退役一个患者健康文章数据库,仍然需要保存这些文章;一个政府机构重新设计其网站,必须保留在特定时间点存在的公共通知;一家律师事务所关闭一项案件研究平台,需要将每一页转换为在法律保留中仍然有效的格式。

规模是每种手动方法都失败的地方。 基于浏览器的打印到PDF适用于一个文档。 对于10,000来说则不是解决方案。编写脚本的无头浏览器仅在您遇到格式错误的HTML、缺少的资产或身份验证墙时才工作,而旧内容往往不干净。

现有的批量转换工具在旧标记上也有类似的问题:2005年的内嵌样式、非标准的表格布局、指向已不再解决的路径的图像引用。 它们要么静默失败,制作布局破损的PDF,要么需要对每页进行手动修复。 同时,IT团队无法证明为了支持早该完成的迁移而无限期地让旧基础架构在线上的合理性。

输出也需要一致。 医院存档健康文章,金融机构保存合规披露页面,律师事务所建设保留档案,所有这些都需要结果的PDF看起来像是来自同一个系统,而不是单独一次导出的浏览器集合。 在本教程中,我们将带您了解IronPDF示例,该如何帮助提升您的项目工作流程。

解决方案:使用IronPDF的自动化HTML到PDF批量转换

Iron Software的IronPDF允许.NET应用程序批量转换HTML文件、HTML字符串或实时URLs为标准化PDF,在单次自动运行中完成。 迁移脚本从一个源读取:一个HTML文件目录,一个HTML blob数据库,或在旧服务器下线前一个待捕获的URL列表,把每个页面输入到ChromePdfRenderer,并将输出写入归档目标。

基于Chromium的渲染引擎以浏览器的方式处理不一致的标记、内嵌样式和嵌入的资产,从而产生视觉上忠实的快照,无论原始HTML是如何编写的。 没有需要维护的浏览器自动化漏洞,没有每个文档的API费用使50,000页的存档过于昂贵。转换在一个.NET控制台应用程序或后台服务内运行,一个NuGet包,没有外部进程。

实践中如何操作:C#PDF文档创建

1. 迁移脚本枚举源内容

脚本通常是为迁移而构建的一个控制台应用程序,一次性运行或可重复的增量内容集合的作业。 它从枚举源开始:磁盘上的.html文件目录,包含HTML blob和元数据的数据库表(原始URL,创建日期,内容ID),或在旧服务器下线前要捕获的实时网页的扁平列表。

对于数据库源,查询返回HTML内容和填充归档清单的元数据。对于URL列表,处理顺序可以按优先级排序,高流量页面或法律敏感内容先被捕获。

2. 样式注入标准化输出

旧HTML本质上是不一致的。 同一个CMS的不同年代的页面可能有不同的基准字体大小、边距约定和布局假设。 在渲染之前,脚本可以选择性地在每个HTML字符串前添加一个标准化的<style>块—设置统一的边距、统一的正文字体和固定的页面宽度—这样每个已归档的PDF文档共享相同的视觉基准,不论原始样式如何。

这个标准化步骤是使档案看起来像是连贯的文档集合和随机的浏览器截图集一样的重要区别。

3. ChromePdfRenderer将每个页面转换为PDF文件

对于磁盘上的HTML文件或数据库中的HTML字符串,RenderHtmlAsPdf()处理转换。 BaseUrlPath参数根据原始文件所在的目录解析图片和样式表引用,保留嵌入的资产:

using IronPdf;

var renderer = new ChromePdfRenderer();

renderer.RenderingOptions.PaperSize = IronPdf.Rendering.PdfPaperSize.A4;

renderer.RenderingOptions.MarginTop = 20;

renderer.RenderingOptions.MarginBottom = 20;

string sourceDir = @"C:\LegacyContent\html";

string archiveDir = @"C:\Archive\pdf";

Directory.CreateDirectory(archiveDir);

foreach (string htmlFile in Directory.EnumerateFiles(sourceDir, "*.html"))
{
    string html = File.ReadAllText(htmlFile);
    PdfDocument pdf = renderer.RenderHtmlAsPdf(html, sourceDir);
    string outputPath = Path.Combine(archiveDir,
        Path.GetFileNameWithoutExtension(htmlFile) + ".pdf");

    pdf.SaveAs(outputPath);
    Console.WriteLine($"Archived: {outputPath}");
}
using IronPdf;

var renderer = new ChromePdfRenderer();

renderer.RenderingOptions.PaperSize = IronPdf.Rendering.PdfPaperSize.A4;

renderer.RenderingOptions.MarginTop = 20;

renderer.RenderingOptions.MarginBottom = 20;

string sourceDir = @"C:\LegacyContent\html";

string archiveDir = @"C:\Archive\pdf";

Directory.CreateDirectory(archiveDir);

foreach (string htmlFile in Directory.EnumerateFiles(sourceDir, "*.html"))
{
    string html = File.ReadAllText(htmlFile);
    PdfDocument pdf = renderer.RenderHtmlAsPdf(html, sourceDir);
    string outputPath = Path.Combine(archiveDir,
        Path.GetFileNameWithoutExtension(htmlFile) + ".pdf");

    pdf.SaveAs(outputPath);
    Console.WriteLine($"Archived: {outputPath}");
}
Imports IronPdf
Imports System.IO

Dim renderer As New ChromePdfRenderer()

renderer.RenderingOptions.PaperSize = IronPdf.Rendering.PdfPaperSize.A4

renderer.RenderingOptions.MarginTop = 20

renderer.RenderingOptions.MarginBottom = 20

Dim sourceDir As String = "C:\LegacyContent\html"

Dim archiveDir As String = "C:\Archive\pdf"

Directory.CreateDirectory(archiveDir)

For Each htmlFile As String In Directory.EnumerateFiles(sourceDir, "*.html")
    Dim html As String = File.ReadAllText(htmlFile)
    Dim pdf As PdfDocument = renderer.RenderHtmlAsPdf(html, sourceDir)
    Dim outputPath As String = Path.Combine(archiveDir, Path.GetFileNameWithoutExtension(htmlFile) & ".pdf")

    pdf.SaveAs(outputPath)
    Console.WriteLine($"Archived: {outputPath}")
Next
$vbLabelText   $csharpLabel

HTML文件转换为PDF格式

输出文件

示例输出:HTML文件与输出PDF

IronPDF示例输出 对于现场URLs,需要在退役的服务器上捕获的页面,RenderUrlAsPdf()处理每个请求。并行批处理可使大量URL集的运行时间可控:

using IronPdf;

var renderer = new ChromePdfRenderer();

int completed = 0, failed = 0;

await Parallel.ForEachAsync(urlList,
    new ParallelOptions { MaxDegreeOfParallelism = 4 },
    async (url, _) =>
    {
        try
        {
            PdfDocument pdf = renderer.RenderUrlAsPdf(url);
            string filename = Uri.EscapeDataString(url).Replace("%", "_") + ".pdf";
            pdf.SaveAs(Path.Combine(@"C:\Archive\pdf", filename));
            Interlocked.Increment(ref completed);
        }
        catch (Exception ex)
        {
            Interlocked.Increment(ref failed);
            Console.Error.WriteLine($"Failed: {url} — {ex.Message}");
        }
        Console.WriteLine($"Progress: {completed} completed, {failed} failed");
    });
using IronPdf;

var renderer = new ChromePdfRenderer();

int completed = 0, failed = 0;

await Parallel.ForEachAsync(urlList,
    new ParallelOptions { MaxDegreeOfParallelism = 4 },
    async (url, _) =>
    {
        try
        {
            PdfDocument pdf = renderer.RenderUrlAsPdf(url);
            string filename = Uri.EscapeDataString(url).Replace("%", "_") + ".pdf";
            pdf.SaveAs(Path.Combine(@"C:\Archive\pdf", filename));
            Interlocked.Increment(ref completed);
        }
        catch (Exception ex)
        {
            Interlocked.Increment(ref failed);
            Console.Error.WriteLine($"Failed: {url} — {ex.Message}");
        }
        Console.WriteLine($"Progress: {completed} completed, {failed} failed");
    });
Imports IronPdf
Imports System.IO
Imports System.Threading
Imports System.Threading.Tasks

Dim renderer As New ChromePdfRenderer()

Dim completed As Integer = 0
Dim failed As Integer = 0

Await Parallel.ForEachAsync(urlList,
    New ParallelOptions With {.MaxDegreeOfParallelism = 4},
    Async Function(url, _) As Task
        Try
            Dim pdf As PdfDocument = renderer.RenderUrlAsPdf(url)
            Dim filename As String = Uri.EscapeDataString(url).Replace("%", "_") & ".pdf"
            pdf.SaveAs(Path.Combine("C:\Archive\pdf", filename))
            Interlocked.Increment(completed)
        Catch ex As Exception
            Interlocked.Increment(failed)
            Console.Error.WriteLine($"Failed: {url} — {ex.Message}")
        End Try
        Console.WriteLine($"Progress: {completed} completed, {failed} failed")
    End Function)
$vbLabelText   $csharpLabel

从URLs生成的文件

从URL生成的文件

示例输出

URL到PDF示例输出 每个输出PDF保存到镜像原始站点层次结构的文件夹结构中,清单文件记录原始URL、转换时间戳和处理的每个文档的输出路径。

实际好处

吞吐量。 IronPDF在毫秒内渲染每个页面。 一个10,000页的档案通常在标准服务器硬件上几小时内完成,无需过夜批量窗口,无需转换运行之间手动交接。

视觉保真度。 基于Chromium的渲染意味着表格、CSS布局、嵌入的图像和内嵌样式都像在浏览器中一样处理。 归档的PDF与原始页面的外观看起来相同,而不是简化的近似。

按计划退役。 一旦归档运行完成并验证清单,遗留的服务器、数据库和CMS安装可以关闭。 内容以永久性、自容的PDF集合形式存在,不依赖于旧基础设施提供的任何内容。

合规性。 不可变的PDF快照满足法律保留和保留要求。 IronPDF支持PDF/A输出用于长期归档保存,单一渲染选项将输出转换为ISO标准化格式,适用于受监管的文档保留。

内容质量的一致性。 在渲染前注入标准化样式表可确保每个归档的PDF共享统一的边距、字体和页面尺寸,无论原始HTML是由遵循标准的开发人员编写还是从Word粘贴的内容作者编写的。

无按文件成本。 转换在内部运行。 没有调用外部转换供应商的API,也没有令大规模档案过于昂贵的定价模式。转换500页或50,000页在基础设施方面的成本相同。

结语

有一个具有退役截止日期的内容迁移不会留下手动转换工作流程或在HTML糟糕时失败的工具的时间。 转换需要自动运行,提供一致的输出,并在旧服务器下线前完成。

由IronPDF支持的.NET迁移脚本覆盖了整个表面,枚举源内容,标准化样式,通过Chromium渲染每个页面,写入归档目标,并记录故障以供审查。 IronPDF在C#中的PDF生成的完整生命周期处理在ironpdf.com,从渲染HTML字符串和URLs到保存、流处理和操作文档。 如果您正在定义迁移范围或启动试点运行,免费30天试用为您提供足够的时间来转换旧内容的代表样本并验证输出,然后再提交完整的档案。

Curtis Chau
技术作家

Curtis Chau 拥有卡尔顿大学的计算机科学学士学位,专注于前端开发,精通 Node.js、TypeScript、JavaScript 和 React。他热衷于打造直观且美观的用户界面,喜欢使用现代框架并创建结构良好、视觉吸引力强的手册。

除了开发之外,Curtis 对物联网 (IoT) 有浓厚的兴趣,探索将硬件和软件集成的新方法。在空闲时间,他喜欢玩游戏和构建 Discord 机器人,将他对技术的热爱与创造力相结合。

钢铁支援团队

我们每周 5 天,每天 24 小时在线。
聊天
电子邮件
打电话给我