提供3000多款全球软件/控件产品
针对软件研发的各个阶段提供专业培训与技术咨询
根据客户需求提供定制化的软件开发服务
全球知名设计软件,显著提升设计质量
打造以经营为中心,实现生产过程透明化管理
帮助企业合理产能分配,提高资源利用率
快速打造数字化生产线,实现全流程追溯
生产过程精准追溯,满足企业合规要求
以六西格玛为理论基础,实现产品质量全数字化管理
通过大屏电子看板,实现车间透明化管理
对设备进行全生命周期管理,提高设备综合利用率
实现设备数据的实时采集与监控
利用数字化技术提升油气勘探的效率和成功率
钻井计划优化、实时监控和风险评估
提供业务洞察与决策支持实现数据驱动决策
翻译|使用教程|编辑:李显亮|2020-04-22 10:40:52.910|阅读 514 次
概述:为了在C ++应用程序中自动进行PDF解析,本文演示了如何使用C ++ 从PDF文档中提取文本。
#慧都22周年庆大促·界面/图表报表/文档/IDE/IOT/测试等千款热门软控件火热促销中>>
相关链接:
在数字信息领域,从文档(PDF,文字处理,网页等)中提取文本具有多种用例。例如,它可以用于解析文档,执行文本分析,信息检索,将文档内容存储到数据库中等等。如果缩小范围,PDF是保存和共享数字信息的最广泛使用的文档格式之一。这种受欢迎程度使PDF文档成为信息的巨大来源。因此,从PDF文档中解析或提取文本可能会涉及多种文本分析方案。
为了在C ++应用程序中自动进行PDF解析,本文演示了如何使用C ++ 从PDF文档中提取文本。它涵盖以下文本提取方案:
Aspose.PDF for C ++使您可以通过几个简单的步骤来解析PDF文档。以下是从PDF文档提取文本的方法。
以下代码示例显示了如何使用C ++从PDF中提取文本。
auto extractor = MakeObject(); // Bind source PDF document extractor->BindPdf(u"candy.pdf"); // Extract text from PDF to PdfExtractor extractor->ExtractText(); auto memStream = MakeObject(); // Save text into memory stream extractor->GetText(memStream); auto unicode = System::Text::Encoding::get_Unicode(); String allText = unicode->GetString(memStream->ToArray()); // Print extracted text Console::WriteLine(u"Extracted text:"); Console::WriteLine(allText);
在某些情况下,仅需要从几页PDF中提取文本。在这种情况下,可以通过设置开始和结束页码来指定PDF中的页面范围。以下是从PDF文档中特定页面提取文本的步骤。
以下代码示例显示了如何从C ++中的PDF特定页面提取文本。
auto extractor = MakeObject(); // Bind source PDF document extractor->BindPdf(u"candy.pdf"); // Set page range extractor->set_StartPage(2); extractor->set_EndPage(2); // Extract text from PDF to PdfExtractor extractor->ExtractText(); auto memStream = MakeObject(); // Save text into memory stream extractor->GetText(memStream); auto unicode = System::Text::Encoding::get_Unicode(); String allText = unicode->GetString(memStream->ToArray()); // Print extracted text Console::WriteLine(u"Extracted text:"); Console::WriteLine(allText);
您可以从文档的每一页分别提取文本,而不是从PDF文档提取所有文本。以下是从PDF中逐页提取文本的步骤。
下面的代码示例演示如何在C ++中从PDF逐页提取文本。
auto extractor = MakeObject();
// Bind source PDF document
extractor->BindPdf(u"candy.pdf");
// Extract text from PDF to PdfExtractor
extractor->ExtractText();
auto unicode = System::Text::Encoding::get_Unicode();
int pageNumber = 1;
while (extractor->HasNextPageText())
{
auto memStream = MakeObject();
extractor->GetNextPageText(memStream);
String text;
// Specify Unicode encoding type in StreamReader constructor
auto streamReader = MakeObject(memStream, unicode);
streamReader->get_BaseStream()->Seek(0, SeekOrigin::Begin);
text = streamReader->ReadToEnd();
streamReader->Dispose();
// Print extracted text
std::cout << "Page: " << pageNumber << "\n"; Console::Write(text); std::cout << "\n------------------------\n"; pageNumber++; }
本站文章除注明转载外,均为本站原创或翻译。欢迎任何形式的转载,但请务必注明出处、不得修改原文相关链接,如果存在内容上的异议请邮件反馈至chenjj@hmdbvip.cn




本文主要介绍如何在MVVM应用程序中使用虚拟源,欢迎下载最新版组件体验!
Aspose.Slides for Java使用户能够轻松地操作幻灯片、添加注释和转换文件。其易用性和集成能力提高了工作效率,使开发人员能够专注于更关键的任务。
在嵌入式软件测试领域,对交叉编译代码进行单元测试是一大挑战。Parasoft C/C++test作为专业的C/C++测试工具,能够与劳特巴赫Trace32调试器深度集成。下面会详细介绍如何在C++test中配置Trace32调试器,实现对PowerPC架构程序的单元测试,涵盖环境设置、项目导入到测试执行的全过程。
本文将为大家介绍如何使用DevExpress WinForms数据网格控件实现摘要文本的格式化,欢迎下载最新版组件体验!
服务电话
重庆/ 023-68661681
华东/ 13452821722
华南/ 18100878085
华北/ 17347785263
客户支持
技术支持咨询服务
服务热线:400-700-1020
邮箱:sales@hmdbvip.cn
关注我们
地址 : 重庆市九龙坡区火炬大道69号6幢
永利最大(官方)网站