[精品]若何将中国知网caj、nh、kdh、pdf格局文件转换成word
PDF文件、caj文件、超星文件转化为Word文档
现在网上许多资料都是以CAJ、PDF等文件格式提供的~其中的文本不能被直接编辑。网上提供了许多处理这种情况的软件~但是它们不是效率低~就是只能提取其中部分文本。本文所述利用微软提供的OCR识别技术从CAJ、PDF等文件中提取全部文本的
方法
快递客服问题件处理详细方法山木方法pdf计算方法pdf华与华方法下载八字理论方法下载
~简便快捷~效率很高。
从不同格式的文件中提取文本前需要做好以下准备工作~安装CAJViewer5.5浏览器软件和acrobat 5 专业版浏览器软件安装Office2003~并完全安装Of?鄄fice工具Microsoft Office Document
Imaging~然后在打印机里面会增加Microsoft Office Document
Image Writer打印机。 Microsoft Office Document Image可以非常准确的全文件识别转化中文、英文、表格。
一、CAJ文件的识别
,一,首先~从网上下载CAJ格式的资料文件保存到本地硬盘上。
,二,然后~启动CAJViewer浏览器程序~并在该程序中打开刚才保存的CAJ格式的文件。浏览文件到最后一页后~不要关闭CAJ浏览器程序。
,三,在CAJ浏览器程序窗口中~选择“文件”?“打印”~并选择打印机为Microsoft Office Document Image Writer打印机~勾选打印到文件选项和确定打印页数。
,四,保存打印文件,*.prn,到适当位置。等待打印完成后~
Microsoft Office Document Image 自动打开刚才保存的打印文件。
,五,在Microsoft Office Document Image窗口中~选择“页面”菜单中的“选择所有页面”菜单项~然后选择“工具”菜单中的“使用OCR识别文本”提取文本。
,六,选择“工具”下的 “将文本发送到word”~最后将把整个CAJ文件识别输出到word文件中。
二、PDF文件的识别
,一,以文本形式保存的PDF文件~用acrobat 5 专业版~识别整个文件。直接打开从网上下载的PDF格式文件另存为RTF文件~或者选择工具栏上的文字选择按钮~然后选择文字区域~然后复制到Word中即可。
,二,以图片形式保存的PDF文件~将PDF文件打印到Microsoft Office Document Image Writer打印机~选择打印形成的文件的保存位置~然后会自动形成一个MDI文件~并且自动用Microsoft Office
Document Image打开此文件~然后在Microsoft Office Document Im?
鄄age中选择“工具”菜单中的“使用OCR识别文本”~识别完成后~在选择“工具”下的~“将文本发送到word”~最后将把整个PDF文件识别输出到word文件中。
,三,加密的PDF文件先下载解密软件~解密后在参照上述步骤1),2) 进行。 ,四,繁体PDF文件用上述步骤2)的方法识别到word后~用word中的“工具”?“语言”?“中文繁简转换”
三、超星文件的识别
,一,全文件识别打印到Microsoft Office Document Image
Writer打印机~然后按上述PDF文件的识别步骤中第二点操作~要注意的是~超星打印功能有点区别~因为超星是目录和全文分开的~所以打印时~需要分别把目录和正文识别到Word中~再合并到一起。打印时要填入打印页码从1到最后一页~不要选择打印全部。在打印选项中~要将页面比例设成真实大小~而不是整宽。注意识别速度比其他格式要慢很多~请保持耐心。一般一本200多页的书~识别需要几分钟的时间。
,二,超星文件识别相对比较麻烦一些~如果还有问题~可以先把超星打印成完整的PDF文件~然后再用上述识别PDF文件的方法转成Word。
四、后记