纯文本抽出程序库DMC TEXT FILTER

因需而生,红樱枫为文本转换市场领航

——纯文本抽出程序库DMC TEXT FILTER,从需求中把握平衡

在高度数字化的今天,数字图书馆已经成为很多人查询资料的有效途径。然而即使在畅通的宽带搜寻中一样会出现堵塞,可恨的是这种堵塞可能并不是网络造成的,而是出于个人电脑的软件配置。就读国际关系学院的研究生韩小姐颇有感触:“在查找资料时,面对繁多的数据格式,由于手头的工具太少,大量的文件无法打开,只好望而兴叹。”据了解,有韩小姐这种想法的用户不在少数。

广泛需求,催熟应用市场

对症下药,红樱枫软件公司的纯文本抽出程序库DMC TEXT FILTER应运而生。它不仅只针对以上所提到的小范围用户,它是基于一个市场广阔需求境况而开发的。来自市场的需求才是产品生存的基础,DMC TEXT FILTER纯文本抽出程序库积极响应了数字时代的召唤,同时它很大程度应和了数字信息资源的一大基本表现组织——数字图书馆的较高需求。

数字图书馆无论在资源创建、存储、检索还是管理上,都依赖于强大的数据转化程序和网络的支持。数字化图书馆在某种程度上实现了全球资源的共享,但是在资源搜索与存贮中,多种语言格式的存储,为浏览和信息提取造成了较多的困难。在数字信息网络中,文件的格式并非以我们常用的文本格式所存储。以PDF文件为例,目前网络中多数技术资料以PDF格式提供,但在进行资料翻译或引用时,常常会因无相应软件的支持而无法实现。再如经由日本一太郎编辑存储的文件,如果没有与其相兼容软件的支持,就不能实现在既定电脑上的读取。用户的切实需求反应在软件上,就暴露出问题的所在——数据格式转换软件的开发面临全新市场。

提到数据格式转换软件,我们从WEB搜索的应用上足可窥其广阔的需求态势。全球最大的搜索网站百度,就采用了高效数据转换技术。以提高搜索引擎的搜索质量和易用性为主要目标,百度将纯文本抽出程序库应用于搜索引擎,进行二次开发和应用,为用户提供了一个既易于操作、又能准确查询的搜索技术平台。文本抽出程序在INTERNET中的二次应用,使搜索网站在专业化进程中更进一步。

同样,类似WEB搜索引擎,在邮件处理中一样需要纯文抽出程序库来帮忙。为使商业邮件的管理更为有序高效,用户需要找到一个简单快捷的途径,来对邮件进行检索规整。这就相当于要在电脑上建立一个“透视眼”,对目标性信息进行查询。只要键入目标信息,就可以在不打开附件的情况下,找到搜索目标,可获知信件的主要信息,这样既能提高效率又能保证网络安全。

表面看似毫无关联的三种市场需求,实际上都需要纯文本抽出程序软件来解决问题。成熟的市场,已经把新的软件开发课题提到日时日程上来。因此,北京红樱枫软件有限公司的DMC纯文本抽出通用程序库的应用推广,对广大用户而言,无疑是一大喜讯。

红樱枫DMC,施展数据格式转换的魅力

纯文本抽出通用程序库DMC TEXT FILTER是将各种电子文档中的特殊控制信息完全除掉,将纯文本内容进行快速提出的OEM软件部件。它的应用可使各种文件处理软件简单、快速的对文件进行处理,而且在文本内容提取过程中,它完全独立于生成文件的原应用软件。也就是说在不需要安装其他应用软件的情况下,就可以通过DMC TEXT FILTER来查看和阅读数十种格式的文件内容。

作为OEM软件,DMC TEXT FILTER本身就具有很强的可塑性。纯文本抽出通用程序库DMC TEXT FILTER支持目前被广泛使用的许多应用软件的电子文件,可自由地对许多种字符集(UNICODE)进行操作。它提供了七个主要公开API接口:文件识别功能、文本抽出功能、属性抽出功能、页抽出功能、加密PDF文本的抽出功能、加密PDF的属性抽出功能、加密PDF的页抽出功能,同时还提供了大量的函数接口及各种选项用于对不同类型文件的操控。

  作为工具软件,它具备了多语言、多平台、多线程的多种特性,使用户更加亲近不同操作程序的文件和不同语言文字集合的文件,在面对繁多的数据格式也一样能游刃有余。它支持简体中文、繁体中文、日文、韩文、英文等多种语言,可以在Windows、Solaris、Linux、Macintosh、IBM_AIX、HP-UNIX等各多种平台上运行。亦可根据OEM用户的需求,亦可生成相应的操作系统版本。特别是在Linux、Solaris环境下处理诸如word等格式文件的技术,目前在国内还处于绝对领先地位。多线程的特点更加体现了该产品在应用中的领先优势。所谓多线程就是指在一个程序中同时启动多个线程,多线程运行可以使服务器同时响应多个用户的请求,且多线程比多进程更节省系统资源。

  基于以上的特点,纯文本抽出程序库DMC TEXT FILTER拥有了超大兼容性,它的表现足可令用户放心。它支持目前被广泛使用的许多应用软件的电子文件,如ADOBE的PDF、Pagemaker、Microsoft的Word、Excel、PowerPoint、RTF以及LOTUS 1-2-3、AUTOCAD、HTML、XML、日文一太郎、OASYS等应用软件生成的文件。DMC TEXT FILTER程序库的推出,将为其他软件厂商、INTERNET系统构筑商以及网络系统集成商提供又一可供OEM捆绑的软件部件。特别是移动通讯网络服务的发展,通过纯文本内容抽取,可以使PDA产品,甚至小小的手机都能阅读到大千世界的各种各样的丰富信息。

  在高速发展与更新的软件世界,没有一成不变的软件产品,能以一成不变的钻研精神来迎合市场的瞬息万变,能在市场和应用中把握平衡,这才是高明赢家的做法。期待红樱枫及软件业其他并肩做战者施展数字转换的魅力,演绎出更多的数字神奇。

纯文本抽出程序库DMC TEXT FILTER

时间: 2024-10-11 06:00:50

纯文本抽出程序库DMC TEXT FILTER的相关文章

数据抽取——纯文本抽出程序库DMCTextFilter

数据抽取工具 纯文本抽出程序库DMCTextFilter DMCTextFilter V4.2是由北京红樱枫软件有限公司研制和开发的纯文本抽出通用程序库产品.本产品可以从各种各样的文档格式的数据中或从插入的OLE对象中,完全除掉特殊控制信息,快速抽出纯文本数据信息.便于用户实现对多种文档数据资源信息进行统一管理,编辑,检索和浏览. 一.应用案例 在实际的推广和应用中,红樱枫的通用文本抽出程序软件被应用到了多个领域,如:信息资源开发利用,智能搜索引擎,情报分析和服务,信息安全,企业知识门户,数字图

数据抽取工具——DMCTextFilter(纯文本抽出通用程序库)

DMC文本抽出支持office.pdf.邮件.压缩文件等几乎所有软件的各个版本的文本提取以及邮件中的附件.压缩文件中的压缩文件.嵌入文件中的文件的文本提取. DMCTextFilter 是由北京红樱枫软件有限公司研制和开发的纯文本抽出通用程序库产品.本产品可以从各种各样的文档格式的数据中或从插入的OLE对象中,完全除掉特殊控制信息,快速抽出纯文本数据信息.便于用户实现对多种文档数据资源信息进行统一管理,编辑,检索和浏览.本产品采用了先进的多语言.多平台.多线程的设计理念,支持多国语言(英语,中文

数据抽取工具——DMCTextFilter V4.2(纯文本抽出通用程序库)

DMCTextFilter V4.2是由北京红樱枫软件有限公司研制和开发的纯文本抽出通用程序库产品.本产品可以从各种各样的文档格式的数据中或从插入的OLE对象中,完全除掉特殊控制信息,快速抽出纯文本数据信息.便于用户实现对多种文档数据资源信息进行统一管理,编辑,检索和浏览.本产品采用了先进的多语言.多平台.多线程的设计理念,支持多国语言(英语,中文简体,中文繁体,日本语,韩国语),多种操作系统(Windows,Solaris,Linux,IBM AIX,Macintosh,HP-UNIX),多种

数据格式转换(二)纯文本抽出

DMCTextFilter是由北京红樱枫软件有限公司研制和开发的纯文本抽出通用程序库产品.本产品可以从各种各样的文档格式的数据中或从插入的OLE对象中,完全除掉特殊控制信息,快速抽出纯文本数据信息.便于用户实现对多种文档数据资源信息进行统一管理,编辑,检索和浏览. 本产品采用了先进的多语言.多平台.多线程的设计理念,支持多国语言(英语,中文简体,中文繁体,日本语,韩国语),多种操作系统(Windows,Solaris,Linux,IBM AIX,Macintosh,HP-UNIX),多种文字集合

纯文本抽出通用程序库 让您不再为文本抽出和处理发愁!

该程序库可以从数十种数据文件格式中,将纯文本数据进行抽出,通过该程序库,用户可以轻松获得各种格式文档的文字信息,方便检索和处理.功能:(1)文件自动识别:可识别源生成文件和其版本,文件的识别不是根据文件的扩展名,而是根据文件内部信息进行识别.(2)文本抽出:从指定的文件或嵌在文件中的OLE对象中抽出文本数据.(3)属性抽出:从指定文件中,将文件属性抽出到属性结构体中.(4)页面抽出:从指定文件中,抽出指定页中的文本数据.(5)加密PDF文件抽出:从设定了安全包保护的PDF中抽出文本数据.特点:方

数据转换服务-文本抽出技术

利用我公司自主开发的数据格式转换产品,面向社会各界,提供数据转换技术服务.根据用户的需求,将用户提供的原始数据文件转换为用户所需的数据文件格式.本公司向广大用户承诺,数据格式转换结果满足用户的需求,收费价格合理.为用户提供质量优良的技术服务. DMC Text Filter是北京市红樱枫软件有限公司自主独立开发完成的,支持多平台.多线程.多语言的通用文本抽出程序库.利用该程序库可以从数十种数据文件格式中,将纯文本数据进行抽出. (1)原数据文件的语言 中国语(简体/繁体),英语,日本语及韩国语.

优秀的文本抽出工具-TextPorte

大数据时代的最佳选择 TextPorter纯文本抽出软件 北京博信施科技有限公司是一家专业从事数据格式转换.数据处理领域研发软件产品和解决方案实施的技术型公司.随着大数据时代的到来,数据的处理.加工.生产.流通.管理成为了人们必不可少的一部分.TextPorter纯文本抽出软件可以从多种文件格式的数据中或从插入的OLE对象中,完全除掉特殊控制信息,快速抽出纯文本数据信息.广泛应用于全文检索.搜索引擎.文档管理等技术领域,百度.搜狐.拓尔思.Openfind等知名企业将本软件应用在文本检索系统.搜

利用htmlparser提取网页纯文本的例子

import org.htmlparser.Node; import org.htmlparser.NodeFilter; import org.htmlparser.Parser; importorg.htmlparser.filters.TagNameFilter; import org.htmlparser.tags.TableTag; import org.htmlparser.util.NodeList; /** * 标题:利用htmlparser提取网页纯文本的例子 */ publi

Python发送多个附件和支持HTML及纯文本内容的 Email 实现

由于工作中经常需要收发电子邮件,例如每日(周)的工作报告,测试报告,监控告警,定时提醒等等,大都已电子邮件的形式发送.本文将实现一个 Python 的电子邮件发送类,支持发送多个附件(目录),HTML或纯文本内容,抄送收件人,多个接收者等功能. 代码实现 #!/usr/bin/env python # -*- coding: utf-8 -*- ''' Copyright (C) 2015 By Thomas Hu. All rights reserved. @author : Thomas H