组件分享之后端组件——docconv组件将文档转换为纯文本
背景
近期正在探索前端、后端、系统端各类常用组件与工具,对其一些常见的组件进行再次整理一下,形成标准化组件专题,后续该专题将包含各类语言中的一些常用组件。欢迎大家进行持续关注。
组件基本信息
- 组件:docconv
- 开源协议:MIT License
- 使用与下载:https://github.com/sajari/docconv
内容
本次分享的组件是用于将PDF, DOC, DOCX, XML, HTML, RTF, ODT,页面文档和图像转换为纯文本使用的,该组件是基于Golang语言开发的,具体使用如下:
代码语言:javascript复制package main
import (
"fmt"
"log"
"code.sajari.com/docconv"
)
func main() {
res, err := docconv.ConvertPath("需要转换的文件.pdf")
if err != nil {
log.Fatal(err)
}
fmt.Println(res)
}
读取远程文件使用如下:
代码语言:javascript复制package main
import (
"fmt"
"log"
"code.sajari.com/docconv/client"
)
func main() {
// 使用默认端点创建一个新客户端 (localhost:8888)
c := client.New()
res, err := client.ConvertPath(c, "your-file.pdf")
if err != nil {
log.Fatal(err)
}
fmt.Println(res)
}
本文声明:
本作品由 cn華少 采用 知识共享署名-非商业性使用 4.0 国际许可协议 进行许可。