组件分享之后端组件——docconv组件将文档转换为纯文本

2022-03-06 09:13:47 浏览数 (1)

组件分享之后端组件——docconv组件将文档转换为纯文本

背景

近期正在探索前端、后端、系统端各类常用组件与工具,对其一些常见的组件进行再次整理一下,形成标准化组件专题,后续该专题将包含各类语言中的一些常用组件。欢迎大家进行持续关注。

组件基本信息

  • 组件:docconv
  • 开源协议:MIT License
  • 使用与下载:https://github.com/sajari/docconv

内容

本次分享的组件是用于将PDF, DOC, DOCX, XML, HTML, RTF, ODT,页面文档和图像转换为纯文本使用的,该组件是基于Golang语言开发的,具体使用如下:

代码语言:javascript复制
package main

import (
    "fmt"
    "log"

    "code.sajari.com/docconv"
)

func main() {
    res, err := docconv.ConvertPath("需要转换的文件.pdf")
    if err != nil {
        log.Fatal(err)
    }
    fmt.Println(res)
}

读取远程文件使用如下:

代码语言:javascript复制
package main

import (
    "fmt"
    "log"

    "code.sajari.com/docconv/client"
)

func main() {
    // 使用默认端点创建一个新客户端 (localhost:8888)
    c := client.New()

    res, err := client.ConvertPath(c, "your-file.pdf")
    if err != nil {
        log.Fatal(err)
    }
    fmt.Println(res)
}
本文声明:

本作品由 cn華少 采用 知识共享署名-非商业性使用 4.0 国际许可协议 进行许可。

0 人点赞