pdf-extract-api：高精度文档解析和提取API开源项目

90次阅读

没有评论

一个文档解析和提取 API，支持将 PDF 或图片文件转换为结构化的 JSON 或 Markdown 格式。

它利用了先进的 OCR 技术和 Ollama 支持的语言模型来实现高精度文本转换和去除敏感信息。

支持离线运行、分布式任务处理、Redis 缓存、CLI 操作工具以及对图片中的表格、数学公式的处理。

开源地址：https://github.com/CatchTheTornado/pdf-extract-api

正文完

pdf-extract-api

发表至：值得一看开源项目

2024-11-07

转载说明：本站提供的一切软件、教程、电子书、视频、图片、音乐、文字以及所有内容信息仅供个人学习、研究或欣赏；不得将上述内容用于商业或者非法用途，否则，一切后果请用户自负。本站信息来自网友分享及网络收集整理，版权争议与本站无关。您必须在下载后的24个小时之内，从您的电脑或手机中彻底删除上述内容。如果您喜欢相关内容信息，请支持正版，进行购买注册，以得到更好的正版服务。我们非常重视版权问题，如有侵权请邮件与我们联系处理。敬请谅解！侵删请致信E-mail：tntwl@qq.com

人体象形图：免费人物象形图下载网站

新视觉影院：热门电影电视剧好看的动漫综艺节目推荐网站

内置30+神级功能的神器WebTab插件

开源照片背景去除模型：BRIA Background Removal v1.4

折纸模拟器：一个在线模拟折纸的网站

Yi King Tirage：在线易经占卦平台

诓骗：小心有骗

ResourceBoy：最好海量免费设计资源

Python：实用Python脚本合集列表开源项目

3D模型在线预览与转换：提供了一个在线预览和转换3D模型的解决方案