漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2025-05-03 talkingdev

浏览器内免费PDF编辑器BreezePDF发布,支持文本编辑、签名合并及加密

近日,一款名为BreezePDF的免费在线PDF编辑器引发技术社区广泛关注。该工具突破传统PDF软件限制,直接在浏览器中实现全功能操作:支持添加文本、图片、电子签名、表单字段,可删除/合并页面并通过密码保护文档安全。...

Read More
2025-04-05 talkingdev

OCR pipeline革新ML训练:支持表格、图表、数学公式及多语言处理

近日,一款专注于ML训练的OCR pipeline技术引发业界关注。该工具创新性地支持表格、图表、数学公式等复杂结构的识别,并具备多语言处理能力,为机器学习数据预处理提供了高效解决方案。其核心优势在于通过优化的算法...

Read More
2025-03-19 talkingdev

[论文推荐]SmolDocling:极小型高效文档OCR模型

近日,一款名为SmolDocling的新型文档OCR(光学字符识别)模型引发广泛关注。该模型以其极小的规模和高效的性能脱颖而出,成为文档处理领域的最新突破。SmolDocling不仅能够实现闪电般的处理速度,还具备足够的准确...

Read More
2025-02-27 talkingdev

Allen AI推出OlmOCR:基于Qwen VL的PDF文本提取新突破

Allen AI近日宣布,其通过持续微调Qwen VL模型,成功训练出一款强大的PDF文本提取工具——OlmOCR。该模型基于超过20万份PDF文档进行训练,能够高效、精准地提取PDF中的文本内容。OlmOCR的推出标志着PDF文本提取技术的...

Read More
2025-02-26 talkingdev

Vision Language Models或将取代OCR技术

随着Vision Language Models(VLMs)的快速发展,传统的光学字符识别(OCR)技术正面临被取代的可能。VLMs结合了计算机视觉和自然语言处理的能力,能够更准确地理解和解析图像中的文本内容。与OCR相比,VLMs不仅能识...

Read More
2024-11-22 talkingdev

Meta全面转型:扎克伯格如何以Llama重构公司战略

Meta的Llama项目在开源AI模型与封闭模型的哲学辩论中扮演了关键角色。Llama是Meta全面战略转型的核心,标志着公司全力投入生成性人工智能。2023年7月发布的Llama 2是Meta和创始人马克·扎克伯格(Mark Zuckerberg)的...

Read More
2024-08-09 talkingdev

LLM辅助OCR技术——使用LLM纠正Tesseract OCR的错误

近日,一项名为LLM-aided OCR的技术在OCR领域引起了极大的关注,该技术使用LLM(语言模型)来协助纠正Tesseract OCR的错误。Tesseract OCR是一种开源OCR引擎,具有高度的准确性,但仍然无法避免一些错误。LLM-aided...

Read More
2024-07-23 talkingdev

zerox-文档OCR新时代, GPT-mini引领技术变革

随着数字化时代的到来,文件的电子化处理已经成为各行各业的标配。然而,文件的电子化处理通常需要时间和人力成本较高的OCR技术,而且现有的OCR技术并不能完全满足用户的需求。为了解决这个问题,一家名为Zerox的初...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page