很多人手里有一批扫描版 PDF——相机拍的、扫描仪扫的、或者老文档转成的图片型 PDF。这类文件有两个麻烦:
第一次认真考虑"作业辅导"这件事,是从研究腾讯云的一批 AI Skills 开始的。当时在系统梳理这些能力:OCR 能读图、ASR 能听声、TTS 能说话、内容...
最近,我在 Timeline Studio 中实现了实物描边能力:识别画面中的商品、鞋子、玩具等物体,并在浏览器本地生成可编辑的描边效果。
本文拆解漫画翻译中"保留画风"背后的技术管线:从 OCR 文字识别、原文擦除、Inpaint 图像修复到重新嵌字排版,分析每个环节的技术难点与处理逻辑。适合对图...
你接入了某个文档解析服务,处理一批扫描的业务申请表。表格主体看起来规整——账户名称、账号等,各占一行。但在各项“金额”栏里,旁边还嵌着一个小表格,分别列出“万、...
DeepSeek 放了个大招, 发布“DeepSeek-OCR: Contexts Optical Compression”论文及相关模型: 个人认为影响程度不...