暂无搜索历史
给视频第一帧的目标掩码,后面所有帧都不再给标注。一套冻结视觉模型能把目标跟到最后吗? 这次没有接入专门训练的视频分割网络,也没有根据验证集标签调阈值。我们把 ...
在固定的官方模型、数据快照、推理与评分实现下,LocateAnything-3B 在 RefCOCOg validation 的 4,889 条指代表达上取得8...
不再只问「模型能不能检出」,而是问:在最新训练栈上,默认配方到底长什么样、贵不贵、准不准。底座选定两套当下最热的检测训练框架——
前面测过:YOLO-World / OWL-v2 在自然场景 100% 命中,在裸金属条上 0%。读者最常问的下一句是——
25 正常训练 · 42 测试 · WRN50-2 · RTX 5060 Ti · 2026.07
3 模型 · 9 张图 · RTX 5060 Ti · conf≥0.10 · 2026.07
栈 javacpp 1.5.13 · OpenCV 4.13 阅读 ~22 min
统一视觉模型最近很火。论文漂亮、榜单好看、Demo 惊艳——但工业现场的图,它到底行不行? 我们没有用官方精美样例,而是把自己的金属工件、产线双目图,加上从网...
224-linear vs 512-linear · 6 对真实图 · RTX 5060 Ti 16GB · 2026.07
Base vs Large · 6 对真实图 · RTX 5060 Ti 16GB · long-edge 768 · 2026.07
SmolDocling 是 IBM Docling 团队发布的超轻量多模态文档解析模型,参数量仅 256M, 基于 HuggingFace 的 Idefics3...
2.3k 行 Java 代码 · 真 1.7B 模型端到端跑通 附完整架构图、KV Cache 机制解析、SmolVLM 图片理解实测
UniFlowMatch vs RoMa v2 · RTX 5060 Ti · FP32 · 2026.07
做电商、做设计、做内容,谁都逃不开"把主体抠出来"这件事。这两年大家都在用 SAM2(SAM3 很强但太重了不做比较),但真到了头发丝、毛发、商品批量抠图,总感...
在工业视觉检测中,模板匹配是最基础也最关键的任务。给定一张模板图和一张检测图,找到它们之间的对应关系,从而精确定位零件。
传统物体检测(YOLO、Faster R-CNN)虽然精确,但需要大量标注数据训练。而最近大火的视觉语言模型(VLM)让我想到一个思路:
RoMa v2 · CVPR 2025 稠密特征匹配 · 亚像素级坐标映射 · 2026.07
在工业视觉检测中,测量弯曲物体(绳索、金属条、软管)的宽度是常见需求。medial_axis 是 scikit-image 的核心算法——从二值图像中提取物体的...
最开始我让 GPT-4o / Qwen 直接判断 "该调哪些 tool",效果不差,但生产上有三个硬伤:
最近在做一个和模板匹配相关的需求,翻到一篇发表在 Expert Systems with Applications 上的工作,叫 PoseMatch-TDCM。...
暂未填写公司和职称
暂未填写技能专长
暂未填写学校和专业
暂未填写个人网址
暂未填写所在城市