暂无搜索历史
✨导读:现有无人机多模态大模型只看懂环境、分不清自身运动状态,本文打造SIS-Bench统一评测基准,从「空间认知+自我觉知」双维度分层评估26款主流模型;进一...
多视角生成和视频生成有一个共同的难点:单张图看上去可能都不错,但放在一起就容易“穿帮”。同一个物体换个视角后结构变了,纹理一会儿有一会儿没;视频里主体走着走着形...
2024级硕士研究生赖勇文在王超群副教授指导下,研究成果《AnyStyle: A Single LoRA is Sufficient for Image-Gui...
论文题目:From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vis...
道路异常分割是自动驾驶开放世界感知与安全决策中的基础技术,旨在识别遗落货物、异常障碍物、路面塌陷等未被预先定义的危险目标。近年来,随着深度视觉模型和开放世界感知...
近日,国际顶刊Nature在线发表了一篇题为《人形机器人用于外科手术的活体可行性研究》的论文。该研究将宇树G1人形机器人搬进了手术室,让它握着给人类医生使用的普...
近日,第34届ACM国际多媒体会议(The 34th ACM International Conference on Multimedia, ACM MM 20...
同方知网数字科技有限公司 7 月 15 日发布《知网关于人工智能(AI)署名为作者的论文处理声明》:
近日,东南大学网络空间安全学院23级大三本科生施奕彤,在韦康老师和霍赋硕老师的指导下,完成了关于自监督编码器模型防御窃取的研究工作,成果以第一作者身份被计算机视...
本文介绍了武汉大学行为理解与视觉感知实验室(HUVPR-Lab)在ECCV2026上发表的研究成果。该工作针对以人为中心的音视频联合生成中长期存在的"语音-音...
Transformer依然是当下的绝对主流,但简单套用和魔改已经过时,深度和创新性才是顶会审稿人的菜!比如ACL26上关于局部注意力为何有效的论文。
Project Page: https://xiaobiaodu.github.io/flux-gs-project/ Code(移动端与训练代码均已开源)...
《金融时报》爆料,腾讯正在洽谈成为Manus最大股东。该笔交易的目的是撤销Meta对Manus的收购,参与方是Manus的老股东们,回购价格仍为当初的20亿美元...
近日,计算机图形学与多媒体领域顶级会议ACM International Conference on Multimedia(ACM MM 2026)公布了论文接...
随着三维高斯泼溅(3D Gaussian Splatting, 3DGS) [1] 和神经辐射场(Neural Radiance Fields, NeRF)[2...
6 月初,Google DeepMind Build Day 活动期间,他坐下来,接受了一场完全没有脚本的现场问答,主题是「前沿 AI」。
近日,西南财经大学新财经综合实验室最新的研究成果“A General Image Fusion Approach Exploiting Gradient Tra...
从“拍脑袋修 Bug”到“多假设因果诊断”,完全自动科研的容错能力换一个视角被重新设计。
✨导读:大模型加持的机器人导航,为何总陷入“决策黑箱”、泛化差、易过拟合的困境?传统方案直接输入输出映射无推理、思维链训练缺优质标签,难以落地。本文提出Evol...
能力、速度、成本三者叠加,才是它的竞争力所在。也就是说,它干活儿用的Token,只有别人的零头。
暂未填写公司和职称
暂未填写个人网址