浙大等让轮腿机器人不用力传感器也会擦白板、开带闭门器的门
浙江大学、上海人工智能实验室、清华大学、云深处科技等机构提出FWBC-VLA,让轮腿机器人无需加装力传感器,也能估计接触强度并调整全身动作。系统用5000余条数据训练,在实机上完成擦白板和开启带闭门器的门;验证只覆盖这两类接触任务。
浙江大学、上海人工智能实验室、清华大学、云深处科技等机构提出FWBC-VLA,让轮腿机器人无需加装力传感器,也能估计接触强度并调整全身动作。系统用5000余条数据训练,在实机上完成擦白板和开启带闭门器的门;验证只覆盖这两类接触任务。
伊利诺伊大学厄巴纳-香槟分校团队提出EditVid,用一个免训练框架兼容指令驱动和参考主体驱动的视频编辑。它在FiVE上取得78.16 FiVE-Acc,对比免训练基线为58.95,用户研究总体偏好51.8%;优势来自论文选定任务和模型,不
中国科学院自动化研究所、清华大学、复旦大学、新加坡国立大学等机构提出GIFT,训练机器人策略时强制中间视觉特征保留几何、可操作区域和目标位置。三种配置在LIBERO-Plus零样本迁移中最高达到87.8%;实机结果覆盖论文设置的单臂、双臂操
香港城市大学、苏黎世联邦理工学院提出KnowVis,把线性视频课程改排成概念图、知识单元和视觉摘要。团队整理10个学科的125段视频并生成1079份摘要,人体研究报告认知负担下降、学习与保持改善;样本规模有限,不能外推到所有课程和长期学习。
阿里通义、清华大学提出Terminal-Universe,把代码智能体留下的一次性操作轨迹还原成可重复运行的终端环境。系统从公开轨迹构建3.73万个环境,训练Qwen3.5-27B后,单轮与多轮基准分别提升11.9和13.8分;恢复过程包含
英伟达、阳明交通大学提出Scal3R,专门修复长视频在线三维重建的累计位姿漂移。它冻结原有主干,只增加约1%可学习参数,单张GPU训练8小时,并把KITTI相对在线基线的平均轨迹误差降低超过60%;这个比例只对应论文比较设置。
微软亚洲研究院、中国科学技术大学、清华大学等机构提出OctWorld,从一张图沿指定相机路线持续生成可探索视频。系统用动态八叉树保存三维记忆,重点处理长路径后重新看见旧区域时的空间一致性;论文展示的是离线作者实验,不能据此认定已经达到实时交
Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也
美团、中国科学技术大学、南京理工大学、新加坡国立大学等机构提出BooM-VVT,让视频虚拟试衣不再需要用户提供试衣区域掩码。方法用图像级伪数据学习定位,并在大动作、遮挡和多视角条件下保持服装细节;成绩来自论文数据集与作者比较,尚不代表任意自
腾讯混元、复旦大学、上海人工智能实验室等机构提出WorldReward,把世界模型的镜头动作执行和画面质量交给同一个奖励模型判断。它在760对人工标注视频上,三项偏好一致性分别比GPT-5.5高3.42、1.45和3.56个百分点;结果来自
北京大学王选计算机研究所与MemoraX AI联合提出GraphMemix,将长期多模态记忆检索重构为查询驱动的“证据森林”组合优化,在四项基准上取得61.55%的平均Judge Accuracy。
DocIQ 的价值不只在于提出了一个新的文档图像质量评估模型,更在于它明确了文档智能系统中的一个关键问题:文档图像不是普通自然图像,文档质量也不是单纯的视觉美学问题。
伊利诺伊大学厄巴纳-香槟分校、Meta联合提出PILL,让扩散语言模型补代码或文本时先预测缺口长度,再并行尝试附近候选。它在5种模型、8个基准上比最强基线快1.82倍,代码平均通过率提高4.8点、文本BLEU-2提高6.0点;结果不代表所有
巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数
伊利诺伊大学厄巴纳-香槟分校、宾夕法尼亚大学、斯坦福大学、剑桥大学等机构联合提出Kirin,从野外视频重建四足动物3D动作,再按文字和图片生成可直接驱动网格的动画。项目展示了多物种动作和基线对比,降低动物动作采集门槛;效果仍受视频遮挡、重建
浙江大学、上海交通大学、诺埃马特里斯、无尽人工智能等机构联合提出HINT,让机器人只在操作阶段切换时重新理解指令,随后用多视角定位和跟踪维持目标。框架在3项长流程任务、2种基础策略及多类未见变化中提高任务进展和端到端成功率;证据仍来自指定分
智元机器人、北京大学、中国人民大学、香港大学等机构联合提出ZETA,用14种保留机型研究视觉语言动作模型能否跨机器人迁移。仅在预训练中加入5%目标机型数据,平均任务进展就提高13.4个百分点,说明“完全没见过”和“预训练见过少量”必须分开报
谷歌DeepMind、伦敦大学学院、牛津大学、苏黎世联邦理工学院等机构联合构建TAPVid-MV,收录284段序列、1142路标定相机流和109769条3D点轨迹。30多种基线仍远未解决任务,多视图跟踪器也不稳定优于单目方法;结论针对该基准
加州大学伯克利分校、直觉外科公司等机构联合提出MACAW,让达芬奇研究机器人用视觉伺服对准碎片,再以单目图像控制抓取深度。双臂设置在物理实验中达到92%成功率,平均7秒处理一个碎片、折合每小时473个;实验使用研究平台和仿真组织碎片,不能视
清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来