arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 552
2607.08688 2026-07-10 cs.CV 新提交

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

SAM-MT:实时交互式多目标视频分割

Ruiqi Shen, Chang Liu, Henghui Ding

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 研究针对多目标视频分割中帧率随目标数增加而降低的问题,基于SAM2提出SAM-MT。通过显式查询、解耦掩码注意力等方法,实现延迟与目标数解耦,保持分割性能,达到与单目标基线相当的实时速度。

Comments ECCV 2026, Project Page: https://henghuiding.com/SAM-MT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08537 2026-07-10 cs.CV 新提交

Whareformer: Learning to Track What is Where in Long Egocentric Videos

Whareformer:学习在长时间的第一人称视角视频中追踪物体位置

Jacob Chalk, Saptarshi Sinha, Dima Damen, Yannis Kalantidis, Diane Larlus

机构 * University of Bristol(布里斯托大学) NAVER LABS Europe(NAVER欧洲实验室)

AI总结 针对第一人称视角视频的OSNOM任务,提出基于Transformer的Whareformer模型,通过可更新内存和轨迹分配模块联合推理物体外观与位置,在小数据集训练后在多数据集长测试视频上达SOTA,性能显著优于先前工作。

Comments Accepted at ECCV 2026. Project Webpage: https://jacobchalk.github.io/Whareformer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08398 2026-07-10 cs.GR cs.CV 新提交

HoloTetSphere: Unified TetSphere Mesh Reconstruction for Physical Simulations

HoloTetSphere:用于物理模拟的统一四面体网格重建

YaQiao Dai, Renjiao Yi, Zhirui Gao, Wei Chen, Kai Xu, Chenyang Zhu

机构 * National University of Defense Technology, Changsha, China(国防科技大学,中国长沙) Institute of AI for Industries, Chinese Academy of Sciences, Nanjing, China(产业人工智能研究所,中国科学院,中国南京)

AI总结 研究针对物理模拟的3D重建问题,提出通过耦合高斯球与四面体元素、联合最小化网格平滑能量和多视图高斯渲染误差等方法,构建统一且拓扑连贯的四面体网格,优于现有技术,简化物理模拟。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08270 2026-07-10 cs.CV 新提交

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

作为潜在漂移的进展:缓慢演变病理的生成预测

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)

AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08203 2026-07-10 cs.CV 新提交

Metrics or Mirage? An Audit of Evaluation Inconsistencies in Colonoscopy Polyp Segmentation Benchmarks

指标还是幻影?结肠镜息肉分割基准中评估不一致性的审查

Aisha Urooj, Zain Ul Abdien, Neelu Madan

机构 * Lunit, South Korea RPTU Kaiserslautern, Germany Aalborg University \& Pioneer Center, Denmark

AI总结 研究针对结肠镜息肉分割基准评估不一致性问题,审查27篇论文发现存在省略豪斯多夫距离、训练/测试分割协议不兼容、无统计显著性检验等问题,通过重新评估模型揭示问题严重性,进而提出息肉分割报告清单进行纠正。

Comments Submitted to ECCV Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08201 2026-07-10 cs.CV cs.AI 新提交

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation

TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割

Hyeonseop Song, Seokhun Choi, Hoseok Do

机构 * LG Electronics(LG电子)

AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。

Comments Accepted to ECCV 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03330 2026-07-10 cs.CV 新提交

GrowFields: Compositional 4D Neural Fields for Topology-Changing Plant Growth

GrowFields:用于拓扑变化植物生长的组合式4D神经场

Joaquin Gajardo, Michele Volpi, Marko Mihajlovic, Siyu Tang, Lukas Roth, Sergey Prokudin

机构 * ETH Zürich(苏黎世联邦理工学院) Swiss Data Science Center(瑞士数据科学中心) Martin-Luther-Universität Halle-Wittenberg(马丁-路德-哈雷-维滕贝格大学)

AI总结 针对从稀疏纵向3D观测量化植物生长动力学的难题,提出GrowFields,将植物分解为器官并对齐到规范坐标系,学习共享神经变形场,在植物器官跟踪中表现优于现有表示。

Comments ECCV 2026 paper (main conference). v2 corrects the vertical guide lines in supplementary Figures 5-7. Project page and code available at https://joaquin-gajardo.github.io/growfields/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26687 2026-07-10 cs.CV 新提交

DeCoFlow: Structural Decomposition of Normalizing Flows for Continual Anomaly Detection

DeCoFlow: 用于持续异常检测的归一化流结构分解

Hun Im, Jungi Lee, Subeen Cha, Pilsung Kang

机构 * Seoul National University(首尔国立大学)

AI总结 针对工业环境中新产品类别顺序到达且无法访问旧数据的持续异常检测问题,提出DeCoFlow方法,通过将子网络分解为冻结通用基和任务特定低秩适配器来隔离参数更新,并引入任务特定对齐、辅助耦合层和尾感知损失,在MVTec-AD和VisA数据集上达到最先进性能且零遗忘。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07187 2026-07-09 cs.CV 新提交

EditVerse3D: High-Quality 3D Object Editing with Region-Aware Learning

EditVerse3D:基于区域感知学习的高质量3D对象编辑

Youtan Yin, Yanning Zhou, Jiacheng Wei, Xiaofeng Yang, Jun Zhang, Jiayang Bai, Jingwen Ye, Weidong Zhang, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Tencent AIPD(腾讯人工智能产品部)

AI总结 针对3D对象局部编辑难题,EditVerse3D框架输入3D对象、粗略边界框和参考2D图像,利用区域感知自适应损失及数据增强技术,输出高质量编辑对象,实验证明其性能优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://editverse3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07170 2026-07-09 cs.CV 新提交

PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation

PUF:用于在线3D场景图生成的即插即用不确定性感知融合

Yi Yang, Myrna Castillo, Bodo Rosenhahn, Michael Ying Yang

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) Istituto Italiano di Tecnologia(意大利技术研究院) University of Bath(巴斯大学)

AI总结 研究在线3D场景图生成中不确定性问题,提出PUF框架,将节点关联概率化,用狄利克雷证据积累分配证据,可选先验补全边,在不同后端实例化有改进,实验表明该方法优于现有方法,确立不确定性感知融合范式。

Comments Accepted by ECCV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07119 2026-07-09 cs.CV 新提交

ColorFM: An Optimization-to-Learning Framework for Color Transfer via Flow Matching

ColorFM:一种通过流匹配进行颜色迁移的从优化到学习的框架

Yuhang He, Kai Zhang, Xiaoming Li, Du Chen, Jian Yang

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) VIVO BlueImage Lab(VIVO 蓝图像实验室)

AI总结 针对颜色迁移中现有方法的问题,提出ColorFM框架,先通过ColorFM - O方案拟合速度场产生高质量配对数据,再基于此设计ColorFM - L前馈模型,实验证明该框架在多方面表现优异,结合了优化准确性与推理速度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06943 2026-07-09 cs.CV 新提交

General Incomplete Multimodal Learning via Dynamic Quality Perception

通过动态质量感知进行通用不完全多模态学习

Xiangyu Meng, Shicai Wei

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 针对多模态学习中模态间缺失和模态内退化共存问题,提出通用不完全多模态学习框架GIML,通过动态质量感知处理上述问题,引入噪声感知质量估计器和噪声语义解耦模块,经实验验证其有效性和通用性。

Comments Accepted by ECCV 2026. Corresponding author: Shicai Wei

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06843 2026-07-09 cs.CV 新提交

Retrieving and Refining Winning Noise Tickets for Diffusion-Based Motion Generation

检索和优化用于基于扩散的运动生成的获胜噪声票证

Sakuya Ota, Qing Yu, Kent Fujiwara, Satoshi Ikehata, Ikuro Sato

机构 * Institute of Science Tokyo(东京科学研究所) LY Corporation(LY公司) National Institute of Informatics (NII)(国立情报学研究所)

AI总结 研究基于扩散的文本到运动模型语义漂移问题,提出WINRO框架,通过在扩散采样前选择和优化获胜噪声票证改善文本与运动对齐,无需重新训练,提升了不同模型的文本与运动保真度、时间鲁棒性,并推广到多种应用。

Comments Accepted to ECCV 2026, Project page: https://sinc865.github.io/winro/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06838 2026-07-09 cs.CV 新提交

WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence

WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台

Xiangyu Han, Mengyu Yang, Jiaqi Li, Bowen Chang, Ziyu Chen, Hexu Zhao, Rahul Kumar Agrawal, Anthony Rodriguez, Fiona Hua, Marco Pavone, Chen Feng, Yiming Li

机构 * May Mobility(五月出行公司) New York University(纽约大学) NVIDIA(英伟达公司) Stanford University(斯坦福大学)

AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。

Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06701 2026-07-09 cs.CV cs.AI cs.GR cs.LG cs.RO 新提交

SPEAR: A Simulator for Photorealistic Embodied AI Research

SPEAR:用于逼真的具身人工智能研究的模拟器

Mike Roberts, Renhan Wang, Rushikesh Zawar, Rachith Dey-Prakash, Quentin Leboutet, Stephan R. Richter, Matthias Müller, German Ros, Rui Tang, Stefan Leutenegger, Yannick Hold-Geoffroy, Kalyan Sunkavalli, Vladlen Koltun

机构 * Adobe Research(Adobe研究院) Intel Labs(英特尔实验室) Manycore Tech Inc(众核科技公司) Adobe(Adobe公司) NVIDIA(英伟达公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国学院)

AI总结 研究针对现有逼真模拟器局限,提出SPEAR这一Python库,通过模块化插件架构连接控制UE应用程序,提升可编程性与渲染速度,还提供新图像模态和高级编程模型,经多样示例应用展示了其效用。

Comments Accepted for publication at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06691 2026-07-09 cs.CV 新提交

CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views

CoMind:从多视角理解人类协作活动

Alexey Gavryushin, Dingxi Zhang, Zhao Huang, Alexandros Delitzas, Jiaqi Chen, Ben Ellis, Cedric Zöllner, Manthan Patel, Manuel Kaufmann, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息研究所) Microsoft Switzerland(微软瑞士公司) TU Munich(慕尼黑工业大学)

AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06609 2026-07-09 cs.LG cs.AI 新提交

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

D2PO:通过动态偏好优化扩散采样器

Jinkyu Kim, Jinyoung Choi, Bohyung Han

机构 * Seoul National University(首尔国立大学) Ulsan National Institute of Science and Technology(蔚山国立科学技术院)

AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26016 2026-07-09 cs.CV 新提交

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成

Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06402 2026-07-08 cs.CV cs.AI cs.LG 新提交

What Images Cannot Say: Language-Guided Olfactory Representation Learning

图像无法表达的:语言引导的嗅觉表征学习

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)

AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。

Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06281 2026-07-08 cs.CV 新提交

Straight-Path Flow Matching for Incomplete Multi-View Clustering

用于不完整多视图聚类的直线路径流匹配

Yiteng Yuan, Junyan Wang, Zheyuan Liu, Hong Jia, Lei Fan, Zhulin Tao, Lianbo Guo

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) University of Auckland(奥克兰大学) University of New South Wales(新南威尔士大学) Communication University of China(中国通信大学)

AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。

Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06176 2026-07-08 cs.CV 新提交

Revisiting Scene Graph Generation from the Perspective of Detector-Conditioned Reachability

从检测器条件可达性的角度重新审视场景图生成

Runfeng Qu, Pia K Bideau, Ole Hall, Julie Ouerfelli-Ethier, Klaus Obermayer, Olaf Hellwich

机构 * Technische Universität Berlin(柏林工业大学) Humboldt Universität zu Berlin(柏林洪堡大学) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、格勒诺布尔国立综合理工学院、法国国家科学研究中心格勒诺布尔计算机科学实验室) Bernstein Center for Computational Neuroscience(伯恩斯坦计算神经科学中心) Science of Intelligence Research Cluster of Excellence(智能科学卓越研究集群)

AI总结 该研究从检测器条件可达性角度重新审视场景图生成,设计实验发现基于检测器和基于查询方法的预测行为有互补线索,进而引入双SGG方法整合两种机制,经多数据集实验验证了此方法的有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06109 2026-07-08 cs.CV cs.AI 新提交

RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations

RoME:针对多种对抗性扰动的低秩专家稳健混合

Woo Jae Kim, Kyle Min, Suhyeon Ha, Joonsung Jeon, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Oracle(甲骨文公司)

AI总结 研究针对多扰动对抗训练的鲁棒性权衡问题,提出RoME方法,通过低秩专家混合及双尺度门控、威胁引导门控多样化,在联合鲁棒性和自然准确性上优于现有方法,提升对未知威胁的鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06018 2026-07-08 cs.RO 新提交

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略

Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 针对预训练视频生成模型用于机器人策略规划的局限,提出RoboTALES框架,通过基于分层语言模型的规划器和基于视觉语言模型的评论家两大创新,学习任务对齐的模拟未来以训练机器人策略,在多样操纵任务中表现优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06007 2026-07-08 cs.CV 新提交

OBBSeg: Irregular Lesion Segmentation under Oriented Bounding Box Annotations

OBBSeg:基于有向边界框标注的不规则病变分割

Jun Wei, Xinchang Liu, Yu Liu, Chuhua Yang, Shuhui Wang, Hui Huang

机构 * CSSE, Shenzhen University(深圳大学计算机科学与软件学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 针对医学图像分割像素级标注瓶颈,提出OBBSeg中间监督范式,由有向边界框引导,联合编码空间范围与方向,引入掩码到OBB损失减轻矩形偏差,通过PAFE和DBFE增强前景表示抑制背景干扰,实验表明其性能优异。

Comments 18 pages, 7 figures. ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏