arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2511.10983 2026-03-30 cs.CV cs.AI 62%

Binary Verification for Zero-Shot Vision

零样本视觉的二元验证

Rongbin Hu, Jeffrey Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需训练的二元验证流程,通过量化和二元化步骤提升零样本视觉任务性能,适用于引用表达定位、空间推理和BLINK-Jigsaw等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23517 2026-03-26 cs.LG cs.AI cs.CL cs.SC 62%

Beyond Accuracy: Introducing a Symbolic-Mechanistic Approach to Interpretable Evaluation

超越准确度:引入符号-机械方法进行可解释性评估

Reza Habibi, Darian Lee, Magy Seif El-Nasr

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符号-机械方法,通过结合任务相关符号规则与机械可解释性,评估模型在小数据下的泛化能力,揭示传统准确度指标无法检测的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15087 2026-03-26 cs.CV cs.CL cs.LG 62%

Phrase-Instance Alignment for Generalized Referring Segmentation

短语-实例对齐用于通用指称分割

E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳州立大学 Charlotte 分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过短语-实例对齐解决通用指称分割问题,通过实例级推理和POA损失实现精确对应,提升分割性能。

Comments Accepted to PVUW - CVPR 2026 Workshop. Webpage: https://eronguyen.github.io/InstAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23030 2026-03-25 cs.CV cs.AI 62%

Looking Beyond the Window: Global-Local Aligned CLIP for Training-free Open-Vocabulary Semantic Segmentation

超越窗口:用于无训练开放词汇语义分割的全局-局部对齐CLIP

ByeongCheol Lee, Hyun Seok Seong, Sangeek Hyun, Gilhan Park, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(全北大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GLA-CLIP框架,通过增强窗口间信息交换解决传统滑动窗口方法的语义不一致问题,引入代理锚点和动态归一化方案提升小目标检测性能。

Comments 18 pages, 13 figures, 12 tables, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22317 2026-03-25 cs.LG cs.AI 62%

Geometric Mixture-of-Experts with Curvature-Guided Adaptive Routing for Graph Representation Learning

具有曲率引导自适应路由的几何混合专家用于图表示学习

Haifang Cao, Yu Wang, Timing Li, Xinjie Yao, Pengfei Zhu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GeoMoE框架,通过Ollivier-Ricci曲率指导的自适应路由融合不同黎曼空间的节点表示,提升多尺度拓扑结构的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 62%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08138 2026-03-24 cs.CV cs.AI cs.MM 62%

Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性

Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13275 2026-03-24 cs.LG cs.AI 62%

PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation

PREBA:通过PCA加权检索增强LLMs和贝叶斯平均聚合进行手术持续时间预测

Wanyin Wu, Kanxue Li, Baosheng Yu, Haoyun Zhao, Yibing Zhan, Dapeng Tao, Hua Jin

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) First People’s Hospital of Yunnan Province(云南省第一人民医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PREBA通过PCA加权检索增强和贝叶斯平均聚合,结合机构特定临床证据和统计先验,提升手术持续时间预测的准确性和稳定性,实验显示其性能显著优于零样本推理方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06931 2026-03-24 cs.AI cs.LG 62%

Automated Formalization via Conceptual Retrieval-Augmented LLMs

通过概念检索增强的LLM实现自动化形式化

Wangyue Lu, Lun Du, Sirui Li, Ke Weng, Haozhe Sun, Hengyu Liu, Minghe Yu, Tiancheng Zhang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) Ant Research, Ant Group, Beijing, China(蚂蚁集团北京蚂蚁研究院,中国) Department of Computer Science, Aalborg University, Denmark(丹麦奥尔堡大学计算机科学系) Software College, Northeastern University, Shenyang 110819, China(东北大学软件学院,沈阳 110819,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CRAMF框架,通过检索数学概念定义提升LLM形式化能力,解决模型幻觉和语义鸿沟问题,在三个基准测试中实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13925 2026-03-24 cs.CV cs.AI 62%

Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation

通过查询词进行视觉分割:用于半监督图像分割的语言锚点

Numair Nadeem, Saeed Anwar, Muhammad Hamza Asad, Abdul Bais

机构 * University of Regina, Canada(里嘉大学) The University of Western Australia, Australia(西澳大学) University Canada West, Canada(加拿大西大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HVLFormer,通过生成多尺度文本查询和引入跨视角一致性正则化,提升视觉与文本对齐,以实现更准确的半监督图像分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16196 2026-03-24 cs.CV cs.LG 62%

Learn from Foundation Model: Fruit Detection Model without Manual Annotation

从基础模型学习:无需人工标注的水果检测模型

Yanan Wang, Zhenghao Fei, Ruichen Li, Yibin Ying

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) Faculty of Science, National University of Singapore(新加坡国立大学科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SDM-D框架,通过SDM和知识蒸馏技术,在无标注数据下训练高效的小模型,实现水果检测的高精度与速度,超越现有开放集检测方法。

Comments 35 pages, 11figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19608 2026-03-23 cs.CV cs.AI 62%

FB-CLIP: Fine-Grained Zero-Shot Anomaly Detection with Foreground-Background Disentanglement

FB-CLIP:基于前景-背景解耦的细粒度零样本异常检测

Ming Hu, Yongsheng Huo, Mingyu Dou, Jianfu Yin, Peng Zhao, Yao Wang, Cong Hu, Bingliang Hu, Quan Wang

机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(西安光学精密机械研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Xi’an Jiaotong University(西安交通大学) Zhongnan Hospital of Wuhan University(武汉大学中南医院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FB-CLIP框架,通过多策略文本表示和前景-背景分离,提升细粒度零样本异常检测的准确性和定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19531 2026-03-23 cs.CV cs.AI 62%

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

dinov3.seg: 基于DINOv3的开放词汇语义分割

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi

机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) IIT Bombay(印度理工学院班加罗尔) Monash University(莫纳什大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19008 2026-03-20 cs.CL cs.AI cs.LG 62%

Hypothesis-Conditioned Query Rewriting for Decision-Useful Retrieval

基于假设的查询重写用于决策有用的检索

Hangeol Chang, Changsun Lee, Seungjoon Rho, Junho Yeo, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) School of Electrical Engineering, KAIST, Republic of Korea(韩国科学技术院电气工程学院) Department of Industrial Engineering, Yonsei University, Republic of Korea(延世大学工业工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HCQR框架,通过重写查询获取证据支持假设、区分替代方案和验证关键线索,提升检索与答案选择的对齐度,实验表明在MedQA和MMLU-Med上优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 62%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 62%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 62%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02869 2026-03-18 cs.CY cs.AI cs.CV 62%

Representing Beauty: Towards a Participatory but Objective Latent Aesthetics

表现美:迈向一种参与但客观的潜在美学

Alexander Michael Rusnak

机构 * Digital Humanities Laboratory(数字人文实验室) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨神经网络如何表征美,通过跨模型表征收敛研究,发现美能产生更相似的表示,而不美的图像则不能。研究提出美的现实基础,并强调人类感知与创作在塑造深度学习模型潜在空间中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06993 2026-03-18 cs.AI cs.CV 62%

IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence

IMAIA:交互式地图AI助手用于旅行规划和地理空间智能

Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang

机构 * Microsoft(微软) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13993 2026-03-17 cs.CV cs.AI 62%

VAD4Space: Visual Anomaly Detection for Planetary Surface Imagery

VAD4Space:行星表面影像的视觉异常检测

Fabrizio Genilotti, Arianna Stropeni, Francesco Borsatti, Manuel Barusco, Davide Dalle Pezze, Gian Antonio Susto

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VAD4Space框架,用于自动化发现行星探索中的异常现象,通过实测评估了最先进的基于特征的VAD方法,并建立了两个基准数据集以支持行星科学中的异常检测应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13241 2026-03-17 stat.ML cs.AI cs.LG 62%

A Hybrid Tsallis-Polarization Impurity Measure for Decision Trees: Theoretical Foundations and Empirical Evaluation

一种混合的Tsallis-极化杂质度量用于决策树:理论基础和经验评估

Edouard Lansiaux, Idriss Jairi, Hayfa Zgaya-Biau

机构 * Emergency Department, Lille University Hospital(里尔大学医院急诊科) Lille University(里尔大学) LIRMM Montpellier University(蒙彼利埃大学LIRMM) UMontpellier(蒙彼利埃大学) CRISTAL UMR CNRS 9189 Lille University(里尔大学CRISTAL UMR CNRS 9189)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合归一化Tsallis熵与指数极化成分的混合杂质度量ITC,理论分析与实验验证显示其在决策树学习中具有良好的理论基础和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06213 2026-03-09 cs.CV cs.AI 62%

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

直击核心:一种无需训练的多模态摘要方法 via 事件链

Xiaoxing You, Qiang Huang, Lingyu Li, Xiaojun Chang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04819 2026-03-06 cs.RO cs.AI cs.LG 62%

On the Strengths and Weaknesses of Data for Open-set Embodied Assistance

关于数据在开放集具身助益中的优势与劣势

Pradyumna Tambwekar, Andrew Silva, Deepak Gopinath, Jonathan DeCastro, Xiongyi Cui, Guy Rosman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 62%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04002 2026-03-05 cs.CV cs.AI 62%

Discriminative Perception via Anchored Description for Reasoning Segmentation

通过锚定描述实现的判别感知用于推理分割

Tao Yang, Qing Zhou, Yanliang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03343 2026-03-05 q-bio.NC cs.AI cs.LG 62%

Neuro-Symbolic Decoding of Neural Activity

神经符号解码神经活动

Yanchen Wang, Joy Hsu, Ehsan Adeli, Jiajun Wu

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 NEURONA通过结合符号推理与fMRI基础,提升神经活动解码的准确性和泛化能力。

Comments ICLR 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14572 2026-03-04 cs.LG cs.AI 62%

Robust Weight Imprinting: Insights from Neural Collapse and Proxy-Based Aggregation

鲁棒性权重印刻:来自神经坍缩和基于代理的聚合的见解

Justus Westerhoff, Golzar Atefi, Mario Koddenbrock, Alexei Figueroa, Alexander Löser, Erik Rodner, Felix A. Gers

机构 * DATEXIS, Berliner Hochschule für Technik (BHT), Germany(DATEXIS,柏林技术学院(BHT)) KI-Werkstatt, University of Applied Sciences Berlin, Merantix Momentum, Germany(KI工作室,柏林应用技术大学,Merantix Momentum) Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术与经济高等学院(HTW))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出IMPRINT框架,通过神经坍缩现象和代理聚合改进迁移学习,实现4%的性能提升。

Journal ref Transactions on Machine Learning Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01274 2026-03-03 cs.LG cs.AI 62%

GlassMol: Interpretable Molecular Property Prediction with Concept Bottleneck Models

GlassMol:通过概念瓶颈模型实现可解释的分子属性预测

Oscar Rivera, Ziqing Wang, Matthieu Dagommer, Abhishek Pandey, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01844 2026-03-03 cs.CV cs.AI 62%

CloDS: Visual-Only Unsupervised Cloth Dynamics Learning in Unknown Conditions

CloDS: 未知条件下的视觉-only 无监督布料动力学学习

Yuliang Zhan, Jian Li, Wenbing Huang, Wenbing Huang, Yang Liu, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 CloDS通过无监督学习从多视角视觉数据中学习布料动力学,解决未知条件下的动态模拟问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06203 2026-03-03 cs.LG cs.AI 62%

Reference Grounded Skill Discovery

基于参考的技能发现

Seungeun Rho, Aaron Trinh, Danfei Xu, Sehoon Ha

机构 * School of Interactive Computing(交互计算学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 RGSD通过语义有意义的潜在空间实现技能发现,有效模仿和发现多样行为,在运动任务中优于模仿学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏