arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7409 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7409 篇

2605.11910 2026-05-13 cs.AI 57%

Rethinking Positional Encoding for Neural Vehicle Routing

重新思考神经车辆路径问题中的位置编码

Chuanbo Hua, Federico Berto, Andre Hottung, Nayeli Gast Zepeda, Yining Ma, Zihan Ma, Paula Wong-Chung, Changhyun Kwon, Cathy Wu, Kevin Tierney, Jinkyoo Park

机构 * KAIST(韩国科学技术院) Radical Numerics Bielefeld University(比勒菲尔德大学) University of Vienna(维也纳大学) MIT(麻省理工学院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文针对车辆路径问题中位置编码的不足,提出一种层次化各向异性位置编码,结合几何基础原理,通过分析多种PE方法,证明几何引导的PE在不同问题变体和模型架构中均表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06719 2026-05-13 cs.CR cs.CL cs.LG 57%

Differentially Private Synthetic Text Generation for Retrieval-Augmented Generation (RAG)

差分隐私合成文本生成用于检索增强生成(RAG)

Junki Mori, Kazuya Kakizaki, Taiki Miyagawa, Jun Sakuma

机构 * NEC Corporation(日本电报电话公司) Institute of Science Tokyo(东京科学研究院) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出DP-SynRAG框架,通过生成差分隐私合成RAG数据库提升隐私保护下的RAG性能,避免重复噪声注入并保持固定隐私预算。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11807 2026-05-13 cs.AI 57%

Why Users Go There: World Knowledge-Augmented Generative Next POI Recommendation

为何用户前往那里:世界知识增强的生成性下一个兴趣点推荐

Qiuyu Ding, Heng-Da Xu, Wei Zhang, Dongyi Lv, Changda Xia, Feng Xiong, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AWARE模型,通过LLM代理生成时空感知的上下文叙述,结合用户行为增强世界知识,提升POI推荐效果,实验证明其优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 57%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12923 2026-05-13 cs.CV 57%

Pi-HOC: Pairwise 3D Human-Object Contact Estimation

Pi-HOC:成对3D人体-物体接触估计

Sravan Chittupalli, Ayush Jain, Dong Huang

机构 * Carnegie Mellon University, Robotics Institute(卡内基梅隆大学机器人研究所) National Robotics Engineering Center(国家机器人工程中心)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出Pi-HOC,一种单次传递的实例感知框架,用于密集预测所有人体-物体对的3D语义接触。该方法通过实例检测、创建专用的人-物体令牌并利用交互形式进行细化,结合基于SAM的解码器预测接触,提升了准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11810 2026-05-13 cs.DL cs.AI 57%

Evolving Roles of LLMs in Scientific Innovation: Assistant, Collaborator, Scientist, and Evaluator

大语言模型在科学创新中的演变角色:助手、合作者、科学家和评估者

Haoxuan Zhang, Ruochi Li, Yang Zhang, Ting Xiao, Jiangping Chen, Junhua Ding, Haihua Chen

机构 * Department of Information Science, University of North Texas(北卡罗来纳州立大学信息科学系) Department of Computer Science, North Carolina State University(北卡罗来纳州立大学计算机科学系) Department of Data Science, University of North Texas(得克萨斯大学数据科学系) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出四角色框架,区分研究支持与前沿发现,分析各角色方法、基准和评估实践,强调AI科学进步需兼顾模型能力与评估、监督、责任及机构整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10808 2026-05-12 cs.CR cs.AI 57%

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

基于领域适应语言模型的威胁建模:实证评估与洞察

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy

机构 * Department of Systems(系统部) School of Information Technology(信息技术学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10756 2026-05-12 cs.CV 57%

TINS: Test-time ID-prototype-separated Negative Semantics Learning for OOD Detection

TINS: 测试时ID-原型分离的负语义学习用于OD检测

Yifeng Yang, Jubo Feng, Jing Xu, Xinbing Wang, Qinying Gu, Nanyang Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 TINS通过测试时ID-原型分离负语义学习方法,提升OOD检测性能,实验显示在Four-OOD基准上FPR95显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 57%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10186 2026-05-12 cs.CL cs.AI 57%

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

LegalCiteBench: 评估法律语言模型中的引文可靠性

Sijia Chen, Hang Yin, Shunfan Zhou

机构 * Northeastern University(东北大学) Phala

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。

Comments Preprint. 23 pages including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV 57%

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04093 2026-05-12 cs.LG 57%

Federated Concept-Based Models: Interpretable models with distributed supervision

联邦概念模型:具有分布式监督的可解释模型

Dario Fenoglio, Arianna Casanova, Francesco De Santis, Gabriele Dominici, Johannes Schneider, Pietro Barbiero, Giovanni De Felice, Marc Langheinrich, Martin Gjoreski

机构 * Università della Svizzera italiana(瑞士联邦理工学院) University of Liechtenstein(利亨斯坦大学) Politecnico di Torino(都灵理工大学) IBM Research Zurich(IBM 苏黎世研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出联邦概念模型(F-CMs),在动态联邦学习环境中实现概念可解释性,通过聚合跨机构的概念信息并适应概念监督变化,提升模型准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09976 2026-05-12 cs.CV 57%

OZ-TAL: Online Zero-Shot Temporal Action Localization

OZ-TAL:在线零样本时间动作定位

Chaolei Han, Hongsong Wang, Xin Gong, Jie Gui

机构 * School of Cyber Science and Engineering, Southeast University(东南大学信息科学与工程学院) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(教育部区块链应用、监督与管理工程研究中心(东南大学)) Purple Mountain Laboratories, Nanjing(紫金山实验室(南京)) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OZ-TAL任务,旨在在线检测未见过的动作,提出无需训练的框架利用VLMs并增强视觉表示,实验表明方法在离线和在线零样本设置中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09591 2026-05-12 cs.CV 57%

From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

从像素到概念:分割模型是否理解它们所分割的内容?

Shuang Liang, Zeqing Wang, Yuxian Li, Xihui Liu, Han Wang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) CASIC, The University of Hong Kong(香港大学中国科学院自动化所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出CAFE基准,评估可提示分割模型对概念的忠实性。通过属性层面的反事实操纵,测试模型在误导性提示下的表现,揭示分割模型可能依赖视觉显著但语义误导的线索。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09513 2026-05-12 cs.CV cs.RO 57%

QueST: Persistent Queries as Semantic Monitors for Drift Suppression in Long-Horizon Tracking

QueST:持久查询作为语义监控用于长周期跟踪中的漂移抑制

Mayank Anand, Mohammad Saqlain, Kyan Mahajan, Priya Shukla, Gora Chand Nandi, Andrew Melnik

机构 * Center for Intelligent Robotics(智能机器人中心) Indian Institute of Information Technology Allahabad(阿拔斯理工大学) University of Bremen(不莱梅大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 QueST通过将相关实体视为持久语义查询,而非短暂点跟踪,利用时空视频特征全局注意力,减少漂移并提升长周期跟踪的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09012 2026-05-12 cs.AI 57%

Re$^2$Math: Benchmarking Theorem Retrieval in Research-Level Mathematics

Re²Math:研究级数学中的定理检索基准测试

Zicheng Lyu, Wenjie Yang, Shengzhong Zhang, Zengfeng Huang

机构 * Fudan University(复旦大学) Fudan University Shanghai Innovation Institute(复旦大学上海创新研究院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 Re²Math基准测试旨在评估从部分数学证明中检索工具的能力,通过构建包含层级上下文和可选泄漏控制锚点提示的实例,评估系统在检索文献支持的数学工具时的准确性与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08874 2026-05-12 cs.CV 57%

Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation

超几何空间中的语义对齐用于开放词汇语义分割

Hoang M. Truong, Hai Nguyen-Truong, Dang Huynh

机构 * Fulbright University Vietnam(富布赖特大学越南分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HyRo框架,通过解耦超几何空间中的层次和语义对齐,提升开放词汇语义分割性能。

Comments Accepted to the PVUW Workshop at CVPR 2026. Project page: https://tmhoanggg.github.io/HyRo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08805 2026-05-12 cs.CV 57%

LightAVSeg: Lightweight Audio-Visual Segmentation

LightAVSeg: 轻量级音频视觉分割

Qing Zhong, Guodong Ding, Lingqiao Liu, Zaiwen Feng, Lin Yuanbo Wu, Angela Yao

机构 * College of Informatics, Huazhong Agricultural University, Wuhan, China(华中农业大学信息学院) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) School of Computer Science, Adelaide University, Australia(阿德莱德大学计算机科学学院) School of Engineering, University of Warwick, Coventry, UK(沃里克大学工程学院) Zhejiang Yuexiu University, Shaoxing, China(浙江越秀大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出LightAVSeg,通过解耦设计替代重注意力机制,实现线性交互成本,提升效率,实验显示其在MS3基准上达到50.4 mIoU,参数量仅为AVSegFormer的1/7。

Comments 15 pages, 8 figures, 6 tables, Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08761 2026-05-12 cs.MA cs.LG 57%

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

超越全能代理:企业工作流中角色专业化多代理协作的基准测试

Tao Yu, Hao Wang, Changyu Li, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Yuxuan Zhou, Haopeng Jin, Zhaolu Kang, Jiabing Yang, YiFan Zhang, Xinming Wang, Hongzhu Yi, Zheqi He, Jing-Shu Zheng, Xi Yang, Yan Huang, Liang Wang

机构 * BAAI(北京人工智能研究院) CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出EntCollabBench,用于评估企业多代理协作,模拟权限隔离组织,包含工作流和审批两个子集,通过执行轨迹、数据库验证和确定性政策裁决评估代理系统,实验表明当前模型在企业协作中仍存在缺陷。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08590 2026-05-12 cs.HC cs.AI cs.CL cs.CY 57%

Causal Stories from Sensor Traces: Auditing Epistemic Overreach in LLM-Generated Personal Sensing Explanations

从传感器轨迹中生成因果故事:审计LLM生成的个人传感解释中的知识过度延伸

Shanshan Zhu, Han Zhang, J. Doris Chi, Subigya Nepal, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Yale University(耶鲁大学) University of Virginia(弗吉尼亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究了LLM生成个人传感解释时的知识过度延伸问题,通过分析不同数据集中的异常日场景,发现LLM在缺乏足够证据时仍会做出因果归因,且丰富的上下文无法有效减少这种过度延伸。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07522 2026-05-12 cs.CV 57%

Training-free Spatially Grounded Geometric Shape Encoding (Technical Report)

无需训练的空间几何形状编码(技术报告)

Yuhang He

机构 * Microsoft Research(微软研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出XShapeEnc,一种无需训练的通用空间几何形状编码策略,通过分解几何形状和姿态,利用正交Zernike基和频率传播操作,实现高效、可逆且频率丰富的紧凑表示,适用于多种二维空间任务。

Comments Training-Free 2D Geometric Shape Encoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15075 2026-05-12 cs.LG 57%

Quantize What Counts: More for Keys, Less for Values

量化关键:更多关键,更少值

Mohsen Hariri, Alan Luo, Weicong Chen, Shaochen Zhong, Tianyi Zhang, Qifan Wang, Xia Hu, Xiaotian Han, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) Rice University(Rice大学) Meta

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出两项定理,基于Transformer模型的内在几何特性,指导混合精度KV量化。关键投影具有更大的谱范数和Frobenius范数,优先分配精度给关键能减少量化误差并保留准确性。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 57%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07986 2026-05-11 cs.HC cs.AI cs.CY 57%

Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios

迈向公平的AI评估:从现实使用案例到评估场景

Yee-Yin Choong, Kristen Greene, Alice Qian, Meryem Marasli, Ziqi Yang, Sophia Chen, Laura Dabbish, Anand Rao, Hong Shen

机构 * National Institute of Standards and Technollogy(国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种可重复的流程,通过结构化AI使用案例工作表将高层使用案例转化为详细场景,结合LLM提示和人工审查,生成107个场景,确保评估场景的现实性和人类需求。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 57%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07584 2026-05-11 cs.AI 57%

Parallel Lifted Planning via Semi-Naive Datalog Evaluation

通过半 naive Datalog 评估实现并行提升规划

Dominik Drexler, Oliver Joergensen, Jendrik Seipp

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于半 naive Datalog 评估的并行提升规划方法,通过两级并行性提升规划效率,在多核环境下实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07561 2026-05-11 cs.CV 57%

Multimodal Stepwise Clinically-Guided Attention Learning for Pathological Complete Response Prediction in Breast Cancer

多模态逐步临床引导注意力学习用于乳腺癌病理完全响应预测

Alice Natalina Caragliano, Valerio Guarrasi, Michela Gravina, Carlo Sansone, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Electrical Engineering and Information Technology, University of Naples Federico II(电气工程与信息科技系,那不勒斯费德里科二世大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多模态逐步临床引导注意力学习框架,通过医学引导的空间指导和多模态整合,提升乳腺MRI中病理完全响应预测的敏感性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03479 2026-05-11 cs.CV 57%

ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos

ProcObject-10K:面向教学视频中以对象为中心的程序理解的基准测试

Wenliang Guo, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ProcObject-10K,首个评估教学视频中以对象为中心推理和时间证据定位的基准,涵盖137个任务和五种推理类型,揭示模型在对象动态理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 57%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06963 2026-05-11 cs.HC cs.AI cs.CL cs.IR 57%

From Surface Learning to Deep Understanding: A Grounded AI Tutoring System for Moodle

从表层学习到深度理解:面向Moodle的 grounded AI 教学系统

Anna Ostrowska, Michał Kukla, Gabriela Majstrak, Jan Opala, Sebastian Pergała, Jan Skwarek, Anna Wróblewska

机构 * Faculty of Mathematics and Information Sciences, Warsaw University of Technology(数学与信息科学学院,华沙技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于Moodle的AI教学助手,利用检索增强生成技术提供高质量教育,通过双核心设计实现学生互动式辅导和教师监督内容生成,有效减少信息误导并促进深度理解。

Comments 5 pages, accepted as demo paper at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏