Lifted Relational Probabilistic Inference via Implicit Learning
通过隐式学习实现提升的关系概率推断
机构 * Washington University in St. Louis(华盛顿大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种基于隐式学习的方法,实现第一-order概率逻辑的隐式学习和提升推断,解决了传统方法在模型构建上的局限性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
通过隐式学习实现提升的关系概率推断
机构 * Washington University in St. Louis(华盛顿大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种基于隐式学习的方法,实现第一-order概率逻辑的隐式学习和提升推断,解决了传统方法在模型构建上的局限性。
RF-GPT:教AI看见无线世界
机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) ; College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) ; Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。
Dataforge:自主数据工程的代理平台
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 Dataforge是一个基于大语言模型的自动数据工程平台,通过自动数据清理和迭代优化特征操作,提升表格数据的AI准备质量。
两次测量,一次切割:一种面向语义的视频时间定位方法与视频LLMs
机构 * The University of Osaka(大阪大学) ; CyberAgent, Inc.(CyberAgent公司)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 MeCo提出一种面向语义的视频时间定位方法,通过生成和判别学习任务提升视频LLMs对事件结构的识别能力,实现更精确的时间分割。
Comments ICLR2026
工具使用LLM代理中的信息保真度:模型上下文协议的鞅分析
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种分析模型上下文协议中误差累积的理论框架,通过鞅分析证明误差呈现线性增长并受$O(\sqrt{T})$约束,实验验证了语义加权和周期性再定位对误差控制的有效性。
Comments Full working version of an extended abstract accepted at the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
通过动作效果建模实现过程性错误检测
机构 * Michigan State University(密歇根州立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 本文提出通过动作效果建模实现过程性错误检测,结合语义和视觉信息,在单类分类任务中取得最佳性能。
Comments Accepted by ICLR 2026
当话语基于感知和话语进行 grounding 时,信息密度是否均匀?
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本研究首次探讨了基于感知和话语的视觉环境对信息密度均匀性的影响,发现 grounding 能提高信息分布的均匀性,并在话语单元开始处产生最大的惊奇度降低。
Comments Accepted as main paper at EACL 2026
冰架下方的地下水动态
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 研究通过建立数学模型,揭示了冰架下方沉积盆地中地下水动态受海水入侵和盆地几何形状的影响,发现海水可能被困于盆地中,并影响冰流流动。
Comments 33 pages, 11 figures
Journal ref The Cryosphere, 19, 3725-3747, 2025
语义接触场用于类别级可泛化的触觉工具操作
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 SCFields通过融合视觉语义与密集接触估计,实现类别级可泛化的触觉工具操作,显著优于视觉和原始触觉基线。
历史OCR中的错误模式:TrOCR与视觉语言模型的比较分析
机构 * University of Helsinki, Department of Computer Science, Finland(赫尔辛基大学计算机科学系) ; University of Helsinki, Department of Digital Humanities, Finland(赫尔辛基大学数字人文系)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文比较了TrOCR与视觉语言模型在历史文本OCR中的表现,发现两者在错误模式和学术可靠性上存在显著差异。
BLUEPRINT 重筑遗产:面向复杂工程图纸和文档的多模态检索
机构 * Oak Ridge National Laboratory(橡树岭国家实验室) ; Colorado State University(科罗拉多州立大学)
专题命中 文档图表理解 :VLM(abstract);分类 cs.LG
AI总结 Blueprint通过布局感知的多模态检索系统,提升对复杂工程图纸和文档的自动化检索能力,实现结构化元数据生成与跨设施搜索效率提升。
Comments 20 pages 8 main + 12 appendix + references
HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 文档图表理解 :MLLM(abstract)
AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。
通过代理-Q估计和分步策略优化构建自主GUI导航
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。
DM0:一种面向物理AI的具身原生视觉-语言-动作模型
机构 * DM0 Team(DM0团队) ; Dexmal ; StepFun
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。
Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic
自动驾驶中的基础模型:场景生成与场景分析的综述
专题命中 GUI与屏幕智能体 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。
Comments IEEE Open Journal of Intelligent Transportation Systems
Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026
务实型机器人:通过体验现实世界学习任务规划
机构 * Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室) ; ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心) ; Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国) ; UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 PragmaBot 通过现实世界经验学习任务规划,利用 STM 自我反思和 RAG 提高任务成功率
Comments Accepted to RA-L
视觉-语言远阻抗接口:通过眼动追踪和语音实现物理交互的半自主控制
机构 * Department of Cognitive Robotics, Delft University of Technology(认知机器人系,代尔夫特理工大学) ; European Organization for Nuclear Research (CERN)(欧洲核子研究中心)
专题命中 GUI与屏幕智能体 :VLM(abstract);visual language model(abstract)
AI总结 本文提出一种结合眼动追踪和语音交互的视觉-语言远阻抗接口,用于通过生成刚度矩阵实现远程机械臂的半自主物理交互控制。
Journal ref Frontiers in Robotics and AI, Volume 13, 1749105, February 2026
InternVLA-A1:统一理解、生成和行动以实现机器人操作
机构 * InternVLA-A1 Team(InternVLA-A1团队)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract)
AI总结 InternVLA-A1通过统一的Transformer架构,结合语义理解和动态预测能力,提升了机器人操作任务的性能。
Comments Homepage: https://internrobotics.github.io/internvla-a1.github.io/
HiST-VLA:一种用于端到端自动驾驶的分层时空视觉-语言-动作模型
机构 * Bosch Corporate Research(博世企业研究) ; School of Communication and Information Engineering(信息工程学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 HiST-VLA通过分层时空视觉-语言-动作模型提升自动驾驶轨迹生成的精度与效率,实现端到端的自动驾驶系统。
Plan-MCTS:网页导航中的计划探索用于动作利用
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO Research Institute(OPPO研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 Plan-MCTS通过将网页导航探索转移到语义计划空间,提升动作利用效率,实现更高效的导航任务执行。
LAP:语言-动作预训练实现零样本跨躯体迁移
机构 * Princeton University(普林斯顿大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。
Comments Project website: https://lap-vla.github.io
基于扩散的动态合同用于移动元宇宙中联邦AI代理的构建
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
AI总结 本文提出基于扩散模型的EDMSAC算法,通过动态合同机制优化边缘-云协作下的AI代理构建,提升移动元宇宙中服务的低延迟与安全性。
计算机视觉基础模型是否是良好的符合预测器?
机构 * MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央理工巴黎高等学院、巴黎-萨克雷大学) ; LIVIA, ILLS, ETS Montréal(LIVIA、ILLs、蒙特利尔工程师学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
AI总结 本文研究了计算机视觉基础模型在符合预测中的表现,发现其适合符合化过程,但校准置信度预测会降低效率,且视觉-语言模型在少样本适应中表现更优。
评估机器学习可解释性在勘探风险中的鲁棒性统一框架
机构 * Center for Energy and Geo Processing (CeGP)(能源与地球处理中心) ; Omni Lab for Intelligent Visual Engineering and Science (OLIVES)(智能视觉工程与科学实验室) ; School of Electrical and Computer Engineering(电气与计算机工程学院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG
AI总结 本文提出统一框架,通过量化必要性和充分性来评估LIME和SHAP在高维结构化勘探风险数据中的鲁棒性。
Journal ref Geophysics 90, no. 3 (2025): IM103-IM118
ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索
机构 * Department of Computer Science(计算机科学系) ; Princeton University(普林斯顿大学) ; Center for Information Technology Policy(信息政策中心) ; Department of Electrical and Computer Engineering(电气与计算机工程系) ; NVIDIA(英伟达)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。
Comments Accepted to NeurIPS 2025
双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解
机构 * International Institute of Information Technology(国际信息研究所)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。
对大型视觉-语言模型进行微调以用于艺术品的评分与批评
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出通过微调Qwen2-VL-7B模型,结合多任务学习实现对人类绘画的自动化创造力评估,通过生成与评分标准一致的反馈,提高评分准确性和反馈质量。
小视觉语言模型的高效测试时缩放
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出两种高效测试时缩放策略,通过模型内部特征提升小视觉语言模型的性能,同时保持计算效率。
Comments Accepted at ICLR 2026. Project Page: https://monurcan.github.io/efficient_test_time_scaling
通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪
机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室) ; College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 通过区域、令牌和指令引导的重要性进行高分辨率大视觉-语言模型的金字塔令牌修剪,有效降低计算和内存开销,同时保持性能
自上而下语义细化用于图像描述生成
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 自上而下语义细化通过高效MCTS算法提升图像描述生成的性能与质量