Can NeRFs See without Cameras?
NeRF能否在没有摄像头的情况下看到?
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出通过重新设计NeRF来利用多路径信号推断环境,应用于从稀疏Wi-Fi测量中推断室内平面图。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
NeRF能否在没有摄像头的情况下看到?
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出通过重新设计NeRF来利用多路径信号推断环境,应用于从稀疏Wi-Fi测量中推断室内平面图。
VideoVeritas:通过感知预设强化学习实现AI生成视频检测
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。
Comments Project: https://github.com/EricTan7/VideoVeritas
Kissan-Dost:通过对话物联网弥合小农户精准农业的最后一公里
机构 * Lahore University of Management Sciences (LUMS), Pakistan(拉合尔管理科学大学(LUMS),巴基斯坦)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 Kissan-Dost通过对话物联网系统,利用传感器数据和多语言翻译,为小农户提供精准农业的实时指导和高效决策支持。
支持智能体的前瞻性分析以应对AI系统性风险:智能体用于广度,专家用于判断
机构 * GESIS - Leibniz Institute for the Social Sciences(GESIS-莱布尼茨社会科学研究所) ; ETH Zurich(苏黎世联邦理工学院) ; Nokia Bell Labs(诺基亚贝尔实验室) ; University of Cambridge(剑桥大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种结合智能体和专家的前瞻性分析方法,用于评估AI系统的长期系统性风险,通过模拟智能体和专家讨论,扩大风险覆盖范围并提供上下文基础。
Comments 48 pages, 15 figures
粗到细的 grounded memory 用于 LLM agent 计划
机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出 Coarse-to-Fine Grounded Memory,通过 LLM 实现粗到细的记忆 grounding,以提升代理在复杂规划任务中的灵活性和适应性。
Comments Accepted to EMNLP 2025 Main Conference;27 pages,15 figures
对类无关计数的综述:从基于参考到开放世界文本引导方法的进展
机构 * CNR-ISTI ; Istanbul Technical University(伊斯坦布尔技术大学) ; Division of Engineering, NYU Abu Dhabi(NYU阿布扎比分校工程系)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 本文综述了类无关计数方法,提出三种范式并评估了30种架构,探讨了其性能、挑战及未来方向。
Comments Preprint version of an article accepted ad Elsevier's CVIU
D-ORCA:面向鲁棒音频视觉描述的对话中心优化
机构 * Tsinghua University(清华大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。
特征学习与遗忘的二元性:基于随机梯度下降的神经网络快慢分析
机构 * The University of Tokyo(东京大学) ; RIKEN Center for Advanced Intelligence Project(RIKEN先进人工智能项目中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 本文研究了神经网络中特征学习与遗忘的二元性,通过快慢动态分析揭示特征遗忘的机制与条件,提出特征遗忘由数据主非线性项强度和第二层权重初始尺度决定。
Comments 40 pages
RAPTOR-AI用于灾难OODA循环:基于经验驱动的多模态RAG框架
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI总结 RAPTOR-AI通过分层多模态RAG框架,结合经验驱动的代理控制和LoRA适应,提升灾害响应中的检索精度、情境基础性和任务分解准确性。
Comments 8 pages, 3 figures, 2 tables
赋能受影响个体塑造AI公平性评估:过程、标准与工具
机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院) ; FUJITSU LIMITED(Fujitsu 有限公司) ; Graduate School of Arts and Sciences, The University of Tokyo(东京大学艺术与科学研究生院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文通过定性研究探讨了如何让受影响个体参与AI公平性评估,揭示了个体如何通过模型特征生成公平性标准,并提出了支持包容性AI公平性评估的设计建议。
DA-RAG:动态属性社区搜索用于检索增强生成
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 DA-RAG通过动态属性社区搜索提升检索增强生成的效果,有效处理动态复杂查询,减少计算与经济成本。
EvoCorps:一种用于去极化的进化多智能体框架
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 EvoCorps通过进化多智能体框架主动应对在线讨论中的极化问题,提升讨论质量并实现闭环干预。
多量子比特和许多体系统的复杂性
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出了一种基于熵的复杂性度量,用于识别多量子比特和许多体系统中的非平凡量子相变和临界行为。
Comments 13 pages, 9 figures
Journal ref Phys. Rev. A 113, 022606, 2026
跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测
机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) ; Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) ; Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) ; Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)
专题命中 视觉定位与Grounding :multimodal large language model(abstract)
AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。
Comments 18 pages, 7 figures, 6 tables
DeepPrep: 一种基于大语言模型的自主数据准备代理系统
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。
代理EDA的黎明:自主数字芯片设计的综述
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。
ShoppingComp: LLMs 是否真的准备好为您的购物车服务?
机构 * ByteDance(字节跳动)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。
基于多模态大语言模型的高效表格检索与理解
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; AWS(亚马逊网络服务)
专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG
AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。
Comments Published at EACL 2026 Findings
从死像素到可编辑幻灯片:通过视觉-语言区域理解将信息图转换为原生Google幻灯片
机构 * Trilogy AI Center of Excellence(Trilogy AI卓越中心)
专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 通过视觉-语言区域理解,将信息图转换为可编辑的Google幻灯片,实现元素恢复和布局保真度的高精度转换。
Comments Accepted for publication in the Companion Proceedings of the ACM Web Conference 2026 (WWW Companion '26), April 13-17, 2026, Dubai, United Arab Emirates
从障碍到礼仪:基于VLM引导路径选择的机器人社交导航
机构 * School of Computing(计算机学院) ; Smart Systems Institute(智能系统研究所)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 本文提出了一种结合几何规划与上下文社交推理的机器人社交导航框架,通过VLM模型优化路径选择,以减少对人类活动的干扰并遵守社会规范。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L)
GUI知识基准:揭示VLMs在GUI任务中的知识差距
机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室) ; Beijing University of Posts(北京邮电大学) ; Tsinghua University, Beijing, China(清华大学) ; Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
AI总结 GUI知识基准揭示VLMs在GUI任务中的知识差距,通过提炼三个维度的GUI知识,评估现有模型的不足并指导更高效的任务完成。
OpenPhone: 移动代理基础模型
机构 * The University of Hong Kong(香港大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 OpenPhone通过设备-云协作提升移动GUI代理性能,结合设备端高效模型与云端强大能力,实现成本降低与性能提升的平衡。
UniPlan: 为移动操作统一PDDL形式的视觉-语言任务规划
专题命中 GUI与屏幕智能体 :VLM(abstract)
AI总结 UniPlan通过统一PDDL形式实现视觉-语言任务规划,提升大规模室内移动操作的规划效率和效果。
视觉语言模型对分裂图像有害输入攻击的鲁棒性
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出分裂图像视觉陷阱攻击(SIVA),揭示视觉语言模型在面对分裂图像攻击时的安全漏洞,并通过对抗性知识蒸馏算法提升跨模型攻击效果。
Comments 22 Pages, long conference paper
TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉
机构 * Drexel University(德雷塞尔大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; LLNL(劳伦斯利弗莫尔国家实验室) ; Lehigh University(莱斯大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。
Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025
公平上下文学习用于证据平衡的测试时间适应在视觉-语言模型中
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文提出公平上下文学习方法,通过解决共享证据偏差来提升视觉-语言模型在测试时间适应中的鲁棒性,有效校准文本嵌入并提高适应性能。
视觉语言模型中的道德趋炎奉承
机构 * University of Dhaka(达卡大学) ; Daffodil International University(达福迪国际大学) ; Islamic University of Technology(伊斯兰技术大学) ; University of Central Florida(佛罗里达中央大学) ; King Fahad University of Petroleum and Minerals(国王法赫德石油与矿物大学) ; SDAIA - KFUPM Joint research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)
专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.AI
AI总结 本文研究了视觉语言模型在道德决策中的趋炎奉承现象,发现模型在用户偏见下易产生道德错误回应,揭示了模型在伦理一致性与稳健性上的权衡问题。
Comments 13 pages, 6 figures, 8 tables, Submitted for review in ACL
重新思考视觉-语言模型的实用且高效的量化校准
机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) ; Nanjing University of Science and Technology, Nanjing, China(南京理工大学,南京,中国)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 TLQ通过标记级重要性整合和多GPU层级校准,提升视觉-语言模型的量化稳定性与效率。
可靠且负责任的基础模型:全面综述
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。
Comments TMLR camera-ready version
朝向对抗视觉感知攻击的固有鲁棒性VLMs
机构 * Clemson University(克莱姆森大学) ; Technical Universität München(慕尼黑技术大学) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出V2LMs,通过固有鲁棒性提升自动驾驶车辆感知对视觉攻击的抗性,实验显示其在对抗攻击下表现优于传统DNNs。
Comments Accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV 2026)