arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-09-01 至 2026-09-01 共收录 238 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 64 篇

2608.30653 2026-09-01 cs.CV cs.AI cs.LG 新提交 62%

Fine-Grained Multi Image Object Hallucination Benchmark

细粒度多图像物体幻觉基准测试

Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee

机构 * Seoul National University(首尔大学) AIM Intelligence(AIM智能公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态大语言模型的物体幻觉问题,推出细粒度多图像物体幻觉基准测试MIOH,评估29个模型后发现顶尖模型仍存在明显失败模式,为开发可靠多模态AI提供关键评估工具。

Comments Accepted at CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 18295-18305

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29880 2026-09-01 cs.AI cs.MM 新提交 62%

Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization

感知以假设,验证以落地:面向开放世界地理定位的智能体推理框架

Yutian Jiang, Ruijie Li, Sisuo Lyu, Xixuan Hao, Qingxiang Liu, Yongzi Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本研究针对开放世界地理定位的感知幻觉与上下文漂移问题,提出双层智能体框架GeoPAVE,并引入含完整推理轨迹的新型数据集PAVED,以提升地理定位的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28958 2026-09-01 cs.CL cs.CV 新提交 62%

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

CoVA-SFT:用于视觉抽象链的大规模数据集

Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 CoVA-SFT是用于视觉抽象链的大规模数据集,含5.19万样本等,经其微调的模型在CoVA-Bench上性能优于交错式CoT基线2倍以上,凸显相关研究的开放挑战。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28635 2026-09-01 cs.CL cs.AI 新提交 62%

Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA

多模态大语言模型(MLLMs)真的理解低资源高棉语文档吗?一项关于高棉语文档视觉问答(VQA)的试点研究

Nimol Thuon, Panhapin Theang

机构 * University of Science and Technology of China(中国科学技术大学) Université Paris Cité(巴黎城市大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对高棉语文档VQA,评估开源MLLMs的性能,发现直接使用Qwen3-VL-8B准确率51.9%,外部OCR辅助的Tesseract、PaddleOCR分别达61.9%、61.6%,但高棉语文档理解仍存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06443 2026-09-01 cs.CL cs.MM cs.SI 版本更新 62%

Revising Context, Shifting Simulated Stance: Auditing LLM-Based Stance Simulation in Online Discussions

修正语境,转变模拟立场:审计基于LLM的在线讨论立场模拟

Xinnong Zhang, Wanting Shan, Hanjia Lyu, Zhongyu Wei, Jiebo Luo

机构 * Fudan University(复旦大学) University of Rochester(罗切斯特大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本研究通过反事实语境修正框架审计LLM立场模拟,对比纯文本与多模态策略,评估平均方向性立场转变和立场转换率,揭示语境敏感性的有效性与鲁棒性。

Comments Accepted for publication in the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-09-01 cs.CV cs.CL 版本更新 62%

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31002 2026-09-01 cs.RO cs.CV 新提交 57%

DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception

DARP:用于多视角机器人感知的校准双臂RGB-D-IR数据集

Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * The University of Alabama(阿拉巴马大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DARP双臂机器人感知数据集,含10种桌面物体,经评估几何一致性良好,可用于多视角重建等多类机器人感知相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30896 2026-09-01 cs.CV 新提交 57%

Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis

Rad-R:用于硬件故障诊断的原始ADC雷达数据集与捕获不变SSM

Mainak Mallick, Junghwan Yim, Seung-Kyum Choi

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对汽车毫米波雷达硬件故障数据稀缺问题,提出Rad-R原始ADC雷达数据集与捕获不变RadrNet模型,经基准评估,该模型在受控跨严重程度故障诊断任务中性能优于对比模型,且在其他任务中也表现领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30895 2026-09-01 cs.CV 新提交 57%

A Controlled Evaluation of Model Rankings and Input Reliance in Surface Water Segmentation

地表水分割中模型排名与输入依赖的受控评估

Kittipat Phunjanna, Kristóf Karacs, Chayut Ngamkhanong

机构 * Pázmány Péter Catholic University(帕兹马尼·彼得天主教大学) Chulalongkorn University(朱拉隆功大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本研究针对Sen1Floods11和GEOID-Flood数据集,通过多种受控实验评估地表水分割模型的排名稳定性、输入依赖等,发现聚合指标排名存在局限,需多维度证据支撑评估结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30678 2026-09-01 cs.CL 新提交 57%

OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

OCR元推理基准:评估多模态大语言模型在富文本图像理解中的元推理能力

Gengxu Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出OCR-MetaReasoning基准,将演绎、归纳、溯因作为不同推理方向,分离答案正确性与推理合规性,实验发现现有MLLMs的OCR元推理能力远未饱和。

Comments EMNLP 2026 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30657 2026-09-01 cs.CV 新提交 57%

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29739 2026-09-01 cs.CV 新提交 57%

Drift Calibration in Geometric Eye Tracking Systems

几何眼动追踪系统中的漂移校准

Jiaqi Liu, Zixuan Wang, Yuhong Zhang, Dingkang Liang, Jane Hanqi Li, Tzyy-Ping Jung, Gert Cauwenberghs

机构 * Institute for Neural Computation, University of California San Diego(加州大学圣地亚哥分校神经计算研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文针对几何眼动追踪系统的残留校准误差,构建专用数据集评估校正函数,提出轻量级神经细化器,实验显示其可降低平均角度误差,为注视交互建模提供可复现基准。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29601 2026-09-01 cs.RO cs.CV cs.LG 新提交 57%

$\mathcal{N}_0$-Foundation: Towards the Age of Tactile Intelligence

$\boldsymbol{\tau}_0$-基础模型:迈向触觉智能时代

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI(尼奥特人工智能)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出$\boldsymbol{\tau}_0$-基础模型,构建大规模视触觉数据集及视触觉表征模型,结合真实与模拟套件形成评估基准,助力触觉具身操控研究。

Comments 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29374 2026-09-01 cs.CV 新提交 57%

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

思考、观察与修正:多模态大语言模型中基于不一致感知的视觉自我修正

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA Research(英伟达研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本研究针对工具增强型多模态推理中工具输出缺乏验证的问题,提出ReVISE框架,通过带监督反思的训练数据集与强化学习目标奖励,实现错误检测与修正,在多个基准上取得性能提升。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29210 2026-09-01 cs.AI 新提交 57%

Imag-Eval: a language-grounded framework for interpretable Text-to-Image instruction following evaluation

Imag-Eval:一种基于语言的可解释文本到图像指令遵循评估框架

Ibrahim Mohamed Serouis, David Jaramillo Duque

机构 * Talan Research and Innovation Center(塔兰研究与创新中心)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 针对现有T2I模型评估的局限,提出Imag-Eval基准,通过独立调整实例数与规则组合区分语言复杂性与组合难度,经实验表明结构化技能的组合难度由规则数及绑定方式决定。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28874 2026-09-01 cs.CV cs.LG 新提交 57%

MWIR-4-Plastic: The Identification of Complex End-of-Life Industrial Plastic using Mid-wave Infrared Hyperspectral Imaging and Machine Learning

MWIR-4-Plastic:用中波红外高光谱成像与机器学习识别复杂的报废工业塑料

Elias Arbash, Andréa de Lima Ribeiro, Filipa Simões, Ahmed Jamal Afifi, Aldino Rizaldy, Yuleika Madriz, Samuel Thiele, Sandra Lorenz, Margret Fuchs, Pedram Ghamisi, Paul Scheunders, Richard Gloaguen

机构 * Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) Helmholtz Institute Freiberg for Resource Technology (HIF)(弗莱贝格亥姆霍兹资源技术研究所) University of Antwerp(安特卫普大学) Freie Universität Berlin(柏林自由大学) University of Iceland(冰岛大学) TU Bergakademie Freiberg(弗莱贝格工业大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本研究针对报废工业黑色塑料分拣难题,构建首个公开粉碎黑色塑料高光谱数据集,开发多模态光谱-空间框架,结合高光谱Transformer与化学计量学波段选择,建立含9种方法的综合基准。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28778 2026-09-01 cs.RO cs.CV cs.ET cs.LG cs.SY eess.SY 新提交 57%

Adversarial Calibration Attack on Autonomous Vehicles

针对自动驾驶汽车的对抗性校准攻击

Liangkai Liu, Qingzhao Zhang, Kang G. Shin

机构 * Texas Tech University(德克萨斯理工大学) University of Arizona(亚利桑那大学) University of Michigan(密歇根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出针对自动驾驶汽车相机-激光雷达在线校准的对抗性校准攻击(ACA),通过对抗性海报可诱导校准误差,引发感知等系统错误,在仿真和物理实验中均验证了其有效性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-09-01 cs.CL 版本更新 57%

Physics-R1: An Audited Olympiad Corpus and Released Verifiers for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-09-01 cs.AI 版本更新 57%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted By EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03828 2026-09-01 cs.AI cs.MA 版本更新 57%

AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance

AssetOpsBench:工业资产运维任务自动化AI代理的基准测试

Dhaval Patel, Shuxin Lin, James Rayfield, Nianjun Zhou, Chathurangi Shyalika, Suryanarayana R Yarrabothula, Roman Vaculin, Natalia Martinez, Fearghal O'donncha, Jayant Kalagnanam

机构 * IBM University of South Carolina(南卡罗来纳大学) IBM Research(IBM研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出AssetOpsBench,一个统一框架,用于协调和评估工业4.0中的领域专用代理。该框架包含四个领域代理目录、140+人工撰写的自然语言查询数据集及模拟的CouchDB后端物联网环境,通过三个关键指标分析工具-代理与计划-执行者范式的架构权衡,并系统化发现新兴故障模式。

Comments 25 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30526 2026-09-01 cs.HC 新提交 50%

User Experience in Human-Machine Interaction: Insights from Field Studies in Autonomous Mobility

人机交互中的用户体验:来自自主移动实地研究的见解

Helen Schneider, Svetlana Pavlitska, J. Marius Zöllner

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本研究针对AVs用户接受度研究的场景局限,通过144名参与者的真实交通实地研究,验证多模态传感在乘客情感推断中的实用性,提供相关研究工具,为自主系统用户中心设计奠定基础。

Comments Accepted for publication at ABAW Workshop at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29661 2026-09-01 cs.CE 新提交 50%

OmniClimate-TC: Physics-Aware Visual Abstractions for Multimedia Reasoning over Tropical Cyclones

OmniClimate-TC:面向热带气旋多媒体推理的物理感知视觉抽象

Luwei Xiao, Xin Wang, Keane Ong, Jiawen Wei, Chenyu Dong, Rui Mao, Erik Cambria, Gianmarco Mengaldo

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究针对VLMs处理热带气旋灾害场时的感知不匹配问题,提出PAVA接口并构建OmniClimate-TC基准,证实该表示设计可提升VLMs的相关推理能力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.08774 2026-09-01 q-bio.PE cs.LG stat.ML 版本更新 50%

PhyloGFN: Phylogenetic inference with generative flow networks

PhyloGFN:基于生成流网络的系统发育推断

Mingyang Zhou, Zichao Yan, Elliot Layne, Esmeralda S. Whitammer, Dinghuai Zhang, Moksh Jain, Mathieu Blanchette, Yoshua Bengio

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出PhyloGFN,将生成流网络(GFlowNets)框架用于系统发育推断,在真实基准数据集上产生多样高质量进化假设,边际似然估计具竞争力,贴合目标分布优于变分推断方法。

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 24 篇

2608.30498 2026-09-01 cs.AI 新提交 90%

CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework

CM2:基于集成多智能体框架的多模态文化推理

Qi Li, Zhaojie Kang, Yingjie He, Zheng Lin, Hao Zhang, Guangxin Wu, Yan Gong, Rong Fu, Jianyuan Ni

机构 * Lanzhou University(兰州大学) Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型(MLLM)跨学科文化推理不足的问题,提出基于人类文化解释认知路径的CM2多智能体框架,在CM2D数据集上较CoT等范式取得一致提升,各模块贡献及跨模态仲裁能力均得到验证。

Comments Accepted to the 23rd Pacific Rim International Conference on Artificial Intelligence (PRICAI 2026) as a short paper. 11 pages, 4 figures. Code and dataset are available at https://github.com/GitHub-12138/CM2-Multimodal-Cultural-Reasoning-via-an-Integrated-Multi-Agent-Framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30704 2026-09-01 cs.CV 新提交 90%

TUE-Detector: A Tool-Using Expert MLLM-Based Detector for AI-Generated Videos

TUE-Detector:一种基于使用工具的专家多模态大语言模型(MLLM)的AI生成视频检测器

Yichen Wu, Haoxuan Qu, Yongxing Dai, Yan Bai, Yihang Lou, Yuqi Lin, Hossein Rahmani, Jun Liu

机构 * University of Nottingham(诺丁汉大学) Lancaster University(兰卡斯特大学) Peking University(北京大学)

专题命中 多模态Agent :MLLM(title,title_cn);分类 cs.CV

AI总结 本研究针对AI生成视频检测中识别细微非自然伪影的挑战,提出TUE-Detector框架,将通用MLLM训练为使用工具的专家检测器,通过调用工具收集证据推理检测,经大量实验验证其有效性。

Comments 32 pages, 7 figures, 28 tables; includes supplementary material. Code: https://github.com/Louis-YW/TUE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30705 2026-09-01 cs.CV 新提交 85%

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

VisLens:面向多模态大语言模型的单次可解释视觉搜索方法

Jingyi He, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Munich(慕尼黑亥姆霍兹中心) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对多模态大语言模型的细粒度视觉搜索问题,提出VisLens方法,通过单次前向传播实现可解释的视觉搜索,性能优于或相当现有方法且推理速度大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-09-01 cs.CL cs.AI cs.MA 版本更新 81%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29114 2026-09-01 cs.RO cs.AI 新提交 79%

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

CGFM-Nav:用于语义引导的终身多模态具身导航的认知图场记忆

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对视觉与语言导航中环境表征的不足,提出CGFM及基于其的CGFM-Nav框架,在GOAT-Bench实验中提升了导航的成功率与SPL,验证了方法的有效性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新 79%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00610 2026-09-01 cs.CY cs.AI 版本更新 79%

Multimodal Large Language Models Predict Urban Safety Perception but Encode Non-Neutral Demographic Priors

多模态大语言模型可预测城市安全感知,但编码非中立的人口统计先验

Ciro Beneduce, Bruno Lepri, Massimiliano Luca

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 该研究验证多模态大语言模型可规模化预测城市安全感知,但发现其存在非中立人口统计先验,不同性别、种族角色下的安全判断存在系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏