arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-21 至 2026-01-21 共收录 45 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 45 篇

2601.12346 2026-01-21 cs.CV 83%

MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents

MMDeepResearch-Bench: 一个多模态深度研究代理的基准

Peizhou Huang, Zixuan Zhong, Zhongwei Wan, Donghao Zhou, Samiul Alam, Xin Wang, Zexin Li, Zhihao Dou, Li Zhu, Jing Xiong, Chaofan Tao, Yan Xu, Dimitrios Dimitriadis, Tuo Zhang, Mi Zhang

机构 * OSU(俄亥俄州立大学) Amazon(亚马逊公司) UMich(密歇根大学) UCL(伦敦大学学院) CUHK(香港中文大学) UCR(加州大学尔湾分校) CWRU(克里夫兰医学中心) HKU(香港大学)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13532 2026-01-21 cs.CV 83%

RemoteDet-Mamba: A Hybrid Mamba-CNN Network for Multi-modal Object Detection in Remote Sensing Images

RemoteDet-Mamba: 一种用于遥感图像多模态目标检测的混合Mamba-CNN网络

Kejun Ren, Xin Wu, Lianming Xu, Li Wang

机构 * School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(计算机科学学院,北京邮电大学) School of Electronic Engineering, Beijing University of Posts and Telecommunications, Beijing, China(电子工程学院,北京邮电大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 RemoteDet-Mamba通过融合多模态信息提升遥感图像中小目标的检测性能,采用轻量级融合机制降低计算复杂度,实验证明其在检测精度和效率上的优势。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12820 2026-01-21 cs.CV 81%

A Generalist Foundation Model for Total-body PET/CT Enables Diagnostic Reporting and System-wide Metabolic Profiling

一种通用的基础模型用于全身PET/CT,实现诊断报告和系统层面的代谢分析

Wei Chen, Liang Wu, Shuyi Lu, Yuanyuan Sun, Wenkai Bi, Zilong Yuan, Yaoyao He, Feng Wang, Junchi Ma, Shuyong Liu, Zhaoping Cheng, Xiaoyan Hu, Jianfeng Qiu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);multimodal foundation model(abstract)

AI总结 SDF-HOLO是一种用于全身PET/CT的通用基础模型,通过多模态学习实现诊断报告和系统代谢分析,提升医疗影像处理的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20136 2026-01-21 cs.CL cs.AI cs.IR 81%

Multi-Stage Verification-Centric Framework for Mitigating Hallucination in Multi-Modal RAG

多阶段验证导向框架用于缓解多模态RAG中的幻觉

Baiyu Chen, Wilson Wongso, Xiaoqian Hu, Yue Tan, Flora Salim

机构 * The University of New South Wales(新南威尔士大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。

Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24816 2026-01-21 cs.CV cs.AI 81%

Perception, Understanding and Reasoning, A Multimodal Benchmark for Video Fake News Detection

感知、理解和推理,一个用于视频虚假新闻检测的多模态基准

Cui Yakun, Peng Qi, Fushuo Huo, Hang Du, Weijie Shi, Juntao Dai, Zhenghao Zhu, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出POVFNDB多模态基准,通过10个任务系统评估MLLMs在视频虚假新闻检测中的感知、理解和推理能力,并通过微调Qwen2.5VL-7B-Instruct达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 79%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13052 2026-01-21 cs.CV 79%

GridNet-HD: A High-Resolution Multi-Modal Dataset for LiDAR-Image Fusion on Power Line Infrastructure

GridNet-HD: 一种高分辨率多模态数据集,用于电力线路基础设施的LiDAR-图像融合

Antoine Carreaud, Shanci Li, Malo De Lacour, Digre Frinde, Jan Skaloud, Adrien Gressin

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 GridNet-HD是一个高分辨率多模态数据集,用于电力线路基础设施的LiDAR-图像融合,通过融合高密度LiDAR和高分辨率影像提升3D语义分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10949 2026-01-21 cs.CV 79%

MMedExpert-R1: Strengthening Multimodal Medical Reasoning via Domain-Specific Adaptation and Clinical Guideline Reinforcement

MMedExpert-R1: 通过领域特定适应与临床指南强化多模态医学推理

Meidan Ding, Jipeng Zhang, Wenxuan Wang, Haiqin Zhong, Xiaoling Luo, Wenting Chen, Linlin Shen

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Renmin University of China(中国人民大学) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MMedExpert-R1通过领域特定适应和临床指南强化,提升多模态医学推理能力,实现多专科对齐和高精度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10360 2026-01-21 cs.CV 79%

FaceXBench: Evaluating Multimodal LLMs on Face Understanding

FaceXBench: 评估多模态大语言模型在面部理解上的能力

Kartik Narayan, Vibashan VS, Vishal M. Patel

机构 * Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(电气与计算机工程系,约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FaceXBench通过5000个多模态问题评估MLLMs在面部理解上的能力,揭示了现有模型在复杂任务中的不足。

Comments Accepted in IEEE T-BIOM. Project Page: https://kartik-3004.github.io/facexbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13639 2026-01-21 cs.RO 78%

A General One-Shot Multimodal Active Perception Framework for Robotic Manipulation: Learning to Predict Optimal Viewpoint

一种通用的一次性多模态主动感知框架用于机器人操作:学习预测最佳视角

Deyun Qin, Zezhi Liu, Hanqian Luo, Xiao Liang, Yongchun Fang

机构 * Institute of Robotics and Automatic Information Systems, College of Artificial Intelligence, Nankai University(机器人与自动信息系统研究所,人工智能学院,南开大学) Tianjin Key Laboratory of Intelligent Robotics, Nankai University(智能机器人重点实验室,南开大学) College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) Department of Computing, The Hong Kong Polytechnic University(computing 部门,香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种通用的一次性多模态主动感知框架,用于机器人操作,通过多模态特征融合和交叉注意力机制提升抓取成功率,并实现仿真到现实的无缝迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09853 2026-01-21 cs.LG 78%

ConSurv: Multimodal Continual Learning for Survival Analysis

ConSurv:面向生存分析的多模态持续学习

Dianzhi Yu, Conghao Xiong, Yankai Chen, Wenqian Cui, Xinni Zhang, Yifei Zhang, Hao Chen, Joseph J. Y. Sung, Irwin King

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 ConSurv是首个用于生存分析的多模态持续学习方法,通过多阶段混合专家和特征受限重放技术,有效解决灾难性遗忘和复杂模态交互问题。

Comments 14 pages, 4 figures. This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12584 2026-01-21 cond-mat.mtrl-sci 78%

Multi-modal data-driven microstructure characterization

多模态数据驱动的微观结构表征

Qi Zhang, Santiago Benito, Sebastian Weber, Markus Stricker

专题命中 多模态评测 :multi-modal(title);multimodal(abstract)

AI总结 本研究通过多模态数据驱动方法实现自动化的微观结构表征,包括晶粒分割和晶界检测,利用信息论优化参数选择和潜在空间特征映射。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11606 2026-01-21 cs.LG 78%

A Multimodal Data Processing Pipeline for MIMIC-IV Dataset

用于MIMIC-IV数据集的多模态数据处理流程

Farzana Islam Adiba, Varsha Danduri, Fahmida Liza Piya, Ali Abbasi, Mehak Gupta, Rahmatollah Beheshti

机构 * University of Delaware(德克萨斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种用于MIMIC-IV数据集的多模态数据处理流程,旨在提升多模态数据处理效率和研究可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23627 2026-01-21 cs.SI 78%

MASH: A Multiplatform and Multimodal Annotated Dataset for Societal Impact of Hurricane

MASH: 一种用于飓风社会影响的多平台和多模态注释数据集

Ruichen Yao, Aslanbek Murzakhmetov, Raaghav Pillai, Aliya Maussymbayeva, Zelin Li, Yifan Liu, Yaokun Liu, Lanyu Shang, Yang Zhang, Na Wei, Ximing Cai, Dong Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 MASH数据集通过多平台和多模态注释,全面覆盖飓风社会影响的多维度研究需求。

Comments preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14055 2026-01-21 cs.CV cs.AI 76%

Decoder-Free Supervoxel GNN for Accurate Brain-Tumor Localization in Multi-Modal MRI

无解码器的监督超像素图神经网络用于多模态MRI中脑肿瘤的准确定位

Andrea Protani, Marc Molina Van Den Bosch, Lorenzo Giusti, Heloisa Barbosa Da Silva, Paolo Cacace, Albert Sund Aillet, Miguel Angel Gonzalez Ballester, Friedhelm Hummel, Luigi Serio

机构 * European Organization for Nuclear Research, Geneva, Switzerland(欧洲核子研究中心) Dept. of Neuroscience, École Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(瑞士洛桑联邦理工学院神经科学系) BCN Medtech, Dept. of Engineering, Universitat Pompeu Fabra, Barcelona, Spain(巴塞罗那大学工程系) Universidade de Coimbra, Coimbra, Portugal(科英布拉大学) Sapienza Università di Roma, Rome, Italy(罗马萨皮恩扎大学) ICREA, Barcelona, Spain(巴塞罗那高等科研机构)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出SVGFormer,一种无解码器的监督超像素图神经网络,用于多模态MRI中脑肿瘤的准确定位,通过层次编码器结合Transformer和图注意力网络,实现高精度和可解释的医学图像分析。

Comments 10 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06243 2026-01-21 cs.CL cs.AI 74%

CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning

CoT Referring: 通过 grounded 推理改进指称表达任务

Qihua Dong, Luis Figueroa, Handong Zhao, Kushal Kafle, Jason Kuen, Zhihong Ding, Scott Cohen, Yun Fu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 多模态评测 :MLLM(abstract,comments);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 通过 grounded 推理改进指称表达任务,提出CoT Referring方法,提升多模态大语言模型在复杂指称场景中的性能。

Comments MLLM, Referring Expression Segmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24866 2026-01-21 cs.CV 74%

TalkingHeadBench: A Multi-Modal Benchmark & Analysis of Talking-Head DeepFake Detection

TalkingHeadBench: 一个多模态基准及谈话头深度伪造检测分析

Xinqi Xiong, Prakrut Patel, Qingyuan Fan, Amisha Wadhwa, Sarathy Selvam, Xiao Guo, Luchao Qi, Xiaoming Liu, Roni Sengupta

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV

AI总结 TalkingHeadBench是一个多模态基准,用于评估和分析最先进的谈话头深度伪造检测方法,通过精心设计的协议和数据集提升检测模型的鲁棒性和泛化能力。

Comments WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12256 2026-01-21 cs.AI 74%

Improving Large Molecular Language Model via Relation-aware Multimodal Collaboration

通过关系感知的多模态协作改进大型分子语言模型

Jinyoung Park, Minseong Bae, Jeehye Na, Hyunwoo J. Kim

机构 * Korea University(韩国大学)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 CoLLaMo通过关系感知的多模态协作机制提升分子语言模型的泛化能力,优化分子模态整合并改进评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13299 2026-01-21 cs.CV 70%

Enginuity: Building an Open Multi-Domain Dataset of Complex Engineering Diagrams

Enginuity:构建一个复杂的工程图多领域开放数据集

Ethan Seefried, Prahitha Movva, Naga Harshita Marupaka, Tilak Kasturi, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Enginuity是一个开放的多领域工程图数据集,旨在通过结构注释帮助AI处理工程图解析和科学发现。

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Ai4 Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12585 2026-01-21 cs.HC cs.AI cs.ET 70%

Do MLLMs See What We See? Analyzing Visualization Literacy Barriers in AI Systems

MLLMs是否看到我们看到的?分析AI系统中可视化素养障碍

Mengli, Duan, Yuhe, Jiang, Matthew Varona, Carolina Nobre

机构 * University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究分析了MLLMs在可视化素养中的障碍,揭示了两种机器特定的障碍,并展示了模型在复杂可视化任务上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12505 2026-01-21 cs.CL 70%

DoPE: Decoy Oriented Perturbation Encapsulation Human-Readable, AI-Hostile Documents for Academic Integrity

DoPE: 伪装导向扰动封装用于学术诚信的人可读AI敌对文档

Ashish Raj Shekhar, Shiven Agarwal, Priyanuj Bordoloi, Yash Shah, Tejas Anvekar, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CL

AI总结 DoPE通过在考试文档中嵌入语义伪装,利用MLLM pipelines的渲染-解析差异,实现对AI自动解决的预防和检测,提升学术诚信保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 70%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09949 2026-01-21 cs.CV 70%

UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?

UVE: MLLMs是否能作为AI生成视频的统一评估器?

Yuanxin Liu, Rui Zhu, Shuhuai Ren, Jiacong Wang, Haoyuan Guo, Xu Sun, Lu Jiang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ByteDance Seed(字节跳动种子) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14084 2026-01-21 cs.CV cs.AI cs.CL 67%

DermaBench: A Clinician-Annotated Benchmark Dataset for Dermatology Visual Question Answering and Reasoning

DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集

Abdurrahim Yilmaz, Ozan Erdem, Ece Gokyayla, Ayda Acar, Burc Bugra Dagtas, Dilara Ilhan Erdil, Gulsum Gencoglan, Burak Temelkuran

机构 * Imperial College London(帝国理工学院伦敦分校) Istanbul Medeniyet University(伊斯坦布尔医学大学) Usak Research and Training Hospital(Usak研究与培训医院) Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) Ipswich Hospital(伊普斯韦奇医院) Medicana Atakoy Hospital(Medicana阿塔基医院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14127 2026-01-21 cs.CV cs.CL 62%

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10462 2026-01-21 cs.AI cs.CV 62%

ChartComplete: A Taxonomy-based Inclusive Chart Dataset

ChartComplete: 基于分类的包容性图表数据集

Ahmad Mustapha, Charbel Toumieh, Mariette Awad

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ChartComplete数据集基于图表分类学,涵盖30种图表类型,为多模态大语言模型提供新的基准测试资源。

Comments 7 pages, 4 figures, 3 tables, 1 algorithm. Dataset and source code available at https://github.com/AI-DSCHubAUB/ChartComplete-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09012 2026-01-21 cs.CL cs.AI 62%

TranslateGemma Technical Report

TranslateGemma 技术报告

Mara Finkelstein, Isaac Caswell, Tobias Domhan, Jan-Thorsten Peter, Juraj Juraska, Parker Riley, Daniel Deutsch, Geza Kovacs, Cole Dilanni, Colin Cherry, Eleftheria Briakou, Elizabeth Nielsen, Jiaming Luo, Kat Black, Ryan Mullins, Sweta Agrawal, Wenda Xu, Erin Kats, Stephane Jaskiewicz, Markus Freitag, David Vilar

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TranslateGemma基于Gemma 3开发,通过两阶段微调提升多语言翻译性能,实现高效且高质量的翻译模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13304 2026-01-21 cs.CV 57%

CausalSpatial: A Benchmark for Object-Centric Causal Spatial Reasoning

CausalSpatial: 一个用于以对象为中心的因果空间推理的基准

Wenxin Ma, Chenlong Wang, Ruisheng Yuan, Hao Chen, Nanru Dai, S. Kevin Zhou, Yijun Yang, Alan Yuille, Jieneng Chen

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 CausalSpatial提出一个基准测试,评估模型在因果空间推理中的能力,揭示当前MLLMs在3D场景中处理‘如果’问题的不足,并提出COW模型以改进基于物理现实的推理。

Comments Code is available: https://github.com/CausalSpatial/CausalSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13264 2026-01-21 cs.CL 57%

Unlearning in LLMs: Methods, Evaluation, and Open Challenges

在大语言模型中进行反学习:方法、评估与开放挑战

Tyler Lizzo, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型中反学习的方法、评估体系及开放挑战,旨在为开发可靠且负责任的反学习技术提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10521 2026-01-21 cs.CV 57%

BikeActions: An Open Platform and Benchmark for Cyclist-Centric VRU Action Recognition

BikeActions: 一个面向骑行者的VRU动作识别开放平台和基准

Max A. Buettner, Kanak Mazumder, Luca Koecher, Mario Finkbeiner, Sebastian Niebler, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学) Intelligent Vehicles Lab (IVL)(智能车辆实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 BikeActions通过多模态数据集和开放平台,提升骑行者意图识别的准确性和研究的可扩展性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏