arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9251 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9251 篇

2606.25445 2026-06-25 cs.CV cs.AI 新提交 62%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24488 2026-06-24 cs.CV cs.AI stat.ME 新提交 62%

RetiSEM: Generalising Causal Models for Fragmented Biomedical Data

RetiSEM:泛化碎片化生物医学数据的因果模型

Inam Ullah, Imran Razzak, Shoaib Jameel

机构 * University of Southampton(南安普顿大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出RetiSEM框架,通过领域约束的结构方程模型从碎片化生物医学数据中恢复因果图并进行中介分析,在合成和真实数据上优于无约束基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23678 2026-06-23 cs.CV cs.AI 新提交 62%

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

AIR: MLLMs中的自适应交错推理与代码

Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

机构 * Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出自适应交错推理框架AIR,通过强化学习训练代码增强的复杂数值计算任务,采用分组约束奖励函数和两阶段数据构建,使性能平均提升6.1个百分点。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23144 2026-06-23 cs.CV cs.CL 新提交 62%

Koshur Pixel: a large-scale synthetic ocr dataset for kashmiri

Koshur Pixel:克什米尔语的大规模合成OCR数据集

Haq Nawaz Malik, Faizan Iqbal, Nahfid Nissar

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 针对低资源语言克什米尔语,提出首个大规模合成OCR数据集Koshur Pixel,包含613,078个图像-文本对,采用SynthOCR-Gen框架生成,覆盖多种字体和文本粒度,并集成25种以上数据增强策略,为训练OCR系统、数字化克什米尔文本遗产提供基础资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22608 2026-06-23 cs.CV cs.CL 新提交 62%

Automated sign detection across the Electronic Babylonian Library: A large-scale dataset and end-to-end cuneiform OCR pipeline

电子巴比伦图书馆中的自动楔形文字符号检测:大规模数据集与端到端楔形文字OCR流水线

Wentao Che, Esteban Garcés Arias, Asim Niaz, Andreas Bender, Enrique Jiménez

机构 * Institute of Assyriology and Hittite Studies, LMU Munich(慕尼黑大学亚述学与赫梯学研究所) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出基于可变形检测Transformer(DETR)的楔形文字符号检测模型,在最大标注数据集上实现28-37%的COCO指标提升,并应用于eBL语料库生成290万检测结果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交 62%

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20177 2026-06-23 cs.CV cs.AI 新提交 62%

Evaluating and Enhancing Negation Comprehension in Remote Sensing MLLMs

评估与增强遥感多模态大语言模型的否定理解能力

Haochen Han, Jue Wang, Alex Jinpeng Wang, Fangming Liu

机构 * Peng Cheng Laboratory(鹏城实验室) Tsinghua University(清华大学) Central South University(中南大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出RS-Neg基准评估遥感MLLMs的否定理解,并设计NeFo方法通过测试时学习利用约5%未标注样本显著提升模型性能。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09316 2026-06-23 cs.CV cs.AI cs.LG 版本更新 62%

CLoE: Expert Consistency Learning for Robust Missing Modality Segmentation

CLoE: 面向鲁棒缺失模态分割的专家一致性学习

Xinyu Tong, Meihua Zhou, Bowu Fan, Haitao Li

机构 * University of Chinese Academy Sciences(中国科学院大学) School of Medicine, Southeast University(东南大学医学院) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出CLoE框架,通过模态专家一致性和区域专家一致性双重目标,结合可靠性感知门控网络,解决多模态分割中模态缺失导致的专家分歧和不稳定融合问题,在BraTS 2020和MSD Prostate上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20527 2026-06-19 cs.CL cs.CV 新提交 62%

StylisticBias: A Few Human Visual Cues Drive Most Social Biases in MLLMs

StylisticBias: 少数人类视觉线索驱动多模态大语言模型中的大部分社会偏见

Shaghayegh Kolli, Timo Cavelius, Nafiseh Nikeghbal, Samantha Dalal, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Princeton Center for Information and Technology Policy(普林斯顿信息与技术政策中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出StylisticBias基准,通过控制单一视觉属性变化,发现年龄和体型主导身份层面偏见,而时尚风格等约15个属性解释近80%的偏见变化,偏见集中于少数视觉线索。

Comments Accepted to the non-archival workshops AI4Good and Culture x AI at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19727 2026-06-19 cs.CL cs.AI 新提交 62%

NRITYAM: Language Models Meet Art and Heritage of Dance

NRITYAM:语言模型遇见舞蹈的艺术与遗产

Punit Kumar Singh, Niladri Ghosh, Advait Joshiınst, Shailee Choudhary, Michael Färber, Haiqin Yang

机构 * Shenzhen Technology University(深圳技术大学) New Delhi Institute of Management(新德里管理学院) Technische Universität Dresden(德累斯顿工业大学) Ramakrishna Mission Vivekananda Educational and Research Institute(罗摩克里希纳传道会维韦卡南达教育与研究学院) Indian Institute of Technology(印度理工学院) Swami Vivekananda Institute of Technology(斯瓦米·维韦卡南达技术学院) GuangDong Engineering Technology Research Center of Edge Intelligence(广东省边缘智能工程技术研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出NRITYAM基准,包含9,260个跨12语言的文化问答对,评估语言模型对全球舞蹈传统的文化理解能力,涵盖多种模型类型。

Comments 18 pages, 12 figures, in ECML_PKDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03646 2026-06-18 cs.LG cs.AI cs.CV 版本更新 62%

Revealing Hidden Vulnerabilities in Autoencoders through Gradient Signal Restoration

通过梯度信号恢复揭示自编码器中的隐藏漏洞

Chethan Krishnamurthy Ramanaik, Arjun Roy, Tobias Callies, Eirini Ntoutsi

机构 * University of the Bundeswehr Munich(联邦国防军理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对自编码器对抗攻击中梯度消失导致鲁棒性被高估的问题,提出GRILL框架恢复梯度信号,显著提升攻击效果,暴露隐藏漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17080 2026-06-17 cs.RO cs.AI cs.CV 新提交 62%

HRDX: A Large-Scale Vector HD-Map Dataset

HRDX:大规模矢量高清地图数据集

Sahith Reddy Chada, Isht Dwivedi, Nirav Savaliya

机构 * Honda Research Institute US(本田美国研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出HRDX大规模矢量高清地图数据集,覆盖1400公里驾驶数据,含10类地图元素和20多种属性,并引入复合评分评估几何与属性准确性。

Comments https://usa.honda-ri.com/hrdx

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19099 2026-06-17 cs.CV cs.AI 版本更新 62%

m2sv: A Scalable Benchmark for Map-to-Street-View Spatial Reasoning

m2sv: 地图到街景空间推理的可扩展基准

Yosub Shin, Michael Buriek, Igor Molybog

机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出m2sv基准,通过匹配朝北俯视图与街景图像推断相机方向,评估VLM空间推理能力;最佳模型准确率65.2%,低于人类72.0%,揭示几何对齐与推理一致性的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15307 2026-06-16 cs.CL cs.AI 新提交 62%

Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes

利用思维链监督的强化学习进行仇恨和宣传模因的可解释检测

Mohamed Bayan Kmainasi, Mucahid Kutlu, Ali Ezzat Shahroor, Abul Hasnat, Firoj Alam

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Qatar University(卡塔尔大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出基于强化学习的后训练方法,结合任务特定奖励和组相对策略优化(GRPO),提升思考型多模态大语言模型在仇恨和宣传模因检测中的分类性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16970 2026-06-16 cs.CV cs.AI 版本更新 62%

MAND: Modality-Aware Novelty Detection for Open-World Egocentric Activity Recognition

MAND: 面向开放世界自我中心活动识别的模态感知新颖性检测

Hyejeong Im, Wonseon Lim, Dae-Won Kim

机构 * Department of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MAND框架,通过模态感知自适应评分和表示稳定训练,利用视觉和惯性模态互补信息,提升开放世界自我中心活动识别中的新颖性检测和已知类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13602 2026-06-16 eess.IV cs.AI cs.CV 62%

Translating Electrocardiograms to Cardiac Magnetic Resonance Imaging Useful for Cardiac Assessment and Disease Screening: A Multi-Center Study

将心电图转换为心脏磁共振成像对心脏评估和疾病筛查有用:一项多中心研究

Zhengyao Ding, Ziyu Li, Yujian Hu, Youyao Xu, Chengchen Zhao, Yiheng Mao, Haitao Li, Zhikang Li, Qian Li, Jing Wang, Yue Chen, Mengjia Chen, Longbo Wang, Xuesen Chu, Weichao Pan, Ziyi Liu, Fei Wu, Hongkun Zhang, Ting Chen, Zhengxing Huang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Vascular Surgery, The First Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第一医院血管外科) Department of Cardiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院心内科) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院放射科) Department of Vascular Surgery, Quzhou People’s Hospital(衢州人民医院血管外科) Department of Cardiology, The Second Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第二医院心内科) China Ship Scientific Research Center(中国船舶科学研究院) Guangdong Transtek Medical Electronics Co., Ltd.(广东 Transtek 医疗电子有限公司)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CardioNets框架,通过深度学习将12导联心电图信号转换为心脏磁共振成像级别的功能参数和合成图像,提升大规模心血管疾病筛查的效率和可及性。

Comments 29 pages, 7 figures

Journal ref NEJM AI 2026;3(4)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19947 2026-06-15 cs.CV cs.AI 版本更新 62%

Vanishing Depth: Training Generalized Depth Adapters with Sinusoidal Depth Preprocessing for Pretrained RGB Encoders

消失深度:基于正弦深度预处理的预训练RGB编码器通用深度适配器训练

Paul Koch, Jörg Krüger

机构 * Fraunhofer IPK(弗劳恩霍夫研究所) TU-Berlin(技术大学柏林)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出自监督训练方法,为预训练RGB编码器添加深度适配器,结合正弦深度编码实现通用鲁棒的深度特征提取,在分割、姿态估计和深度补全等下游任务中提升基线性能,SUN-RGBD分割达56.05 mIoU。

Comments Accepted to IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09855 2026-06-12 cs.MM cs.CV cs.LG 新提交 62%

MinhwaNet: Faithful but Insufficient Object Grounding in Korean Folk Painting

MinhwaNet: 韩国民俗画中忠实但不足的对象定位

Joonhyung Bae

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出MinhwaNet,通过部分级检测器生成对象证据图,发现韩国民俗画中符号列表不足以预测画作类型,而符号布局更重要,揭示了忠实但不足的解离现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13591 2026-06-12 cs.AI cs.CL 版本更新 62%

DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体

Maojun Sun, Yifei Xie, Yue Wu, Ruijian Han, Binyan Jiang, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22725 2026-06-11 cs.CV cs.AI 版本更新 62%

OpenVTON-Bench: A Large-Scale High-Resolution Benchmark for Controllable Virtual Try-On Evaluation

OpenVTON-Bench:用于可控虚拟试穿评估的大规模高分辨率基准

Jin Li, Tao Chen, Kai Wen, Siqi Yin, Shuai Jiang, Weijie Wang, Jingwen Luo, Chenhui Wu

机构 * Renxing Intelligence, Hangzhou, China Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出OpenVTON-Bench,包含约10万对高分辨率图像,通过DINOv3聚类和Gemini描述构建,并设计多模态评估协议,沿五个维度衡量试穿质量,与人类判断高度一致。

Comments Under review for the NeurIPS 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07415 2026-06-10 cs.CV cs.CL 版本更新 62%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09644 2026-06-09 cs.CL cs.CV 新提交 62%

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

答案从何而来?面向自动驾驶的多视角MLLMs中视角级视觉证据识别基准

Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多视角自动驾驶场景,提出一个基准测试,评估多模态大模型在视觉问答中识别支持性相机视角的能力,包含122个冲突中心问题对,并区分视角选择与答案正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09578 2026-06-09 cs.AI cs.CL cs.IR 新提交 62%

TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs

TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试

Momina Ahsan, Sarfraz Ahmad, Ming Shan Hee, Roy Ka-Wei Lee, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出TABVERSE基准,通过控制表格内容、跨多种结构格式(HTML、Markdown、LaTeX)和渲染图像,系统评估LLM和VLM在问答、结构理解和结构重建任务中的表现,发现表示格式显著影响表格理解能力。

Comments 24 pages, 18 tables, 16 figures, Submitted to ARR May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08959 2026-06-09 cs.CV cs.CL 新提交 62%

ChinaHeritaQA: A Culturally-Grounded Visual Question Answering Dataset for World Heritage Sites in China

ChinaHeritaQA:面向中国世界遗产地的文化基础视觉问答数据集

Yi Zhang, Bolei Ma, Yong Cao, Chengyan Wu, Daniel Hershcovich, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) FAU Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Tübingen & Tübingen AI Center(图宾根大学与图宾根人工智能中心) Sun Yat-sen University(中山大学) University of Copenhagen(哥本哈根大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出ChinaHeritaQA多模态基准数据集,包含2279张图像和14133个双语多项选择题,覆盖七个认知维度,评估视觉语言模型在中国世界遗产上的文化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07938 2026-06-09 cs.CV cs.MM eess.IV 新提交 62%

DAL-PCQA: Enabling Distortion-Level and Language-Driven Reasoning for Point Cloud Quality Assessment

DAL-PCQA:实现点云质量评估的失真级别与语言驱动推理

Swarna Chakraborty, Gabriel De Castro Araújo, Syeda Tasmi Faria, Marcelo M. Carvalho, Mylene C. Q. Farias

机构 * University of Brasília(巴西利亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 提出DAL-PCQA数据集,通过多级失真标签、质量类别和自然语言描述,结合零样本与微调多模态模型,实现可解释的点云质量评估。

Comments Accepted at Qomex 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07653 2026-06-09 cs.CV cs.AI 新提交 62%

A Dataset for Dynamic Human Preferences for Vision Language Models

面向视觉语言模型的动态人类偏好数据集

Hannah Gao, Dylan Hadfield-Menell, Rachel Ma

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一个评估视觉语言模型理解动态人类偏好能力的基准,通过自动化管道生成包含图像依赖变化的数据集,并评估了现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18347 2026-06-09 cs.CL cs.AI 版本更新 62%

Multilingual Training and Evaluation Resources for Vision-Language Models

面向视觉语言模型的多语言训练和评估资源

Daniela Baiamonte, Elena Fano, Matteo Gabburo, Stefano Simonazzi, Leonardo Rigutini, Andrea Zugarini

机构 * Villanova.ai Aithlas

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出跨五种欧洲语言的视觉语言模型训练与评估资源,通过再生与翻译方法生成高质量多语言数据,验证多语言数据在非英语基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19190 2026-06-05 cs.CV cs.AI 62%

FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery

FUSAR-GPT : 一种嵌入时空特征和两阶段解耦的视觉语言模型,用于合成孔径雷达图像

Xiaokun Zhang, Yi Yang, Ziqi Ye, Baiyun, Xiaorong Guo, Qingchen Fang, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Discipline and Technology Center of Microwave Vision Intelligent Sensing, Fudan University(微波视觉智能感知学科与技术中心,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FUSAR-GPT,一种专门针对合成孔径雷达图像的视觉语言模型,通过嵌入时空特征和两阶段解耦方法,在多个遥感视觉语言基准测试中实现了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04970 2026-06-04 cs.CV cs.AI 62%

Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance

计划、观察、恢复:主动式程序辅助的基准与架构

Kaustav Kundu, Ritvik Shrivastava, Maxim Arap, Nanshu Wang, Xianhui Zhu, Quintin Fettes, Gautam Tiwari, Parth Suresh, Théo Moutakanni, Alejandro Castillejo Munoz, Allen Bolourchi, Pascale Fung, Pinar Donmez, Babak Damavandi, Anuj Kumar, Seungwhan Moon

机构 * Meta Reality Labs(Meta现实实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出EgoProactive数据集和Pro²Bench基准,并设计解耦规划器-交互架构,用于主动式程序辅助中的实时引导和异常恢复。

Comments 53 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01421 2026-06-04 cs.AI cs.CL 62%

SciDER: Scientific Data-centric End-to-end Researcher

SciDER: 以科学数据为中心的端到端研究者

Ke Lin, Owais Aijaz, Yilin Lu, Yiyang Luo, Xuehang Guo, Preslav Nakov

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出SciDER多智能体系统,通过数据驱动方法和动态多模态技能系统,自动化科学研究的全生命周期,并在六个基准测试中取得领先结果。

Comments 10 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏