arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9251 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9251 篇

2511.00392 2026-05-19 cs.RO cs.AI cs.CV 62%

SonarSweep: Fusing Sonar and Vision for Robust 3D Reconstruction via Plane Sweeping

SonarSweep: 通过平面扫描融合声纳与视觉以实现鲁棒的3D重建

Lingpeng Chen, Jiakun Tang, Apple Pui-Yi Chui, Ziyang Hong, Junfeng Wu

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Chinese University of Hong Kong, Hong Kong(香港中文大学) Department of Automation, Harbin Institute of Technology(哈尔滨工业大学自动化系)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SonarSweep,一种端到端的深度学习框架,通过将平面扫描算法应用于声纳与视觉数据的跨模态融合,克服了单一模态方法在 underwater 环境中3D重建的局限性,实现了更精确和稳定的深度图生成。

Comments 8 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18132 2026-05-19 cs.CV cs.AI 62%

Who Generated This 3D Asset? Learning Source Attribution for Generative 3D Models

谁生成了这个3D资产?学习生成3D模型的来源归属

Sihan Ma, Siyuan Liang, Dacheng Tao

机构 * College of Computing & Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出了一种方法,用于确定给定3D资产是由哪种生成模型创建的,通过构建首个被动来源归属基准,发现生成3D模型留下稳定的指纹特征,从而建立了可信的3D内容来源的新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17826 2026-05-19 cs.CV cs.AI 62%

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

CounterCount: 一种用于视觉语言模型计数偏差诊断的框架

Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

机构 * KAUST(卡尔斯鲁德大学) University of Edinburgh(爱丁堡大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CounterCount框架,通过对比事实性与反事实性图像来诊断视觉语言模型在计数任务中的偏差问题,揭示模型对物体级先验知识的依赖,并提出统一的注意力调节策略提升反事实计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17187 2026-05-19 cs.CL cs.AI cs.CY 62%

PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media

PluRule:一种用于社交媒体上多元社区调节的基准测试

Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer

机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16373 2026-05-19 cs.CV cs.AI cs.LG 62%

Cross-Source Supervision for Bone Infection Segmentation in Dual-Modality PET-CT

跨源监督在双模态PET-CT骨感染分割中的应用

Zonglin Yang, Xiaolei Diao, Jishizhan Chen, Xiaozhuang Man, Wei Kong, Gen Wen, Pengfei Cheng, Daqian Shi

机构 * Shanghai Maritime University(上海海洋大学) University College London(伦敦大学学院) Shanghai Sixth People’s Hospital(上海第六人民医院) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) Queen Mary University of London(伦敦女王玛丽大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种双模态端到端分割框架,通过早融合多模态表示整合PET代谢信号和CT骨窗解剖信息,解决标注不一致下的骨感染分割问题,采用患者级3D体积评估和交叉验证提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16357 2026-05-19 eess.SP cs.AI cs.CV 62%

Learning Displacement-Aware WiFi Representations for Weakly Supervised Relative Localization

学习位移感知的Wi-Fi表示以实现弱监督的相对定位

Tzu-Ti Wei, Po-Cheng Chen, Yu-Chee Tseng, Jen-Jee Chen

机构 * College of AI, National Yang Ming Chiao Tung University(人工智能学院,National Yang Ming Chiao Tung大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IP框架,通过交叉模态学习对齐指纹轨迹与位移轨迹,学习位移感知的Wi-Fi表示,实现准确的相对定位,并扩展至少样本绝对定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15764 2026-05-18 cs.CV cs.AI 62%

GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions

GRASP:学习多个人非语言互动中的社会推理

Junho Kim, Xu Cao, Houze Yang, Bikram Boote, Ana Jojic, Fiona Ryan, Bolin Lai, Sangmin Lee, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) Amazon AGI Korea University(亚马逊AGI韩国大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。

Comments Project page: https://social-reaoning.github.io/grasp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15016 2026-05-15 cs.CL cs.AI 62%

COTCAgent: Preventive Consultation via Probabilistic Chain-of-Thought Completion

COTCAgent:通过概率性思维链完成实现预防性咨询

Zihan Deng, Xiaozhen Zhong, Chuanzhi Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(中国电子科学与技术大学深圳高级研究所) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COTCAgent框架,通过概率性思维链完成实现纵向电子健康记录的预防性咨询,解决了现有大语言模型在纵向EHR推理中的统计学推理不足和时间序列依赖性捕捉困难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25855 2026-05-15 cs.CV cs.AI 62%

SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

SIEVES:通过视觉证据评分实现选择性预测

Hector G. Rodriguez, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 62%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23018 2026-05-14 cs.CV cs.AI cs.LG 62%

AmaraSpatial-10K: A Spatially and Semantically Aligned 3D Dataset for Spatial Computing and Embodied AI

AmaraSpatial-10K:一个空间和语义对齐的3D数据集用于空间计算和具身AI

Mohammad Sadegh Salehi, Alex Perkins, Igor Maurell, Ashkan Dabbagh, Raymond Wong

机构 * Zero One Creative(Zero One创意)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AmaraSpatial-10K数据集,包含10000多个合成3D资产,优化零样本部署,通过精确锚点、PBR贴图和文本元数据提升CLIP召回率和物理稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12845 2026-05-14 cs.CV cs.AI 62%

AssemblyBench: Physics-Aware Assembly of Complex Industrial Objects

AssemblyBench: 复杂工业物体的物理感知装配

Danrui Li, Jiahao Zhang, Bernhard Egger, Moitreya Chatterjee, Suhas Lohit, Tim K. Marks, Anoop Cherian

机构 * Rutgers, The State University of New Jersey(新泽西罗格斯大学) The Australian National University(澳大利亚国立大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AssemblyBench数据集和AssemblyDyno模型,通过多模态指令和3D部件模型预测装配顺序和轨迹,优于现有方法的装配姿态估计和轨迹可行性评估。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12684 2026-05-14 cs.CV cs.AI cs.HC 62%

Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty?

视觉审美基准:前沿模型能评判美吗?

Yichen Feng, Yuetai Li, Chunjiang Liu, Yuanyuan Chen, Fengqing Jiang, Yue Huang, Hang Hua, Zhengqing Yuan, Kaiyuan Zheng, Luyao Niu, Bhaskar Ramasubramanian, Basel Alomair, Xiangliang Zhang, Misha Sra, Zichen Chen, Radha Poovendran, Zhangchen Xu

机构 * Bake AI University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Stanford University(斯坦福大学) University of Notre Dame(诺丁汉大学) Carnegie Mellon University(卡内基梅隆大学) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Western Washington University(西雅图华盛顿大学) King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉审美基准(VAB),通过比较选择评估审美,发现前沿模型在判断最佳和最差图像时表现逊于人类专家,表明需进一步改进。

Comments Project page: https://vab.bakelab.ai. Code: https://github.com/BakeLab/Visual-Aesthetic-Benchmark. Dataset: https://huggingface.co/datasets/BakeLab/Visual-Aesthetic-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10865 2026-05-13 cs.AI cs.CV cs.SE 62%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10845 2026-05-12 cs.CV cs.CL 62%

BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation

BabelDOC: 通过中间表示实现更好的布局保持PDF翻译

Qi Yang, Xiangyao Ma, Xiao Wang, Hao Wang, Rui Wang

机构 * School of Computer Engineering and Science, Shanghai University, Shanghai, China(1 上海大学计算机工程与科学学院,上海,中国) Funstory.ai Limited, Hong Kong SAR, China(2 Funstory.ai有限公司,香港特别行政区,中国) Department of Computer Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(3 上海交通大学计算机科学与工程系,上海,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 BabelDOC通过中间表示框架实现布局保持的PDF翻译,解决语言处理与布局保持的矛盾,提升翻译精度和文档一致性。

Comments ACL 2026 System Demonstration paper. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09422 2026-05-12 cs.CL cs.CV 62%

Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

无参与的感知:LMMs中因果发现缺陷的剖析

Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了大型多模态模型在因果发现中的缺陷,提出ProCauEval评估协议和ADPO框架,通过扰动分析揭示模型在视觉和文本模态间的依赖关系,提升视觉推理能力。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 62%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 62%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08222 2026-05-12 cs.CV cs.AI cs.IR 62%

From Historical Tabular Image to Knowledge Graphs: A Provenance-Aware Modular Pipeline

从历史表格图像到知识图谱:一个具有溯源意识的模块化流水线

Sarah Binta Alam Shoilee, Victor de Boer, Jacco van Ossenbruggen, Susan Legêne

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个模块化、具有溯源意识的流水线,将手写表格图像转换为知识图谱,支持人机协作。通过分解为表格重建、信息提取和知识图谱构建三个阶段,确保提取实体和文字可追溯至其视觉和文本来源。

Comments Shorter version of this paper has been accepted in the 5th International Conference on Hybrid Human-Artificial Intelligence (HHAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 62%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 62%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12539 2026-05-05 cs.AI cs.CL 62%

MemeLens: Multilingual Multitask VLMs for Memes

MemeLens:多语言多任务VLMs用于表情包

Ali Ezzat Shahroor, Mohamed Bayan Kmainasi, Abul Hasnat, Dimitar Dimitrov, Giovanni Da San Martino, Preslav Nakov, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Sofia University "St. Kliment Ohridski"(索菲亚大学"圣克莱孟·奥赫里迪斯") University of Padova(帕多瓦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MemeLens,一种统一的多语言多任务解释增强视觉语言模型,用于表情包理解。通过整合38个公开数据集,建立20个任务的共享分类体系,并分析不同模型范式和数据集的表现,发现多模态训练和统一训练对表情包理解至关重要。

Comments disinformation, misinformation, factuality, harmfulness, fake news, propaganda, hateful meme, multimodality, text, images

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00070 2026-05-04 eess.IV cs.AI cs.CV 62%

Brain MR Image Synthesis with 3D Multi-Contrast Self-Attention GAN

利用3D多对比自注意GAN进行脑部MRI图像合成

Zaid A. Abod, Furqan Aziz

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-MC-SAGAN框架,通过单张T2w图像生成高保真多对比MRI图像,保留肿瘤特征,结合多种损失函数提升全局真实感和肿瘤结构保真度。

Comments Note: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV 62%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17056 2026-05-01 cs.CL cs.AI 62%

From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests

从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试

Luoxi Tang, Tharunya Sundar, Yuqiao Meng, Shuai Yang, Ankita Patra, Lakshmi Manohar Chippada, Jiqian Zhao, Yi Li, Weicheng Ma, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) BlossomsAI(BlossomsAI公司) Dartmouth College(达特茅斯学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 62%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 62%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 62%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI 62%

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏