arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2503.02379 2026-05-08 cs.LG cs.CV 57%

Teaching Metric Distance to Discrete Autoregressive Language Models

向离散自回归语言模型传授度量距离

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DIST2Loss,通过奖励加权分布替代one-hot目标,提升离散自回归模型的数据效率和跨领域表现,应用于视觉 grounding、机器人操控、奖励建模和向量量化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05807 2026-05-08 cs.CR cs.AI 57%

LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution

LCC-LLM:利用代码导向的大语言模型进行恶意软件归因

Christopher G. Pedraza Pohlenz, Hassan Jalil Hadi, Ali Hassan, Ali Shoker

机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05546 2026-05-08 cs.AI 57%

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

SPARK:基于知识图谱的异步奖励自我对抗学习

Hyobin Park, Taeseop Kim, Dong-Geol Choi

机构 * Hanbat National University, South Korea(韩国翰bac国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SPARK通过构建统一知识图谱实现多文档科学文献的自我对抗学习,利用图路径生成关系推理问题并基于结构化事实计算奖励,优于传统自对抗基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05459 2026-05-08 cs.CR cs.LG 57%

Privacy Without Losing Place: A Paradigm for Private Retrieval in Spatial RAGs

隐私不丧失位置:空间RAGs中隐私检索的范式

Kennedy Edemacu, Mohammad Mahdi Shokri, Vinay M. Shashidhar, Jong Wook Kim

机构 * The City University of New York(纽约城市大学) Northern Michigan University(北密歇根大学) Sangmyung University(商硕大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出PAS机制,通过相对锚编码实现用户位置隐私保护,在保持检索性能的同时提供粗粒隐私保障,且大语言模型能补偿空间检索的不完美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05403 2026-05-08 cs.AI 57%

When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models

当有益变成谄媚:谄媚是大型语言模型中社会契合与认知完整性之间的边界失败

Jiechen Li, Catherine A. Barry, Rishika Randev, Janet Chen, Ella Jorgensen, Brinnae Bent

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大型语言模型中谄媚现象作为社会契合与认知完整性之间边界失败的问题,提出三条件框架以界定谄媚,并讨论其分类、评估及缓解策略。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05280 2026-05-08 cs.LG 57%

Forecasting Green Skill Demand in the Automotive Industry: Evidence from Online Job Postings

预测汽车行业的绿色技能需求:来自在线招聘信息的证据

Sabur Butt, Joshua N. Arrazola E., Hector G. Ceballos, Patricia Caratozzolo

机构 * Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,蒙特雷理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文通过分析墨西哥汽车行业的在线招聘信息,构建计算框架预测绿色技能需求,识别出274种绿色技能,并利用时间序列模型预测未来趋势,发现可再生能源、回收和氢能技术需求增长最快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20658 2026-05-08 cs.CL cs.CY cs.MA 57%

Cooperative Profiles Predict Multi-Agent LLM Team Performance in AI for Science Workflows

协同特征预测多智能体LLM团队在AI for Science工作流中的性能

Shivani Kumar, Adarsh Bharathwaj, David Jurgens

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过六种行为经济学游戏评估35个LLM的协同特征,发现其能有效预测AI for Science任务中的团队表现,特别是在数据处理、建模和报告生成中,协同策略优于贪心策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-05-08 cs.HC cs.AI 57%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01546 2026-05-05 cs.NI cs.AI 57%

6G Needs Agents: Toward Agentic AI-Native Networks for Autonomous Intelligence

6G需要智能体:迈向面向自主智能的智能体AI原生网络

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(数字未来研究院,哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的智能体架构,用于构建AI原生6G网络,通过分层推理和分布式多智能体系统平衡性能与效率,揭示了模型异构部署和量化影响的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01484 2026-05-05 cs.LG stat.ML 57%

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

通过随机游走评估大图属性估计中的LLM

Sunil Kumar Maurya, Xin Liu

机构 * University of Tokyo(东京大学) AIST(日本产业技术综合研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出EstGraph基准数据集,设计四类任务估计大图属性,通过随机游走采样生成提示,评估LLM在大图场景下的推理能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 57%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI 57%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00800 2026-05-04 cs.LG 57%

Generating Statistical Charts with Validation-Driven LLM Workflows

通过验证驱动的LLM工作流生成统计图表

Pavlin G. Poličar, Andraž Pevcin, Blaž Zupan

机构 * University of Ljubljana Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种结构化的LLM工作流,通过验证输出来生成多样且易读的统计图表,解决可视化特有的失败模式,如可读性和语义不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 57%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15949 2026-05-04 cs.CL 57%

BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interaction

BanglaSocialBench: 一个评估大语言模型在孟加拉社会互动中社会语用和文化对齐的基准

Tanvir Ahmed Sijan, S. M Golam Rifat, Pankaj Chowdhury Partha, Md. Tanjeed Islam, Md. Musfique Anwar

机构 * Jahangirnagar University(贾亨吉尔纳加尔大学) Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出BanglaSocialBench,通过情境依赖的语言使用评估孟加拉语的社会语用能力,发现当前LLM在文化对齐上存在系统性偏差。

Comments Accepted at ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28178 2026-05-01 cs.AI 57%

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

基于LLM的临床图结构细化:增强EEG癫痫诊断中的表示学习

Lincan Li, Zheng Chen, Yushun Dong

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系) SANKEN, The University of Osaka(大阪大学SANKEN)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型对图结构进行细化,以提升EEG信号在癫痫诊断中的表示学习效果,通过两阶段框架去除冗余边,提高诊断准确率和图结构意义。

Comments This paper is accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28039 2026-05-01 cs.AI 57%

SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images

SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试

Jialu Shen, Han Lyu, Suyang Zhong, Hanzheng Li, Haoyi Tao, Nan Wang, Changhong Chen, Xi Fang

机构 * DP Technology(DP技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19630 2026-05-01 cs.CL 57%

Real-World Doctor Agent with Proactive Consultation through Multi-Agent Reinforcement Learning

现实世界中的医生代理通过多智能体强化学习实现主动咨询

Yichun Feng, Jiawei Wang, Lu Zhou, Yikai Zheng, Zhen Lei, Yixue Li

机构 * Guangzhou National Laboratory(广州国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DoctorAgent-RL框架,通过多智能体强化学习提升医疗咨询的动态决策能力,实现70%的准确诊断匹配率,验证了其在现实中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27151 2026-05-01 cs.AI 57%

Step-level Optimization for Efficient Computer-use Agents

面向高效计算机使用代理的步骤级优化

Jinbiao Wei, Kangqi Ni, Yilun Zhao, Guo Gan, Arman Cohan

机构 * Yale NLP Lab(耶鲁大学自然语言处理实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种事件驱动的步骤级级联框架,通过动态分配计算资源提升计算机使用代理的效率,减少冗余计算并增强任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26986 2026-05-01 cs.CL 57%

BatteryPass-12K: The First Dataset for the Novel Digital Battery Passport Conformance Task

BatteryPass-12K:首个数字电池护照符合性任务数据集

Tosin Adewumi, Martin Karlsson, Lama Alkhaled, Marcus Liwicki

机构 * Machine Learning Group, EISLAB(机器学习组,EISLAB) Research Center for Advanced Battery Technology(先进电池技术研究中心) Luleå University of Technology(吕勒奥理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文介绍了首个数字电池护照符合性任务数据集BatteryPass-12K,评估了22种语言模型在零样本推理中的表现,发现思考模型性能最佳,少样本示例显著提升性能,且参数规模扩大并不必然提升性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20577 2026-05-01 cs.SE cs.LG 57%

Evaluating Assurance Cases as Text-Attributed Graphs for Structure and Provenance Analysis

评估作为文本属性图的保证案例用于结构和来源分析

Fariz Ikhwantri, Dusica Marijan

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于图诊断框架分析保证案例的结构和来源,通过链接预测和图分类检测偏见,实验表明GNN在链接预测和来源检测中表现优异。

Comments 10 pages, 4 figures, 8 tables. Accepted to EASE 2026 AI Models / Data track, Glasgow, United Kingdom Fix the captions of tables 7 and 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09408 2026-05-01 cs.AI 57%

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

HiL-Bench (Human-in-Loop Benchmark): 代理何时该请求帮助?

Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto Montoya, Nandan Marwaha, Yannis He, Charles Wang, Fernando Crabedo, Alessa Castilo, Bing Liu

专题命中 推理评测 :self-correction(abstract);分类 cs.AI

AI总结 HiL-Bench通过评估代理在任务中何时请求帮助的能力,揭示了当前基准测试的不足。核心指标Ask-F1衡量代理在请求与猜测之间的平衡,证明判断力可通过强化学习提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00095 2026-05-01 cs.CV cs.AI cs.CY 57%

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26334 2026-04-30 cs.DC cs.AR cs.LG 57%

Efficient, VRAM-Constrained xLM Inference on Clients

高效、受限于VRAM的xLM客户端推断

Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

机构 * Microsoft Corporation(微软公司) NVIDIA Corporation(英伟达公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。

Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23758 2026-04-30 cs.LG cond-mat.mtrl-sci 57%

Agentic Fusion of Large Atomic and Language Models to Accelerate Superconductors Discovery

代理融合大规模原子和语言模型以加速超导体发现

Mingze Li, Yu Rong, Songyou Li, Lihong Wang, Jiacheng Cen, Liming Wu, Anyi Li, Zongzhao Li, Qiuliang Liu, Rui Jiao, Tian Bian, Pengju Wang, Hao Sun, Jianfeng Zhang, Ji-Rong Wen, Deli Zhao, Shifeng Jin, Tingyang Xu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团达摩院,杭州,中国) Hupan Lab, Hangzhou, China(虎扑实验室,杭州,中国) Institution of Physics, University of the Chinese Academy of Sciences, Beijing, China(中国科学院物理研究所,北京,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ElementsClaw框架,结合大规模原子模型与语言模型,通过自主协作加速超导体发现,筛选240万晶体识别6.8万高置信度候选,发现四个新实验验证超导体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03992 2026-04-30 cs.CV cs.AI 57%

Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness

基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法

Hanwen Wan, Zexin Lin, Yixuan Deng, Xiaoqiang Ji

机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26561 2026-04-30 cs.MA cs.AI 57%

Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation

保持分歧:多智能体政策模拟中的架构异质性与一致性验证

Ariel Sela

机构 * Ariel Sela

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI委员会框架,通过120次模拟测试两种干预措施,发现架构异质性可减少一致性,但一致性验证在不同场景下产生分歧-多样性权衡。

Comments 14 pages, 7 tables, 120 deliberations across 2 policy scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25923 2026-04-30 cs.CL 57%

Evaluation Revisited: A Taxonomy of Evaluation Concerns in Natural Language Processing

重新评估:自然语言处理中评估关注点的分类

Ruchira Dhar, Anders Søgaard

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文重新审视自然语言处理中的评估方法,通过梳理现有研究,建立评估关注点的分类体系,并提出结构化检查表以指导更严谨的评估设计与解读。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06198 2026-04-30 cs.CL 57%

LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation

LIT-RAGBench:大型语言模型检索增强生成能力的基准测试

Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

机构 * neoAI Inc.(neoAI公司) Tokyo Metropolitan University(东京 Metropolitan 大学) The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LIT-RAGBench通过五个类别评估生成器的整合、推理、逻辑、表格和回避能力,提供统一的基准测试框架,用于评估多方面能力并指导模型选择与改进。

Comments Published as a conference paper at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24867 2026-04-30 cs.CV cs.AI 57%

Time Blindness: Why Video-Language Models Can't See What Humans Can?

时间盲:为什么视频语言模型无法看到人类能看见的东西?

Ujjwal Upadhyay, Mukul Ranjan, Zhiqiang Shen, Mohamed Elhoseiny

机构 * KAUST(卡士大学) VILA Lab, MBZUAI(VILA实验室,MBZUAI)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示视频语言模型在处理纯时间序列信息时的局限性,提出SpookyBench基准测试,显示人类在识别时间序列中的形状、文本和模式上准确率高达98%,而最先进的VLMs却无法做到,指出模型过度依赖空间特征而非时间线索。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 Project page at https://timeblindness.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏