arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2603.09909 2026-03-20 cs.AI 57%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17822 2026-03-19 eess.AS cs.CL 57%

Multi-Source Evidence Fusion for Audio Question Answering

多源证据融合用于音频问答

Aivo Olev, Tanel Alumäe

机构 * Tallinn University of Technology, Estonia(塔林技术大学,爱沙尼亚)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多源融合框架,利用两个大音频语言模型与25种可靠性分层的声学工具,生成可验证的推理链,提升音频问答的逻辑性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17781 2026-03-19 cs.AI 57%

Facts as First Class Objects: Knowledge Objects for Persistent LLM Memory

事实作为一等对象:用于持久LLM记忆的知识对象

Oliver Zahn, Simran Chana

机构 * Independent Researcher(独立研究者) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出知识对象(KOs)作为持久LLM记忆的解决方案,通过对比上下文记忆和KOs,在多跳推理中KOs表现更优,且能有效应对容量限制、压缩损失和目标漂移等挑战。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13538 2026-03-19 cs.IR cs.AI 57%

RAGXplain: From Explainable Evaluation to Actionable Guidance of RAG Pipelines

RAGXplain: 从可解释评估到RAG流水线的可操作指导

Dvir Cohen, Tamir Houri, Lin Burg, Gilad Barkan

机构 * Wix.com AI Research(Wix.com人工智能研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RAGXplain通过'指标钻石'框架将性能指标转化为可操作指导,利用LLM生成自然语言失败模式解释,提升RAG流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17540 2026-03-19 cs.IR cs.LG 57%

Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify

在Spotify上部署基于语义ID的生成检索用于大规模播客发现

Edoardo D'Amico, Marco De Nadai, Praveen Chandar, Divita Vohra, Shawn Lin, Max Lefarov, Paul Gigioli, Gustavo Penha, Ilya Kopysitsky, Ivo Joel Senese, Darren Mei, Francesco Fabbri, Oguz Semerci, Yu Zhao, Vincent Tang, Brian St. Thomas, Alexandra Ranieri, Matthew N. K. Smith, Aaron Bernkopf, Bryan Leung, Ghazal Fazelnia, Mark VanMiddlesworth, Timothy Christopher Heath, Petter Pehrson Skiden, Alice Y. Wang, Doug J. Cole, Andreas Damianou, Maya Hristakeva, Reid Wilbur, Tarun Chillara, Vladan Radosavljevic, Pooja Chitkara, Sainath Adapa, Juan Elenter, Bernd Huber, Jacqueline Wood, Saaketh Vedantam, Jan Stypka, Sandeep Ghael, Martin D. Gould, David Murgatroyd, Yves Raimond, Mounia Lalmas, Paul N. Bennett

机构 * Spotify

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出GLIDE模型,通过语义ID实现播客推荐,结合语义、上下文和用户状态,提升用户发现新播客和非习惯性流媒体体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17265 2026-03-19 cs.CV cs.CL 57%

LED: A Benchmark for Evaluating Layout Error Detection in Document Analysis

LED:用于评估文档分析中布局错误检测的基准

Inbum Heo, Taewook Hwang, Jeesu Jung, Sangkeun Jung

机构 * Department of Computer Engineering Chungnam National Univ.(计算机工程系, 首尔国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LED基准,用于评估文档分析中结构推理能力,定义八种标准错误类型并构建数据集,通过三种任务揭示模型在多模态和架构上的弱点。

Comments 8pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17204 2026-03-19 cs.CL cs.AR cs.PL 57%

CODMAS: A Dialectic Multi-Agent Collaborative Framework for Structured RTL Optimization

CODMAS:一种基于辩证多智能体协作的结构化RTL优化框架

Che-Ming Chang, Prashanth Vijayaraghavan, Ashutosh Jadhav, Charles Mackin, Vandana Mukherjee, Hsinyu Tsai, Ehsan Degan

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CODMAS通过结合结构化辩证推理与领域感知代码生成和确定性评估,实现RTL优化自动化,显著提升了时钟门控的功耗降低和流水线的延迟减少效果。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 57%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21679 2026-03-19 cs.CL 57%

ReviewScore: Misinformed Peer Review Detection with Large Language Models

ReviewScore:利用大语言模型进行误信同行评审检测

Hyun Ryu, Doohyuk Jang, Hyemin S. Lee, Joonhyun Jeong, Gyeongman Kim, Donghyeon Cho, Gyouk Chu, Minyeong Hwang, Hyeongwon Jang, Changhun Kim, Haechan Kim, Jina Kim, Joowon Kim, Yoonjeon Kim, Kwanhyung Lee, Chanjae Park, Heecheol Yun, Gregor Betz, Eunho Yang

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) KRAFTON(KRAFTON公司) AITRICS(AITRICS研究院) KIT(卡尔斯鲁厄理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ReviewScore方法,通过检测同行评审中的错误前提和可回答问题来识别低质量评审。利用大语言模型评估评审点的误信程度,实验显示模型在评估一致性上表现中等,但仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16862 2026-03-18 cs.CL 57%

Chronos: Temporal-Aware Conversational Agents with Structured Event Retrieval for Long-Term Memory

Chronos:具有结构化事件检索的时序感知对话代理以实现长期记忆

Sahil Sen, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

机构 * Commercial Technology and Innovation Office(商业技术与创新办公室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Chronos通过结构化事件日历和对话日历实现时序感知,有效处理长期对话记忆中的时间敏感查询,提升多跳推理能力,在LongMemEvalS基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15643 2026-03-18 cs.AI 57%

GSI Agent: Domain Knowledge Enhancement for Large Language Models in Green Stormwater Infrastructure

GSI代理:面向绿色雨水基础设施的大语言模型领域知识增强

Shaohuang Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GSI代理,通过监督微调、检索增强生成和代理推理流程,提升大语言模型在绿色雨水基础设施任务中的领域知识能力,实验表明其在领域任务中的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16544 2026-03-18 cs.CL 57%

How often do Answers Change? Estimating Recency Requirements in Question Answering

答案多久会变化?在问答中估计时效性需求

Bhawna Piryani, Zehra Mert, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) MEF University(MEF大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RecencyQA数据集,通过人类评估和实证分析,展示非平稳问题对LLM的挑战随更新频率增加而加剧,为时间推理提供细粒度基准和时效感知问答系统基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16107 2026-03-18 cs.SE cs.AI 57%

RepoReviewer: A Local-First Multi-Agent Architecture for Repository-Level Code Review

RepoReviewer: 一种面向仓库级别的多智能体架构

Peng Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RepoReviewer通过分解仓库获取、上下文合成、文件分析等步骤,提供一种实用的仓库级自动化审查架构,强调系统设计与可重用的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 57%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15121 2026-03-17 cs.LG stat.ML 57%

Establishing Construct Validity in LLM Capability Benchmarks Requires Nomological Networks

在LLM能力基准中建立构念效度需要规范网络

Timo Freiesleben

机构 * Munich Center for Mathematical Philosophy(慕尼黑数学哲学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文探讨了通过规范网络框架建立LLM能力基准的效度问题,指出该框架比因果和推断框架更适合当前研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14911 2026-03-17 cs.CR cs.CL 57%

Fine-tuning RoBERTa for CVE-to-CWE Classification: A 125M Parameter Model Competitive with LLMs

基于RoBERTa的CVE到CWE分类微调:一个125M参数模型与LLMs竞争

Nikita Mosievskiy

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个125M参数的RoBERTa基分类器,通过AI优化的CWE标签构建大规模训练数据集,在27780个样本上达到87.4%的Top-1准确率和60.7%的Macro F1,优于TF-IDF基线。

Comments 9 pages, 2 figures, 6 tables. Dataset: https://huggingface.co/datasets/xamxte/cve-to-cwe Model: https://huggingface.co/xamxte/cwe-classifier-roberta-base

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 57%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02046 2026-03-17 cs.CV cs.AI 57%

Agentic Retoucher for Text-To-Image Generation

面向文本到图像生成的代理修复器

Shaocheng Shen, Jianfeng Liang, Chunlei Cai, Cong Geng, Huiyu Duan, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Agentic Retoucher框架,通过感知-推理-行动循环改进文本到图像生成的质量,引入GenBlemish-27K数据集进行评估,提升图像真实感与局部修正可靠性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01716 2026-03-17 cs.DB cs.LG 57%

SemBench: A Benchmark for Semantic Query Processing Engines

SemBench:语义查询处理引擎的基准测试

Jiale Lao, Andreas Zimmerer, Olga Ovcharenko, Tianji Cong, Matthew Russo, Gerardo Vitagliano, Michael Cochez, Fatma Özcan, Gautam Gupta, Thibaud Hottelier, H. V. Jagadish, Kris Kissel, Sebastian Schelter, Andreas Kipf, Immanuel Trummer

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SemBench是一个针对语义查询处理引擎的基准测试,涵盖多场景、多模态和多操作符,评估不同系统在处理多模态数据时的性能。

Comments Accepted to VLDB 2026; Revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12720 2026-03-17 cs.CL cs.CV cs.MM cs.SD 57%

Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception

Omni-Captioner:多模态信息细粒度感知的数据管道、模型与基准

Ziyang Ma, Ruiyang Xu, Zhenghao Xing, Yunfei Chu, Yuxuan Wang, Jinzheng He, Jin Xu, Pheng-Ann Heng, Kai Yu, Junyang Lin, Eng Siong Chng, Xie Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Omni-Captioner,通过数据管道、模型和基准系统,系统研究多模态细粒度感知,提出Omni-Detective生成高质量数据,实现音频和视频细粒度描述的最优性能。

Comments Accepted by ICLR2026. Open Source at https://github.com/ddlBoJack/Omni-Captioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 57%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 57%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14646 2026-03-17 cs.AI 57%

Dynamic Theory of Mind as a Temporal Memory Problem: Evidence from Large Language Models

动态心智理论作为时间记忆问题:来自大语言模型的证据

Thuy Ngoc Nguyen, Duy Nhat Phan, Cleotilde Gonzalez

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了动态心智理论作为时间延伸表征记忆问题,发现大语言模型在跟踪信念轨迹方面存在挑战,揭示了记忆与干扰机制在社会推理中的影响。

Comments 8 pages, 4 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14597 2026-03-17 q-bio.NC cs.AI 57%

D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing

D-MEM:通过奖励预测误差路由的多巴胺门控代理记忆

Yuru Song, Qi Xin

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 D-MEM通过奖励预测误差路由实现多巴胺门控代理记忆,减少token消耗并提升多跳推理和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14593 2026-03-17 cs.CL 57%

Parameter-Efficient Quality Estimation via Frozen Recursive Models

通过冻结递归模型实现参数高效质量估计

Umar Abubacar, Roman Bauer, Diptesh Kanojia

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了递归机制在低资源语言质量估计中的有效性,发现冻结预训练嵌入能显著提升性能,减少训练参数37倍。

Comments Accepted to LowResLM Workshop @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14456 2026-03-17 cs.CL cs.SD 57%

PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

PARSA-Bench:一个全面的波斯语音-语言模型基准

Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan, Heshaam Faili, Azadeh Shakery

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PARSA-Bench是首个针对波斯语言和文化评估大音频-语言模型的基准,包含16个任务和8000多个样本,涵盖语音理解、语篇分析和文化语音理解,揭示模型在文化相关任务中的局限性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14257 2026-03-17 cs.CL 57%

Automatic Inter-document Multi-hop Scientific QA Generation

自动跨文档多跳科学问答生成

Seungmin Lee, Dongha Kim, Yuni Jeon, Junyoung Koh, Min Song

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AIM-SciQA框架,通过大语言模型生成多文档多跳科学问答数据集,结合语义对齐和引用信息提升事实一致性,构建IM-SciQA数据集并验证其在检索增强推理中的有效性。

Comments 14 pages, 5 figures, 8 tables. Accepted to the 2026 International Conference on Language Resources and Evaluation (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14171 2026-03-17 cs.LG 57%

TACTIC for Navigating the Unknown: Tabular Anomaly deteCTion via In-Context inference

TACTIC用于未知领域的导航:通过上下文推理进行表格异常检测

Patryk Marszałek, Tomasz Kuśmierczyk, Marek Śmieja

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出TACTIC,一种基于上下文推理的表格异常检测方法,通过预训练异常中心合成先验,实现快速且数据依赖的异常判断,优于传统得分方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13884 2026-03-17 cs.CL 57%

Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation

观点过于开放?在大型语言模型中拥抱开放性以进行社会模拟

Bolei Ma, Yong Cao, Indira Sen, Anna-Carolina Haensch, Frauke Kreuter, Barbara Plank, Daniel Hershcovich

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在大型语言模型中采用开放性文本进行社会模拟的重要性,强调其在提升测量、探索意外观点和减少偏差方面的价值。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏