arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2607.13569 2026-07-21 cs.CV cs.AI 版本更新 79%

GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning

GHR-VLM:通过基于视觉基础的混合推理实现零样本公交视频分析

Kaicong Huang, Weiheng Oh, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究旨在实现零样本公交视频分析,提出GHR-VLM框架,利用边缘-云设计,通过轻量级边缘监视器跟踪门状态、分割乘客片段,后端VLM经两阶段细化识别乘客与支付行为,减少云推理,评估显示其在公交支付分析中有潜力且面临视频条件挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10922 2026-07-21 cs.AI 版本更新 79%

Data-Efficient Curation for Multimodal Reasoning under Fixed Training Protocols

固定训练协议下多模态推理的数据高效整理

Yosub Shin, Michael Buriek, Boris Sobolev, Pavel Bushuyeu, Vikas Kumar, Haoyang Xu, Samuel Watson, Igor Molybog

机构 * University of Hawai'i at M\=anoa, Honolulu, HI, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究固定协议微调下多模态推理的数据整理,以NeurIPS 2025 DCVLR挑战为测试平台,分析多种因素对推理准确性的影响,发现对齐源语料库的难度过滤增益最强,为数据受限的多模态推理微调提供经验方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 79%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08423 2026-07-20 cs.AI 版本更新 79%

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05000 2026-07-17 cs.CR cs.LG 版本更新 79%

Agentic Vulnerability Reasoning on COTS Binaries

基于商用现货二进制文件的智能体漏洞推理

Hwiwon Lee, Jongseong Kim, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14333 2026-07-17 cs.CV cs.CL 新提交 79%

SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning

SD-MAR:通过合成数据和强化学习进行多图像分析推理

Shiyu Yuan, Sourav Sanjukta Bhabesh, Zhe Wang, Dmitriy Bespalov, Wesley Rose, Huzefa Rangwala

机构 * Stevens Institute of Technology(史蒂文斯理工学院) AGI Foundations for AWS(AWS的通用人工智能基金会) Amazon Web Services (AWS)(亚马逊网络服务公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对视觉语言模型在多图像分析推理任务中的局限,提出SD-MAR框架,通过合成数据和强化学习训练评估模型。该框架构建场景生成任务,采用GRPO-lite与BDA训练。实验表明能提升域内准确率,保持或提高域外泛化能力,还改进了模型逻辑连贯性和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27636 2026-07-17 cs.CL 79%

Simorgh at SemEval-2026 task 7: Region-Aware Hybrid Retrieval for Low-Resource Cultural Reasoning in Multilingual Question Answering

Simorgh at SemEval-2026 task 7: 面向低资源文化推理的多语言问答中的区域感知混合检索

Hadi Bayrami Asl Tekanlou, Mahdi Bakhtiyarzadeh, Jafar Razmara

机构 * University of Tabriz(塔布里兹大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出区域感知混合检索方法,结合BM25和稠密语义相似度与区域加权启发式,以提升多语言文化问答的跨语言稳定性。

Comments 6 pages, 3 figures, accepted to the Everyday Knowledge Across Diverse Languages and Cultures shared task at SemEval2026

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (SemEval-2026), Association for Computational Linguistics, 2026, pp. 624-629

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交 79%

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11736 2026-07-14 cs.CL 新提交 79%

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning

MET:基于理论和文化感知的多语言道德推理

Ayoung Lee, Ryan Kwon, Yunxiang Zhang, Yuxuan Liu, Peter Railton, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对语言模型用于跨语言文化道德决策时存在的多语言性忽视问题,提出MET两步提示法及MET-D自我蒸馏训练,引入MCLASH基准,实验表明MET-D提升模型性能,揭示不同文化有益依据差异,为多语言道德推理开辟道路。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11357 2026-07-14 cs.AI cs.SE 新提交 79%

OpsMem: Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis

OpsMem:用于故障诊断的具有跨内存共振的双内存推理

Yongqian Sun, Rongchen Gao, Yu Luo, Wenwei Gu, Shenglin Zhang, Qingyi Guo, Qiuai Fu, Yaoliang Wu, Dan Pei

机构 * Huawei(华为)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现代软件系统故障诊断中缺乏协调诊断状态与操作经验机制的问题,提出双内存框架OpsMem,通过跨内存共振等进行多智能体诊断,实验表明其在华为微服务故障诊断数据集上优于基线,提升了匹配度和相关性。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10562 2026-07-14 cs.AI 新提交 79%

CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps

CRiT-QA:利用反事实链和干扰陷阱评估多跳推理

JungMin Yun, JuneHyoung Kwon, YoungBin Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) Graduate School of Advanced Imaging Sciences, Multimedia and Film, Chung-Ang University(Chung-Ang大学高级成像科学研究院,多媒体与电影)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大语言模型多跳推理能力评估难题,提出CRiT-QA数据集,通过反事实实体转换推理链、注入干扰链解决模型依赖知识和利用捷径问题,实验表明该数据集能暴露模型弱点,为评估多跳推理及开发可靠模型提供基础。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08233 2026-07-14 cs.LG 版本更新 79%

Enhancing Reasoning for Diffusion LLMs via Distribution Matching Policy Optimization

通过分布匹配策略优化增强扩散大语言模型的推理能力

Yuchen Zhu, Wei Guo, Jaemoo Choi, Petr Molodyk, Bo Yuan, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出DMPO方法,通过分布匹配优化提升扩散大语言模型的推理能力,实现显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09099 2026-07-13 cs.AI 新提交 79%

L-MAD: A Systematic Evaluation of Multi-Agent Debate Structures in Legal Reasoning

L-MAD:法律推理中多智能体辩论结构的系统评估

Tan-Minh Nguyen, Hoang-Trung Nguyen, Huu-Dong Nguyen, Dinh-Truong Do, Thi-Hai-Yen Vuong, Le-Minh Nguyen

机构 * Japan Advanced Institute of Science(日本先进科学研究院) VNU University of Engineering(越南工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究在法律领域探索多智能体辩论(MAD)框架有效性,引入L-MAD框架评估不同结构和方法,通过分配专家角色提升效果,分析辩论规模发现权衡,明确了在法律推理中部署协作多智能体系统的边界与安全边际。

Comments Outstanding paper in the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07761 2026-07-10 cs.AI 新提交 79%

Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning

对齐临床需求与人工智能能力:医学推理大语言模型综述

Qi Peng, Jiatong Li, Sirui Huang, Yiyang Jiang, Kaisong Gong, Ronger Ding, Shijie Ye, Changmeng Zheng, Yi Cai, Xiaobo Yang, Jin Huang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University(香港大学) South China University of Technology(华南理工大学) University of Toronto(多伦多大学) Peking Union Medical College Hospital(北京地坛医院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 综述医学大语言模型在医疗领域的进展,提出双视角方法,连接临床实践与计算方法,建立五级能力方案并关联推理模式与医学任务,引入基准数据集并报告模型结果,讨论进展与挑战及未来方向。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交 79%

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10956 2026-07-09 cs.CV cs.AI 版本更新 79%

A Study of Commonsense Reasoning over Visual Object Properties

关于视觉对象属性的常识推理研究

Abhishek Kolari, Mohammadhossein Khojasteh, Yifan Jiang, Floris den Hengst, Filip Ilievski

机构 * Department of Computer Science, Vrije Universiteit(自由大学计算机科学系) Information Sciences Institute, University of Southern California(南加州大学信息科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对视觉对象属性的常识推理,引入含特定图像类型、推理层次和属性维度的评估框架,在两个VQA基准中实验,发现现有VLM存在显著局限,虽新模型有进步但仍与人类有差距,还提供了相关数据和代码以助未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05029 2026-07-07 cs.CR cs.AI 新提交 79%

Your Agent's Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses

你的智能体记忆并非其自身所有:针对大语言模型智能体记忆的伪造推理攻击及防御

Neeraj Karamchandani, Piyush Nagasubramaniam, Sencun Zhu, Dinghao Wu

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体记忆伪造推理的攻击,提出FARMA攻击方法,通过规避语言伪造推理痕迹并强化,还引入SENTINEL防御管道,实验表明该防御能有效降低攻击成功率。

Comments Preprint. 10 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02983 2026-07-07 cs.AI 新提交 79%

Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models

基于强化学习的大语言模型证据寻求诊断推理

Shengyi Hua, Kangzhe Hu, Conghui He, Xiaofan Zhang, Shaoting Zhang

机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学清源研究院) Shanghai Innovation Institute(上海创新院) Shanghai AI Laboratoty(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 将医学诊断形式化为迭代证据寻求任务,利用带可验证奖励的强化学习,引入基于检索增强生成的检查模拟器,使大语言模型从被动响应转变为自主助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01145 2026-07-07 cs.AI 版本更新 79%

Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches

Reasoning4Sciences:将推理语言模型桥接到所有科学分支

Teddy Ferdinan, Bartłomiej Koptyra, Mikołaj Langner, Tomasz Adamczyk, Łukasz Radliński, Maciej Markiewicz, Aleksander Szczęsny, Stanisław Woźniak, Tymoteusz Romanowicz, Dzmitry Pihulski, Mateusz Zbrocki, Mateusz Śmigielski, Michał Rajkowski, Mateusz Biedka, Konrad Kiełczyński, Konrad Wojtasik, Jacek Duszenko, Jan Eliasz, Piotr Matys, Michał Bernacki-Janson, Maria Bellaniar Ismiati, Latius Hermawan, Wiktoria Mieleszczenko-Kowszewicz, Anna Kubicka-Sowińska, Grzegorz Chodak, Karol Postawa, Paweł Zyblewski, Tomasz Szandała, Łukasz Sterczewski, Adrian Chajec, Paweł Niewiadomski, Piotr Gruber, Marcin Wdowikowski, Sławomir Czarnecki, Bartłomiej Kryszak, Dominik Drabik, Tomasz Kajdanowicz, Kamil Mamak, Paweł Preś, Katarzyna Paczkowska, Joachim Sobczuk, Tomasz Zięba, Jan Kocoń, Maciej Piasecki, Przemysław Kazienko

机构 * Poznan University of Technology(波兹南理工大学) National Cheng Kung University(国立成功大学) Universitas Katolik Musi Charitas Palembang(Palembang 巴厘岛天主教大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文首次全面分析推理语言模型在28个科学学科中的采用情况,提出基于领域资源的成熟度评估框架,揭示学科间差距并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28160 2026-07-07 cs.AI 79%

Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning

按需查看:多模态推理中视觉证据获取的认知调度框架

Yang Zhang, Xiaoshuai Sun, Rui Zhao, Wujin Sun, Yidong Chen, Jiayi Ji, Qian Chen, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知实验室) Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(教育部高效计算实验室,厦门大学,361005,中国) Sino-Russian ResearchCenter for Digital Economy(中俄数字经济研究中心) Institute of Artificial Intelligence, Xiamen University, China(人工智能研究院,厦门大学,中国) School of Informatics, Xiamen University, China(信息学院,厦门大学,中国) School of Information Engineering, Xiamen Ocean Vocational College, Xiamen 361102, China(信息工程学院,厦门海洋职业技术学院,厦门361102,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CSMR框架,通过语言模型控制何时调用独立视觉感知模块获取任务相关视觉证据,在零样本设置下多个基准上优于基线方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02436 2026-07-03 cs.SE cs.AI 新提交 79%

Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study

推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究

Achint Mehta

机构 * TrendAI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。

Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19127 2026-07-03 cs.CL 版本更新 79%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 79%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 79%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11599 2026-07-01 cs.LG 版本更新 79%

Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol

面向LLM推理的定向测试:一种受审计约束的协议

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种受审计约束的协议,用于评估LLM推理能力,通过组件自适应提示采样与均匀采样对比,验证了在受控环境下研究定向提示变化的有效性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14200 2026-07-01 cs.LG 79%

TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning

TS-Haystack:一种用于长上下文时间序列推理的多任务检索基准

Nicolas Zumarraga, Thomas Kaar, Ning Wang, William Tennien, Alpay Hasanli, Max Rosenblattl, Fan Wu, Kevin Riehl, Maxwell A. Xu, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(1 非常规系统实验室,苏黎世联邦理工学院) Stanford University(2 斯坦福大学) Traffic Engineering Group, Institute for Transport Planning and Systems, ETH Zurich(3 交通工程组,交通规划与系统研究所,苏黎世联邦理工学院) University of Illinois Urbana-Champaign(4 印第安纳大学厄巴纳-香槟分校) Google(5 谷歌) Centre for Digital Health Interventions, ETH Zurich(6 数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(7 数字健康干预中心,圣加尔登大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出TS-Haystack基准,评估长上下文时间序列推理能力,发现现有TSLMs存在长上下文退化问题,代理检索框架在9/10任务中表现优异。

Comments Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新 79%

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29067 2026-06-30 cs.CL 79%

ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

ThinkProbe:超越准确性——通过非生成式思维图对开放式LLM推理轨迹进行结构分析

Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba, Yann Dauxais, Maha Ben-Fares, Pierre Holat

机构 * F-Initiatives Université sorbonne Paris Nord(巴黎-索邦大学 Nord)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出ThinkProbe框架,将LLM推理轨迹转化为思维图,通过非生成式管道提取五维认知特征,发现推理结构是模型级稳定属性,且结构维度对问题领域敏感。

Comments Under Review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28349 2026-06-30 cs.IR cs.AI 79%

HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning

HMARS:用于长上下文推理的分层多智能体记忆系统

Zeju Li, Ziyang Zheng, Yizhou Zhou, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HMARS分层多智能体记忆系统,通过子智能体、中层智能体和前沿模型的分层结构管理长上下文,在长文档和多轮记忆任务中优于检索、重排序、全上下文、基于图和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 79%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏