arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18998 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18998 篇

2608.21897 2026-08-25 cs.AI 新提交 81%

From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning

从求解器反馈到可信规划:用于符号规划的多角色强化学习

Chenghao Zhang, Yikai Mao, Shanqi Liu, Haoyu Gao, SaiSai Hu, Dan Roth

机构 * University of Pennsylvania(宾夕法尼亚大学) Georgia Institute of Technology(佐治亚理工学院) Pace University(佩斯大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出基于求解器的多角色强化学习框架,仅用求解器反馈实现无人工演示的自然语言转PDDL,在PlanBench上显著提升规划成功率与可信性,降低语义漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12129 2026-08-25 cs.CL 版本更新 81%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG:基于查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI(智量科技)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出SAG(SQL检索增强生成)架构,通过查询时动态超边实现结构化检索,在HotpotQA等多跳问答基准上性能优于基线,为LLM智能体处理组织知识提供了新方案。

Comments This work was intended as a replacement of arXiv:2606.15971 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20359 2026-08-24 cs.CL 新提交 81%

Self-Speculation for Faster Reasoning Models

用于更快推理模型的自推测技术

Ravisri Valluri, Tung Nguyen, Aditya Grover

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM推理延迟问题,提出无需训练的SSR自推测解码方法,结合思维链与后缀解码,在Qwen3.5、Gemma-4等模型上实现总生成延迟最高24.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05616 2026-08-21 cs.AI cond-mat.mtrl-sci physics.comp-ph 版本更新 81%

Toward Greater Autonomy in Materials Discovery Agents: Unifying Planning, Physics, and Scientists

迈向材料发现智能体的更高自主性:统一规划、物理与科学家

Lianhao Zhou, Hongyi Ling, Keqiang Yan, Kaiji Zhao, Xiaoning Qian, Raymundo Arróyave, Xiaofeng Qian, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯A&M大学) Department of Materials Science and Engineering, Texas A&M University(材料科学与工程系,德克萨斯A&M大学) Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学) Computing and Data Sciences, Brookhaven National Laboratory(布鲁赫斯国家实验室计算与数据科学部) Department of Physics and Astronomy, Texas A&M University(物理与天文学系,德克萨斯A&M大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);language agent(abstract)

AI总结 该研究提出MAPPS智能体框架,通过统一规划、物理与科学家实现更高自主性,在MP-20数据集上使材料发现相关指标提升5倍,是自主材料发现的潜力框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18084 2026-08-20 cs.CL cs.PL 新提交 81%

Compiler-Guided Adaptive Proof Search with Cross-Model Synergy on Context-Dependent Theorem Proving

面向上下文依赖定理证明的、结合跨模型协同的编译器引导自适应证明搜索

Zhuo Liu, Ding Yu, Hangfeng He

机构 * University of Rochester(罗切斯特大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究针对Lean 4项目定理证明的上下文依赖难题,提出结合双模型生成等策略的编译器引导证明搜索框架,在7个项目实验中实现了通过率提升且LLM调用量减少的更优权衡。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-20 cs.CV cs.CL 版本更新 81%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16149 2026-08-20 cs.AI 版本更新 81%

Teaching agentic AI to learn expert reasoning for rare disease diagnosis

LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体

Minh-Ha Nguyen, Erica Gray, Bryce A. Schuler, Kevin W. Byram, Chih-Ting Yang, Fan Ma, Hua Xu, Wu-Chen Su, Chao Yan, Wei-Qi Wei, Adam Wright, Lisa Bastarache, Josh F. Peterson, Lingyao Li, Siyuan Ma, Undiagnosed Diseases Network, Rizwan Hamid, Thomas A. Cassini, Cathy Shyr

机构 * Vanderbilt University(范德堡大学) Vanderbilt University Medical Center(范德堡大学医学中心) University of South Florida(南佛罗里达大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出轻量级框架LiteOdyssey,通过人类-AI协作的诊断策略和公共生物医学工具增强单个推理语言模型,在罕见病诊断基准上达到最先进性能,无需微调或多智能体集成。

Comments Updated abalation experiments and layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17153 2026-08-19 cs.CL 新提交 81%

Towards Safer RAG: Only Agents Capable of System 2 Thinking may Access Untrusted Documents

迈向更安全的检索增强生成(RAG):仅具备系统2思考能力的智能体可访问不可信文档

Mehrdad Ghassabi

机构 * University of Isfahan(伊斯法罕大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对RAG系统的知识投毒漏洞,提出仅具备系统2推理能力的智能体可访问不可信文档的安全原则,通过实证证明该原则能提升模型对被破坏证据的鲁棒性且无需严格隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-19 cs.CL 版本更新 81%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16178 2026-08-18 cs.DC cs.AI 新提交 81%

Agent-Native Telemetry: Verifiable State-Delta Evidence for Autonomous Operations

智能体原生遥测:面向自主操作的可验证状态增量证据

Jun He, Deying Yu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出智能体原生遥测架构,基于ATP协议和状态增量证据账本,在微服务基准测试中大幅降低了数据开销、LLM资源消耗,且能检测对抗性突变、抵御提示注入攻击。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15600 2026-08-18 cs.AI 新提交 81%

VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation

VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试

Mingyu Yuan, Shengtao Wen, Lingbing Guo, Zhen Bi, Xiang Chen

机构 * NUAA(南京航空航天大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15291 2026-08-18 cs.AI 新提交 81%

ReasonCast: Agentic Demand Forecasting with Selective Semantic Reasoning

ReasonCast:基于选择性语义推理的智能体需求预测

Ziyue Yang, Chaolin Xu, Yijing Wang, Tiankai Gu, Hui Yang, Yanhong Lin, Kaiyuan Liu, Fei Xiao

机构 * Taobao and Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 ReasonCast是结构化语义干预框架,通过选择性语义推理结合多类信息,在三类场景降低WMAPE,且可避免稳定期无差别干预的负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14566 2026-08-18 cs.AI 新提交 81%

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

立场:AI道德推理的评估仍遗漏了一半关键内容

Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

机构 * University of Connecticut(康涅狄格大学) Carnegie Mellon University(卡内基梅隆大学) Hugging Face

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究指出现有LLM道德推理评估聚焦道德价值问题而忽视规范问题,识别出三大缺口并提出含规范表征、标注数据集及分层评估的研究议程,以推动规范推理的系统研究。

Comments 8 pages, 1 figure. Accepted for archival publication at the ACL 2026 Workshop on Evaluating Evaluations (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21037 2026-08-18 cs.CR cs.CL 版本更新 81%

Honeyquest for LLMs: Rethinking Cyber Deception for AI Attackers

Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗

Kerri Prinos, Lilianne Brush, Cameron Denton

机构 * Horizon3.ai

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-08-18 cs.CR cs.AI 81%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24465 2026-08-18 cs.CL 版本更新 81%

MechMath: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Proving

Mechanic:基于遗憾的正式分解工作流用于自动定理证明

Ruichen Qiu, Yichuan Cao, Junqi Liu, Dakai Guo, Xiao-Shan Gao, Lihong Zhi, Ruyong Feng

机构 * Academy of Mathematics and Systems Science, CAS(数学与系统科学研究院,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) School of Mathematical Science, UCAS(数学科学学院,中国科学院大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Mechanic通过基于遗憾的正式分解策略提升自动定理证明效率,有效解决传统方法在处理失败尝试时的效率与上下文过长问题。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13460 2026-08-18 cs.CV cs.AI 81%

Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization

基于证据链的多模态推理用于少样本时序动作定位

Mengshi Qi, Hongwei Ji, Wulian Yun, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。

Comments Accepted by TIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09706 2026-08-17 cs.CE cs.LG 版本更新 81%

Test-Time Scaling for CAD Generation via Verifier-Free Consensus Selection

基于无验证器共识选择的CAD生成测试时缩放

Aaron Haag, Altay Kacan, Bertram Fuchs, Oliver Lohse

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对文本到CAD生成的单个样本易出错问题,提出无验证器的3D CAD共识选择方法,经实验验证其可提升几何准确率并降低Chamfer距离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12585 2026-08-14 cs.AI 新提交 81%

Reasoning Jury: Multi-Model Consensus for Evaluating Reasoning Traces

推理评审团:用于评估推理轨迹的多模型共识机制

Congchao Wang, Diwakar Singh, Qiaozi Gao, Spyros Matsoukas, Yang Liu, Mahdi Namazifar

机构 * Amazon AGI(亚马逊AGI)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出Reasoning Jury系统,以多LLM评审团及调控共识机制替代单模型评审员,其识别推理缺陷的准确率显著优于前沿模型,且开销仅为后者的8%-15%,还可用于理解推理LLM的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08322 2026-08-14 cs.AI cs.HC math.CO 版本更新 81%

Agentic Neurosymbolic Collaboration for Mathematical Discovery: A Case Study in Combinatorial Design

代理神经符号协作用于数学发现:组合设计的一个案例研究

Hai Xia, Carla P. Gomes, Bart Selman, Stefan Szeider

机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11260 2026-08-13 cs.AI cs.CV 新提交 81%

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

扫视、审视与思考:将视频异常检测从无训练推进到智能体推理

Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang

机构 * Beijing Jiaotong University(北京交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对视频异常检测的“何时-何事”脱节问题,提出无训练框架GtS及工具增强型智能体方法,扩展基准并引入联合评估指标,实现了更高的异常检测准确性与推理速度。

Comments 34 pages, 8 figures, 8 tables. Journal extension of our AAAI 2026 paper (arXiv:2507.21507)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 81%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 81%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09524 2026-08-11 cs.CR cs.AI 新提交 81%

STAIR: Effective Incident Response Using an End-to-End Agentic Planning Framework

STAIR:使用端到端智能体规划框架的有效事件响应

Hanlin Jiang, Jionghao Huang, Shaofei Li, Bojia Yu, Peng Jiang, Yuxin Ren, Ning Jia, Yao Guo, Ding Li

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对事件响应规划的静态工作流和现有LLM智能体的不足,提出端到端智能体规划框架STAIR,在100个Docker网络靶场中实现0.94标准化防御得分,较最强基线提升9.5%。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08466 2026-08-11 cs.AI 新提交 81%

Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses

分层自改进:一种面向任务特定可进化智能体控制框架的方法

Tailin Zhou

机构 * HKUST(香港科技大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出HSI框架,使冻结LLM的任务特定控制框架可进化,在中等难度任务上取得性能提升,超出模型能力时无增益,为改进冻结LLM智能体提供可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08254 2026-08-11 cs.AI 新提交 81%

Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?

你的提示并非唯一提示:大型语言模型对结构化输出模式描述的权重有多大?

Sin-Ying Lin

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究测试LLM对结构化输出模式描述的权重,发现模式影响具模型依赖性,模式设计是更强杠杆,建议将提示与模式视为统一指令表面并实证验证其放置与字段设计。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07476 2026-08-11 cs.AI cs.LO 新提交 81%

Determinization in Structure Theories: A Unified Framework via Closure, Comparability, and Joint Admissibility

结构理论中的确定化:基于闭包、可比性与联合可容许性的统一框架

Hai Hai Fu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出了基于闭包、可比性与联合可容许性的统一框架,用于从多结构理论构造典范解释,区分非确定性类型并给出对应确定化机制,还可应用于LLM辅助推理以分析幻觉问题。

Comments Formal framework paper on canonicalization and determinization in structure theories; version v2.16.4; 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17593 2026-08-11 cs.CL 版本更新 81%

From Chains to DAGs: Probing the Graph Structure of Reasoning in LLMs

从链到DAG:探测语言模型推理中的图结构

Tianjun Zhong, Linyang He, Ziyang Li, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨语言模型内部推理是否以有向无环图形式存在,通过设计探针验证DAG结构在各层的出现,并发现中间层具有最强的结构恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27544 2026-08-11 cs.AI cs.FL 版本更新 81%

TempoBench: Reasoning Execution Without Causal Attribution Is Just Simulation

TempoBench:评估大语言模型中的时间因果推理

Nikolaus Holzer, William Fishell, Baishakhi Ray, Mark Santolucito

机构 * Columbia University(哥伦比亚大学) Columbia University, Barnard College(哥伦比亚大学、巴纳德学院)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TempoBench基准,通过合成Mealy机生成可验证的因果标签,评估LLM在时间因果推理中的表现,发现模型在最小因果归因任务上准确率低于25%,主要错误是过度指定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 81%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏