arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2607.00544 2026-07-02 cs.CV 新提交 80%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30378 2026-06-30 cs.CV 80%

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

OmniCoT: 全局与多步骤全景推理基准

Haocong He, Chenfei Liao, Zichen Wen, Zihao Dongfang, Xu Zheng, Bin Ren, Chang Su, Zixin Zhang, Harold Haodong Chen, Hongfei Zhang, Weijia Li, Kailun Yang, Conghui He, Xuming Hu, Nicu Sebe, Linfeng Zhang

机构 * MBZUAI Shanghai AI Lab(上海人工智能实验室)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OmniCoT基准,通过链式思维标注和两阶段训练策略,增强多模态大模型在全景图像中的全局多步推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27505 2026-06-29 cs.CV 新提交 80%

TruEye: Fine-Grained Detection of AI-Generated Human Subjects in Images

TruEye:图像中AI生成人物的细粒度检测

Jay Barot, Dan Lin

机构 * Vanderbilt University(范德堡大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出TruEye模型,通过掩码条件双流Transformer区分五种合成内容类别,实现AI生成或篡改人物与场景的细粒度检测和定位,无需大型语言模型,速度提升百倍。

Comments 18 Pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 80%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24694 2026-06-24 cs.HC 新提交 80%

SupplyNet: Supporting Visual Exploratory Learning in Supply Chain via Contextual Multi-Agent Simulation

SupplyNet: 通过上下文多智能体模拟支持供应链中的视觉探索式学习

Yanjia Li, Kelcy Kexin Han, Tianrui Hu, Yi-Fan Cao, Huamin Qu, Sicheng Song

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出SupplyNet,一种基于上下文图的多智能体LLM框架的视觉模拟系统,通过交互式网络视图、分支时间线和任务分析控制台,支持供应链中的反事实探索、因果追踪和比较推理,提升用户参与度和理解。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24443 2026-06-24 cs.LO cs.PL 新提交 80%

Verifiable Auto-Formalization of Mathematics Using a Relaxed Natural Formal Language

使用宽松自然形式语言的可验证数学自动形式化

Zhicheng Hui, Lihan Xie, Xingzhi Qi, Zhehao Li, Yingjun Lan, Qinxiang Cao

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出一种宽松自然形式语言作为中间目标,通过分阶段精化实现可验证的数学自动形式化,结合规则转换与LLM启发式方法,并利用领域特定策略语言生成验证条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21129 2026-06-23 cs.CR cs.OS 新提交 80%

AgenticOS: An Intent-Oriented Secure Operating System Architecture for Autonomous AI Agents

AgenticOS: 面向自主AI代理的意图导向安全操作系统架构

Zhen Zhao, Yu Zhang, Yanpeng Zhu, Jia Wang, Songqiao Tao, Xin Cheng, Jiexin Gao

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对LLM驱动代理面临的结构性安全挑战,提出AgenticOS架构,将OS从资源管理器重构为意图过滤器,通过四层架构和意图ABI实现最小权限环境。

Comments 11 pages,5 figures,1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16136 2026-06-19 cs.SE 80%

Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing

视觉即修复:基于多模态大语言模型的视觉软件问题修复

Kai Huang, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GUIRepair方法,通过多模态推理解决视觉软件问题,结合图像到代码和代码到图像的组件提升故障理解和修复验证。

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18550 2026-06-18 cs.CR 新提交 80%

The Gate Is Only as Honest as Its Contracts: ContractGuard for the Contract Layer of Risk-Aware Causal Gating

门仅与其合约一样诚实:面向风险感知因果门控合约层的ContractGuard

Laxmipriya Ganesh Iyer, Rahul Suresh Babu

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对工具增强型LLM代理的间接提示注入,提出ContractGuard,通过验证合约完整性(而非风险标签)来防御攻击,在基准测试中实现零注入成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28076 2026-06-18 cs.CL cs.AI cs.LG 版本更新 80%

TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering

TopBench:表格问答中隐式预测推理的基准

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01650 2026-06-17 cs.CL cs.AI cs.LG 版本更新 80%

EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning

EngTrace:工程推理可验证过程监督的符号基准

Ayesha Gull, Muhammad Usman Safder, Rania Elbadry, Fan Zhang, Veselin Stoyanov, Preslav Nakov, Zhuohan Xie

机构 * Namal University(纳马尔大学) MBZUAI(马克斯·普朗克智能人工智能研究所) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出EngTrace符号基准,包含1350个参数化测试用例,通过两阶段可验证评估框架(分层协议+AI仲裁)检验中间推理轨迹与最终答案,揭示数值精度与轨迹保真度的权衡。

Comments 33 pages, includes figures and tables; introduces the EngTrace benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16458 2026-06-16 cs.RO 新提交 80%

RHO: Your Coding Agent is Secretly a Roboticist

RHO:你的编码代理其实是个机器人专家

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。

Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14989 2026-06-16 cs.MA 新提交 80%

Hierarchical Generative Agents for Simulating Sequential Human Behavior

用于模拟序列人类行为的层次化生成式智能体

Maria G. Mendoza, Lucas Waldburger, Jin Lee, Shankar Sastry

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于认知层次和人格驱动的生成式智能体框架,结合大语言模型和人类疏散数据,模拟灾害中序列决策行为。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02435 2026-06-16 cs.IR 版本更新 80%

Beyond Chunks and Graphs: Retrieval-Augmented Generation through Triplet-Driven Thinking

超越分块与图:基于三元组驱动的检索增强生成

Shengbo Gong, Xianfeng Tang, Qi He, Carl Yang, Wei jin

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出T$^2$RAG框架,利用三元组知识库和迭代检索,在六数据集上平均性能提升11%,检索成本降低45%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10322 2026-06-15 cs.CR cs.MA 新提交 80%

Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs

面向鲁棒上下文推理的博弈论多智能体控制方法在LLMs中的应用

Saeid Jamshidi, Amin Nikanjam, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对LLMs在多轮交互中易受提示注入和上下文投毒攻击的问题,提出GT-MCP方法,通过博弈论多智能体控制和自愈机制,将上下文漂移限制在99.6%的轮次内,且控制器级注入攻击零成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13037 2026-06-12 cs.CR cs.SE 新提交 80%

DIG: Oracle-Guided Directed Input Generation for One-Day Vulnerabilities

DIG:面向单日漏洞的Oracle引导定向输入生成

Andrew Bao, Haochen Zeng, Peng Chen, Stephen McCamant, Pen-Chung Yew

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对补丁延迟或未完全部署导致的单日漏洞风险,提出Oracle引导的定向输入生成方法DIG,利用补丁揭示触发条件,通过LLM合成Oracle并引导生成器进化与定向模糊测试,在138个真实CVE上触发80个漏洞,超过现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12972 2026-06-12 cs.HC 新提交 80%

From Prompts to Preferences: An Open-Source Platform for Generative AI-Enhanced Conjoint Analysis

从提示到偏好:生成式AI增强联合分析的开源平台

Philipp Brauner

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个开源、自托管的联合分析调查平台,利用生成式AI(大语言模型和文本到图像模型)创建集成刺激格式,降低研究门槛,并通过概念验证研究展示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11354 2026-06-11 cs.ET 新提交 80%

A Zero-Shot Multi-Agent Framework for Human-Building Interaction via Programmatic Reasoning

通过程序化推理实现人楼交互的零样本多智能体框架

Yuqi Wang, Gulai Shen, Ali Mehmani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种分层多智能体框架,利用语义路由和程序化推理解耦自然语言理解与建筑分析,通过“门卫”机制分解任务并生成可执行Python脚本,在200多栋商业建筑数据上验证了准确性和上下文响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08464 2026-06-09 cs.CV 新提交 80%

TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding

TVI-CoT: 面向多模态理解的文本-视觉交错思维链推理

Lianyu Hu, Xiaoyu Ma, Zeqin Liao, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract)

AI总结 提出TVI-CoT框架,通过可学习控制令牌实现文本推理与视觉特征访问的动态交错,解决多模态LLM在推理过程中无法访问视觉特征的问题,在多个基准上取得最优结果。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08457 2026-06-09 cs.MA 新提交 80%

The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment

一致性错觉:多智能体辩论如何隐藏推理失调

Xiaoyang Wang, Christopher C. Yang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对多智能体LLM系统中答案共识不等于推理对齐的问题,提出CARA指标检测一致性错觉,并设计GDP协议通过事实承诺和立场表态显著提升推理对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08214 2026-06-09 cs.RO 新提交 80%

Agentic Neuro-Symbolic Planning and Commissioning for Human-in-the-Loop Industrial Robotics with Digital Twins

面向人机协同工业机器人的智能神经符号规划与调试:基于数字孪生

Zhihao Liu, Victor Nan Fernandez-Ayala, Tianyu Wang, Qiang Qin, Xi Vincent Wang, Dimos V. Dimarogonas, Lihui Wang

机构 * Royal Institute of Technology (KTH)(皇家理工学院(KTH))

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出一种结合LLM语言理解与确定性验证执行的神经符号框架,采用SDI架构和两级恢复机制,在数字孪生中验证后执行,显著提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19228 2026-06-09 cs.CL cs.AI cs.IT cs.LG math.IT 版本更新 80%

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

通过分步置信度归因诊断黑盒大语言模型的多步推理失败

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17488 2026-06-09 cs.CV 80%

AutoVQA-G: Self-Improving Agentic Framework for Automated Visual Question Answering and Grounding Annotation

AutoVQA-G:用于自动视觉问答与接地标注的自我改进代理框架

Rongsheng Hu, Runwei Guan, Yicheng Di, Jiayu Bao, Yuan Liu

机构 * School of Artificial Intelligence(人工智能学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);language model(abstract)

AI总结 本文提出AutoVQA-G框架,通过迭代优化流程提升视觉问答接地标注的准确性,优于现有多模态LLM,为构建高质量数据促进更稳健的视觉语言模型训练提供新方法。

Comments Accepted at IEEE ICASSP 2026. 5 pages, 5 figures. Code available at https://github.com/rohnson1999/AutoVQA-G

Journal ref Proc. 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 12312-12316, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07486 2026-06-08 eess.SY cs.SY 新提交 80%

OPENPATH: A Supervisor--Specialist Agent System for Personalized, Accessible, and Multi-stop Urban Trip Planning

OPENPATH: 一种用于个性化、无障碍和多站点城市出行规划的监督-专家智能体系统

Ziyang Xiong, He Zong, Zhiyuan Xue, Manxi Wu

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出监督-专家多智能体系统OPENPATH,结合LLM解析自然语言与经典算法优化路径,支持个性化偏好、多站点规划和无障碍需求,并用于城市尺度无障碍分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07036 2026-06-04 cs.CL cs.AI cs.LG 80%

Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers

Mid-Think: 通过词元级触发器实现无需训练的中间预算推理

Wang Yang, Debargha Ganguly, Xinpeng Li, Chaoda Song, Shouren Wang, Vikash Singh, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析注意力机制和提示实验,发现推理行为主要由少量触发词元控制,并据此提出Mid-Think方法,通过组合触发词元实现中间预算推理,在准确率-长度权衡上优于基线,并能在强化学习训练中减少时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03152 2026-06-03 cs.DB 80%

Cost-Aware Optimization for Agentic Query Execution

面向代价的智能查询执行优化

Lunyiu Nie, Yilin Xia, Yiren Liu, Christopher Jermaine, Swarat Chaudhuri

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对LLM支持的查询执行中算子放置、顺序和粒度影响代价与质量的问题,提出EnumGRPO优化器,通过上下文强化学习从枚举计划中蒸馏启发式策略,在SWAN数据库上实现0.011美元/查询的LLM代价和35.4%的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03047 2026-06-03 cs.RO cs.MA 80%

ModuLoop : Low-Level Code Generation using Modular Synthesizer and Closed-Loop Debugger for Robotic Control

ModuLoop: 使用模块化合成器和闭环调试器进行机器人控制的低级代码生成

Gina Yoon, Sumin Lee, Joo Yong Sim

机构 * Department of Mechanical Systems Engineering, Sookmyung Women’s University(苏州市女子大学机械系统工程系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出闭环模块化代码合成框架,利用预训练大语言模型进行模块化代码规划与生成,并通过迭代执行和调试探针实现系统调试与优化,成功应用于RGB-D相机与机械臂标定及抓取任务。

Comments IEEE Robotics and Automation Letters (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27590 2026-06-02 cs.CV cs.MM 80%

ForestHG-Trace: Traceable Long-Horizon Ecological Reasoning over Large-Scale Forest Scenes

ForestHG-Trace: 大规模森林场景下的可追踪长程生态推理

Zihang Cheng, Duanchu Wang, Cheng Li, Jing Huang, Huanzhao Fu, Di Wang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出ForestHG-Trace框架,通过生态超图表示和LLM引导的确定性工具链,实现森林场景中可追踪的多步生态推理,并构建ForestTraceQA基准,显著提升长程生态问答的准确性和执行忠实度。

Comments It has theoretical flaws and experimental errors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04069 2026-06-02 cs.CV cs.RO 80%

SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL

SpaceTools: 通过双交互强化学习实现工具增强的空间推理

Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay

机构 * NVIDIA University of Michigan(密歇根大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 提出双交互强化学习(DIRL)框架,通过两阶段训练让视觉语言模型学会协调多种工具(如深度估计、分割、姿态估计)进行精确空间推理,在多个基准上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31574 2026-06-01 cs.HC 80%

Can Generative AI help people navigate Radical Moral Disagreements? The CONSIDER prototype

生成式AI能否帮助人们应对根本性道德分歧?CONSIDER原型

William Hohnen-Ford, Sarah Chen, Kathryn B. Francis, Madeline G. Reinecke, Ilina Singh, David Lyreskog

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CONSIDER原型,一种基于大型语言模型的一对一AI工具,通过结构化分歧帮助用户澄清价值观,以应对根本性道德分歧。

Comments 25 pages, 1 figure, 2 tables. Submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏