arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2309.11244 2023-09-21 cs.RO 78%

Integrating Visual Foundation Models for Enhanced Robot Manipulation and Motion Planning: A Layered Approach

Chen Yang, Peng Zhou, Jiaming Qi

专题命中 推理与问题求解 :foundation model(title,abstract)

Comments 3 pages, 2 figures, IEEE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03424 2023-08-08 cs.DB 78%

CAESURA: Language Models as Multi-Modal Query Planners

Matthias Urban, Carsten Binnig

专题命中 推理与问题求解 :language model(title,abstract)

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03357 2023-08-08 cs.RO 78%

Foundation Model based Open Vocabulary Task Planning and Executive System for General Purpose Service Robots

Yoshiki Obinata, Naoaki Kanazawa, Kento Kawaharazuka, Iori Yanokura, Soonhyo Kim, Kei Okada, Masayuki Inaba

专题命中 推理与问题求解 :foundation model(title,abstract)

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08587 2023-06-21 cs.RO 78%

Grounding Classical Task Planners via Vision-Language Models

Xiaohan Zhang, Yan Ding, Saeid Amiri, Hao Yang, Andy Kaminski, Chad Esselink, Shiqi Zhang

专题命中 推理与问题求解 :language model(title,abstract)

Comments ICRA Workshop on Robot Execution Failures and Failure Management Strategies, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01009 2023-06-05 cs.CL cs.AI cs.LG 78%

Examining the Emergence of Deductive Reasoning in Generative Language Models

Peter Belcak, Luca A. Lanzendörfer, Roger Wattenhofer

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the 1st Natural Language Reasoning and Structured Explanations Workshop (NLRSE@ACL'23). 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07875 2023-04-18 eess.IV cs.CV 78%

The Segment Anything foundation model achieves favorable brain tumor autosegmentation accuracy on MRI to support radiotherapy treatment planning

Florian Putz, Johanna Grigo, Thomas Weissmann, Philipp Schubert, Daniel Hoefler, Ahmed Gomaa, Hassen Ben Tkhayat, Amr Hagag, Sebastian Lettmaier, Benjamin Frey, Udo S. Gaipl, Luitpold V. Distel, Sabine Semrau, Christoph Bert, Rainer Fietkau, Yixing Huang

专题命中 推理与问题求解 :foundation model(title,abstract)

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04671 2023-03-09 cs.CV 78%

Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models

Chenfei Wu, Shengming Yin, Weizhen Qi, Xiaodong Wang, Zecheng Tang, Nan Duan

专题命中 推理与问题求解 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09360 2023-02-27 cs.CR 78%

Backdoor Attacks to Pre-trained Unified Foundation Models

Zenghui Yuan, Yixin Liu, Kai Zhang, Pan Zhou, Lichao Sun

专题命中 推理与问题求解 :foundation model(title,abstract)

Comments This paper is accepted as a poster for NDSS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05155 2022-07-13 cs.AI cs.CL cs.LG 78%

Can Language Models perform Abductive Commonsense Reasoning?

Seungone Kim

专题命中 推理与问题求解 :language model(title);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.08212 2017-06-27 cond-mat.mtrl-sci 78%

Analysis of Thermal Stresses in Solidification of Spherical SLM Components

Amir Mahyar Khorasani, Ian Gibson, Moshe Goldberg, Mohammad Masoud Movahedi, Guy Littlefair

专题命中 推理与问题求解 :SLM(title,abstract)

Comments 9 Pages, 5 Figures, 16 Equations, Design and Technology Conference, Geelong, Australia, 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24305 2026-05-26 cs.LG cs.AI 77%

ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

ChaosBench-Logic v2: 大规模评估大语言模型在动力系统上的逻辑推理能力

Noel Thomas

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(title,comments);分类 cs.AI、cs.LG

AI总结 针对二元推理基准的准确性掩盖了关键缺陷,本文提出包含40,886个问题、覆盖165个动力系统的ChaosBench-Logic v2基准和CARE评估协议,揭示模型在状态转换推理、FOL演绎等任务上的表现差异和系统性反相关。

Comments 14 pages, 8 figures. Published at the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15843 2026-02-19 cs.CL cs.AI 77%

The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts

困惑性悖论:为什么代码在LLM提示中比数学压缩得更好

Warren Johnson

机构 * Bona Opera Studios(博纳歌剧工作室)

专题命中 推理与问题求解 :LLM(title,comments);分类 cs.CL、cs.AI

AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。

Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25457 2026-08-28 cs.CR cs.AI cs.MA 版本更新 77%

MACGen: Toward Functionally Correct and Secure Code Generation via Multi-Agent Collaboration

MACGen:通过多智能体协作实现功能正确且安全的代码生成

Miseon Yu, Jaehoon Choi, Younghan Lee, Yunheung Paek

机构 * Seoul National University(首尔大学) Sungshin Women’s University(诚信女子大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-08-28 cs.AI 版本更新 77%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24790 2026-08-26 cs.AI 新提交 77%

Right Diagnoses, Decorative Reasoning:A Perturbation Audit of Medical Chain-of-Thought

正确诊断,装饰性推理:医学思维链的扰动审计

Mengzhu Xu, Jifan Gao, Xia Jiang, Yaoxin Wu, Xi Long

机构 * Eindhoven University of Technology(埃因霍温理工大学) Dana-Farber Cancer Institute(达纳-法伯癌症研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本研究通过医学扰动审计方法,对14个大语言模型在四个医学问答基准上进行测试,发现医学思维链多为装饰性内容,为医学CoT的忠实性审计提供了可复用标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23181 2026-08-26 cs.CR cs.CL 版本更新 77%

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

CyberFactory:利用真实场景实例扩展网络安全能力

Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Zhoujun Li, Xianglong Liu, Tianyu Zheng, Bryan Dai, Chengran Yang

机构 * Beihang University(北京航空航天大学) ELLIS(欧洲学习与智能系统实验室) IQuest Research(智问研究) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出开源框架CyberFactory,将真实场景漏洞转化为任务实例以训练安全模型Aegis,该模型在CyberGym上的Pass@1较Qwen~3.5提升22.8个百分点,优于通用主干模型。

Comments We updated scores with models trained on updated agentic data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23493 2026-08-25 cs.AI 新提交 77%

SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning

SRPO:用于长程推理的自反思策略优化

Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li

机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23029 2026-08-25 cs.CL 新提交 77%

Meta-Moderator: Empowering Multi-Agent Debate with Meta-Cognition

元审核员:用元认知赋能多智能体辩论

Wentao Hu, Zhuoyue Wan, Jinhao Shen, Chen Jason Zhang, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究提出Meta-Moderator可学习框架,将多智能体辩论的审核视为元认知过程,经结果驱动策略优化训练,在五个基准测试中性能优于现有决策层,能动态调控辩论并减少错误聚合。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 77%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22332 2026-08-25 cs.CL 新提交 77%

Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching

通过顺序激活补丁的思维链推理的机制可解释性

Murat Dura, Serkan Öztürk, Selma Tekir

机构 * İzmir Institute of Technology(伊兹密尔理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究提出顺序激活补丁框架及顺序多头补丁,探究思维链推理的因果效应位置与相关注意力头,证实存在支持思维链的分布式推理子电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21614 2026-08-25 cs.AI cs.DC 新提交 77%

SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning

SAEM:面向思维链推理的内存高效混合专家模型推理的阶段感知型专家管理

Yujie Zhang, Bin Gao, Tulika Mitra

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对思维链推理中MoE模型的内存与延迟问题,提出SAEM阶段感知型专家管理运行时,通过阶段感知缓存等技术提升吞吐量,在受限GPU内存下平均实现1.33倍的性能提升。

Comments Extended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21049 2026-08-24 cs.CR cs.AI cs.NI 新提交 77%

$Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN

$Z^2$-ACT:面向开放6G无线接入网的端到端可验证智能体意图控制

Sunder Ali Khowaja, Kapal Dev, George C. Alexandropoulos

机构 * School of Computer Science, Dublin City University(都柏林城市大学计算机科学学院) Munster Technological University(芒斯特理工大学) National and Kapodistrian University of Athens(雅典国立与卡波迪斯特里亚大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对开放6G RAN多厂商部署的安全可验证需求,提出$Z^2$-ACT架构,集成多类核心组件并经实验验证其执行过滤与攻击恢复能力提升。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20564 2026-08-24 cs.AI 新提交 77%

Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning

Consilience:用于隐式多智能体推理的保形校准通信控制

Abhijith Babu, Ramneet Kaur, Vishal Pramanik, Olivera Kotevska, Nathaniel D. Bastian, Susmit Jha, Sunny Raj, Yanzhao Wu, Sumit Kumar Jha, Anirban Roy

机构 * Knight Foundation School of Computing and Information Sciences, Florida International University(佛罗里达国际大学奈特基金会计算与信息科学学院) SRI International(SRI国际公司) University of Florida(佛罗里达大学) Oak Ridge National Laboratory(橡树岭国家实验室) Army Cyber Institute, United States Military Academy(美国军事学院陆军网络研究所) Oakland University(奥克兰大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出Consilience框架,通过轮次保形校准程序保证多智能体通信控制的可靠性,在HiddenBench任务上提升了决策准确性与通信效率,优于现有协议甚至全信息基线。

Comments 39 pages, 2 figures, 9 tables. Includes appendix with full proof of Proposition 1, expanded results, ablations, and complete prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14178 2026-08-20 cs.AI cs.MA 版本更新 77%

ReasFlow: Assisting Reasoning-Centric Scientific Discovery in Applied Mathematics via a Knowledge-Based Multi-Agent System

ReasFlow:通过基于知识的多智能体系统助力应用数学中以推理为中心的科学发现

Yutong He, Daibo Li, Guohong Li, Jiahe Geng, Zhengyang Huang, Can Ren, Zekun Zhang, Yifan Liu, Shuchen Zhu, Hengrui Zhang, Boao Kong, Ming Sun, Shu Li, Chenyi Li, Jiang Hu, Kun Yuan, Zaiwen Wen, Pingwen Zhang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对理论驱动科学发现探索不足的问题,ReasFlow引入以推理为中心的自主智能体系统,通过内部验证循环和知识检索机制减少专家干预,能统一多项科研任务,从最少提示生成高质量论文,在开源基线中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12982 2026-08-19 cs.AI cs.MA cs.SC 版本更新 77%

FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation

形式分析几何:一种基于神经符号的多模态解析几何问题生成框架

Ruoran Xu, Wending Gao, Xiaoqing Kang, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究解析几何问题生成,提出基于神经符号的FormalAnalyticGeo框架,利用CDL及四个大语言模型组件,无需人工注释自动生成问题,形成闭环,生成的AnalyticGeo7K数据集问题误差小,框架和数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00417 2026-08-19 cs.NI cs.AI 77%

AgentxGCore: Agentic AI for Next-Generation Mobile Core Network

AgentxGCore:面向下一代移动核心网络的智能体AI

Maria Katarine Santana Barbosa, Kelvin L. Dias

机构 * Centro de Informática - Universidade Federal de Pernambuco(计算机中心 - 佩鲁巴科联邦大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgentxGCore,通过智能体AI原生层扩展3GPP架构,利用多智能体系统实现基于实时信息的闭环优化,支持自组织和自适应。

Comments This paper has been accepted for publication in IEEE Network

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16742 2026-08-18 cs.SE cs.AI 新提交 77%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

机构 * National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Qingdao Research Institute and Hangzhou Innovation Institute, Beihang University(北京航空航天大学青岛研究院与杭州创新研究院) School of Software, Beihang University(北京航空航天大学软件学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15445 2026-08-18 cs.AI 新提交 77%

Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization

测量位置混淆优化下的奖励黑客行为与推理-答案解耦

Suyash Maniyar, Armaan Sandhu, Abhishek Mishra

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 该研究针对位置混淆优化下的奖励黑客与推理-答案解耦问题,通过GRPO训练语言模型,发现模型会学习答案位置捷径,推理与答案解耦,且该捷径可跨域迁移,解耦率等指标可区分能力损失与捷径。

Comments Accepted at the AI Measurement Science Workshop, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 77%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(summary_cn);prompting(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10840 2026-08-14 cs.LG 版本更新 77%

Training and Benchmarking Code Generation for Physics-Inspired Animations

SimuScene: 通过训练和基准测试代码生成来模拟物理场景

Yanan Wang, Renxi Wang, Yongxin Wang, Xuezhi Liang, Fajri Koto, Timothy Baldwin, Xiaodan Liang, Haonan Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏