arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 127 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 27 篇

2512.18190 2025-12-29 cs.AI cs.CL cs.LG 88%

External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning

外部海马体:用于引导大语言模型推理的拓扑认知图

Jian Yan

机构 * School of Computer Science, Zunyi Normal University(计算机科学学院,遵义师范学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出External Hippocampus框架,通过拓扑认知图引导大语言模型推理,解决多步推理中的认知死锁问题,提升推理效率和准确性。

Comments 12 pages, 7 figures. v3: replaces v2 (uploaded in error); updated to two-column format; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13143 2025-12-29 cs.CY 88%

Auditing Meta-Cognitive Hallucinations in Reasoning Large Language Models

审查推理大型语言模型中的元认知幻觉

Haolang Lu, Yilian Liu, Jingxin Xu, Guoshun Nan, Yuanlong Yu, Zhican Chen, Kun Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过审查推理链轨迹,揭示了大型语言模型在长推理过程中如何通过错误反思强化偏见,提出黑盒审查方法以更有效地检测和归因幻觉问题。

Comments Accepted by NeurIPS 2025 (37 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21404 2025-12-29 cs.CR cs.AI 85%

LLM-Driven Feature-Level Adversarial Attacks on Android Malware Detectors

基于大语言模型的Android恶意软件检测器特征级对抗攻击

Tianwei Lan, Farid Naït-Abdesselam

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LAMLAD框架,利用大语言模型生成特征扰动以对抗恶意软件检测器,实验显示攻击成功率高达97%,并提出对抗训练防御策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12717 2025-12-29 cs.CL 83%

ToTRL: Unlock LLM Tree-of-Thoughts Reasoning Potential through Puzzles Solving

ToTRL: 通过解谜游戏解锁大语言模型树状思维推理潜力

Haoyuan Wu, Xueyi Chen, Rui Ming, Jilong Gao, Shoubo Hu, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab(Noah's Ark Lab) Huawei(华为) ChatEDA Tech(ChatEDA科技)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToTRL通过解谜游戏训练,提升大语言模型的树状思维推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21855 2025-12-29 cs.AI cs.CL cs.LG cs.MA 80%

SIGN: Schema-Induced Games for Naming

SIGN:基于模式的命名游戏

Ryan Zhang, Herbert Woisetschläger

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIGN通过引入轻量结构引导惯例形成,提升了多代理协调效率,其在命名游戏中展示了更高的收敛速度和一致性。

Comments AAAI 2026 Student Abstract (Oral). Code available ar https://github.com/ryanzhangofficial/schema-induced-games-for-naming

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21723 2025-12-29 cs.RO cs.AI cs.LG 79%

HELP: Hierarchical Embodied Language Planner for Household Tasks

家庭任务的分层具身语言规划器HELP

Alexandr V. Korchemnyi, Anatoly O. Onishchenko, Eva A. Bakaeva, Alexey K. Kovalev, Aleksandr I. Panov

机构 * MIRAI Cognitive AI Systems Lab(认知人工智能系统实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HELP通过分层结构的LLM智能体解决家庭任务中的复杂规划问题,结合自然语言处理与具身智能,实现高效任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19864 2025-12-29 cs.CL cs.AI 79%

HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data

HARMON-E:多模态肿瘤病历的分层代理推理以提取结构化数据

Shashi Kant Gupta, Arijeet Pramanik, Jerrin John Thomas, Regina Schwind, Lauren Wiener, Avi Raju, Jeremy Kornbluth, Yanshan Wang, Zhaohui Su, Hrituraj Singh

机构 * Triomics University of Pittsburgh(匹兹堡大学) Ontada

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HARMON-E通过分层代理推理框架,实现对多模态肿瘤病历的结构化数据提取,达到高精度和大规模应用。

Comments 39 Pages, Supplementary Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20312 2025-12-29 cs.LG cs.AI 79%

TableGPT-R1: Advancing Tabular Reasoning Through Reinforcement Learning

TableGPT-R1: 通过强化学习推进表格推理

Saisai Yang, Qingyi Huang, Jing Yuan, Liangyu Zha, Kai Tang, Yuhang Yang, Ning Wang, Yucheng Wei, Liyao Li, Wentao Ye, Hao Chen, Tao Zhang, Junlin Zhou, Haobo Wang, Gang Chen, Junbo Zhao

机构 * Zhejiang University Institute of Computing Innovation(浙江大学计算创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 TableGPT-R1通过强化学习框架提升表格推理能力,整合数据工程、奖励系统和多阶段训练框架,实现复杂表格任务的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19855 2025-12-29 cs.LG cs.HC 77%

Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning

在LLM中诱导因果世界模型以实现零样本物理推理

Aditya Sharma, Ananya Gupta, Chengyu Wang, Chiamaka Adebayo, Jakub Kowalski

机构 * Department of Electrical Engineering(电气工程系) Indian Institute of Technology Bombay(印度理工学院孟买分校) Department of Computer Science and Automation(计算机科学与自动化系) Indian Institute of Science(印度科学研究所) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) University of Lagos(拉各斯大学) Faculty of Mathematics, Informatics, and Mechanics(数学、信息学与力学学院) University of Warsaw(华沙大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CWMI框架,通过引入因果物理模块和因果干预损失,使LLM具备因果推理能力,在零样本物理推理任务中取得显著成效。

Comments 12 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21699 2025-12-29 cs.AI 77%

Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning

迈向负责任和可解释的AI代理:基于共识驱动的推理

Eranga Bandara, Tharaka Hewa, Ross Gore, Sachin Shetty, Ravi Mukkamala, Peter Foytik, Abdul Rahman, Safdar H. Bouk, Xueping Liang, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University, Norfolk, VA, USA(老奥本大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Florida International University, USA(佛罗里达国际大学) Nanyang Technological University, Singapore(南洋理工大学) University of Colombo, Sri Lanka(科伦坡大学) Accenture Technology Labs, Arlington, VA, USA(Accenture技术实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于多模型共识和推理层治理的负责任和可解释的AI代理架构,通过结构化整合不同模型的输出以提升系统鲁棒性、透明度和责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05622 2025-12-29 cs.RO cs.AI 77%

CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory

CityNavAgent:基于层次语义规划和全局记忆的空中视觉-语言导航

Weichen Zhang, Chen Gao, Shiquan Yu, Ruiying Peng, Baining Zhao, Qian Zhang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CityNavAgent通过层次语义规划和全局记忆模块,提升空中视觉-语言导航在复杂城市环境中的导航性能。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20458 2025-12-29 cs.IR 75%

Laser: Governing Long-Horizon Agentic Search via Structured Protocol and Context Register

激光:通过结构化协议和上下文寄存器治理长 horizon 的代理搜索

Shuting Wang, Qiaolin Xia, Vich Wang, Herberttli, Bobsimons, Zhicheng Dou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Laser通过结构化协议和上下文寄存器稳定并扩展代理搜索,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18286 2025-12-29 cs.CV 75%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21481 2025-12-29 cs.MA 75%

The AI Committee: A Multi-Agent Framework for Automated Validation and Remediation of Web-Sourced Data

AI委员会:一种多智能体框架,用于自动验证和修复网络来源的数据

Sunith Vallabhaneni, Thomas Berkane, Maimuna Majumder

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AI委员会是一种多智能体框架,通过自动化验证和修复网络数据集,提升数据质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18848 2025-12-29 cs.CL cs.AI cs.LG stat.ME 75%

A Causal Lens for Evaluating Faithfulness Metrics

一种评估忠实度度量的因果视角

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出因果诊断性框架,用于评估自然语言解释的忠实度度量,通过生成忠实-不忠实解释对,发现Filler Tokens在多任务中表现最佳,连续度量更优但易受噪声影响。

Comments Published at EMNLP 2025; 25 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21711 2025-12-29 cs.CL cs.AI 73%

Do Latent Tokens Think? A Causal and Adversarial Analysis of Chain-of-Continuous-Thought

潜在标记是否思考?对连续思维链的因果和对抗分析

Yuyi Zhang, Boyu Tang, Tianjie Ju, Sufeng Duan, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过因果和对抗分析揭示COCONUT作为伪推理机制的问题,指出其依赖捷径而非真实推理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09109 2025-12-29 cs.CL cs.AI cs.IR 73%

Thinking Forward and Backward: Multi-Objective Reinforcement Learning for Retrieval-Augmented Reasoning

正向与反向思考:用于检索增强推理的多目标强化学习

Wenda Wei, Yu-An Liu, Ruqing Zhang, Jiafeng Guo, Lixin Su, Shuaiqiang Wang, Dawei Yin, Maarten de Rijke, Xueqi Cheng

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Bi-RAR通过双向信息距离和多目标强化学习框架,提升检索增强推理在复杂多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01470 2025-12-29 cs.CL 70%

BARD: budget-aware reasoning distillation

BARD: 带预算意识的推理蒸馏

Lujie Niu, Lei Shen, Yi Jiang, Caixia Yuan, Xiaojie Wang, Wenbo Su, Bo zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.CL

AI总结 BARD通过两阶段训练实现推理能力蒸馏与预算控制,使模型在不同预算下高效完成推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 70%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04440 2025-12-29 cs.CL cs.AI cs.LG 67%

StepFun-Formalizer: Unlocking the Autoformalization Potential of LLMs through Knowledge-Reasoning Fusion

StepFun-Formalizer: 通过知识推理融合解锁大语言模型的自动形式化潜力

Yutong Wu, Di Huang, Ruosi Wan, Yue Peng, Shijie Shang, Chenrui Cao, Lei Qi, Rui Zhang, Zidong Du, Jie Yan, Xing Hu

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 StepFun-Formalizer通过知识推理融合提升大语言模型的自动形式化能力,在FormalMATH-Lite和ProverBench上取得最佳成绩。

Comments AAAI 2026 Oral. Extended version with full appendix, 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21613 2025-12-29 cs.AI 57%

AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design

AMS-IO-Bench 和 AMS-IO-Agent:用于模拟和混合信号集成电路输入/输出设计的基准测试与结构化推理

Zhishuai Zhang, Xintian Li, Shilong Liu, Aodong Zhang, Lu Jie, Nan Sun

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出 AMS-IO-Agent 和 AMS-IO-Bench,通过结构化推理提升模拟和混合信号集成电路输入/输出设计效率,实现高通过率和缩短设计周期。

Comments 8 pages, 5 figures. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21431 2025-12-29 cs.SE cs.LG 57%

Cerberus: Multi-Agent Reasoning and Coverage-Guided Exploration for Static Detection of Runtime Errors

Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测

Hridya Dhulipala, Xiaokai Rong, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21722 2025-12-29 cs.RO 50%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21560 2025-12-29 cs.CV 50%

Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration

迈向智能场景增强以实现情境感知的对象放置和赞助商-标志集成

Unnati Saraswat, Tarun Rao, Namah Gupta, Shweta Swami, Shikhar Sharma, Prateek Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science(巴里尔理工学院和科学研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出两个新任务:情境感知的对象插入和赞助商-产品标志增强,并构建了相应数据集以支持这些任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 25 篇

2404.00287 2025-12-29 cs.SE cs.CR 90%

Evaluating Large Language Models for Line-Level Vulnerability Localization

评估大型语言模型在行级漏洞定位中的表现

Jian Zhang, Chong Wang, Anran Li, Weisong Sun, Cen Zhang, Wei Ma, Yang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文评估了大型语言模型在行级漏洞定位中的表现,发现判别微调在有充足训练数据时效果显著,而提示方法在低数据环境下更有效,同时提出了改进微调过程的策略。

Comments Accepted to TSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02455 2025-12-29 cs.CL cs.AI cs.CY 90%

An Exploration of Higher Education Course Evaluation by Large Language Models

大型语言模型在高等教育课程评估中的探索

Bo Yuan, Jiazi Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大型语言模型进行高等教育课程评估,发现微调和提示工程能显著提高评估准确性,LLM生成的反馈有助于教学改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03297 2025-12-29 cs.HC 89%

"It's the only thing I can trust": Envisioning Large Language Model Use by Autistic Workers for Communication Assistance

只有一件事我可信任:面向自闭症工作者的大型语言模型在沟通辅助中的应用展望

JiWoong Jang, Sanika Moharana, Patrick Carrington, Andrew Begel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨自闭症工作者在工作中使用LLM进行沟通辅助的现象,发现参与者更倾向LLM,但专家对其建议持质疑态度,提出需关注自闭症体验的设计考量。

Comments 19 pages, 6 figure, CHI '24 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 89%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21347 2025-12-29 cs.SE 89%

Understanding the Role of Large Language Models in Software Engineering: Evidence from an Industry Survey

理解大型语言模型在软件工程中的作用:来自行业调查的证据

Vítor Mateus de Brito, Kleinner Farias

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过行业调查揭示大型语言模型在软件工程中的应用现状与影响,探讨其积极效果与潜在风险,提出需批判性使用LLM工具以提升开发效率与安全性。

Comments 4 Figures, 8 Tables, Text in Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21422 2025-12-29 cs.CL cs.AI 88%

Teaching People LLM's Errors and Getting it Right

教导人类LLM的错误并使其正确

Nathan Stringham, Fateme Hashemi Chaleshtori, Xinyuan Yan, Zhichao Xu, Bei Wang, Ana Marasović

机构 * University of Utah(犹他大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了如何通过教导人类LLM的错误模式来减少其过度依赖,发现教学效果依赖于更有效的自动失败发现方法和新的评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏