arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-25 至 2025-12-25 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 16 篇

2512.20647 2025-12-25 cs.AI 90%

Reasoning Relay: Evaluating Stability and Interchangeability of Large Language Models in Mathematical Reasoning

推理中继:评估大型语言模型在数学推理中的稳定性与可替换性

Leo Lu, Jonathan Zhang, Sean Chua, Spencer Kim, Kevin Zhu, Sean O'Brien, Vasu Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Binghamton University(宾夕法尼亚州立大学布林茅尔分校) University of Toronto(多伦多大学) UC Berkeley(加州大学伯克利分校) Algoverse

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究探讨大型语言模型在数学推理中的稳定性与可替换性,通过评估不同模型间推理链的延续性,揭示推理过程的可靠性和一致性。

Comments NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21120 2025-12-25 cs.CL cs.IR 89%

ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models

ClarifyMT-Bench: 会话大语言模型多轮澄清的基准测试与改进

Sichun Luo, Yi Huang, Mukai Li, Shichang Meng, Fengyuan Liu, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(中移动巨泰研宄院) CityUHK(城市大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 ClarifyMT-Bench通过多轮对话基准测试和ClarifyAgent代理方法,解决LLM在多轮对话中澄清不足的问题,提升在模糊情境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19512 2025-12-25 cs.CV cs.AI 89%

Anatomy-R1: Enhancing Anatomy Reasoning in Multimodal Large Language Models via Anatomical Similarity Curriculum and Group Diversity Augmentation

Anatomy-R1: 通过解剖相似性课程和群体多样性增强多模态大语言模型的解剖推理

Ziyang Song, Zelin Zang, Zuyao Chen, Xusheng Liang, Dong Yi, Jinlin Wu, Hongbin Liu, Jiebo Luo, Zhen. Lei

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 Anatomy-R1通过解剖相似性课程和群体多样性增强方法提升多模态大语言模型在医学影像中的解剖推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21238 2025-12-25 cs.SE cs.CR cs.LG 88%

Assessing the Software Security Comprehension of Large Language Models

评估大语言模型的软件安全理解能力

Mohammed Latif Siddiq, Natalie Sekerak, Antonio Karam, Maria Leal, Arvin Islam-Gomes, Joanna C. S. Santos

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究评估了五种大语言模型在软件安全方面的认知能力,发现其在低阶任务表现良好,但在高阶任务如推理和系统设计上存在显著不足,并识别出51种常见误解模式。

Comments Submitted to Empirical Software Engineering (EMSE) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20954 2025-12-25 cs.CL cs.AI 88%

Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models

反射预训练使生物序列模型实现token级自我修正

Xiang Zhang, Jiaqi Wei, Yuejin Yang, Zijie Qiu, Yuhan Chen, Zhiqiang Gao, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Wanli Ouyang, Chenyu You, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Stony Brook University(石溪大学)

专题命中 推理与问题求解 :pretraining(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00617 2025-12-25 cs.CL cs.AI 86%

ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization

ART:自适应响应调节框架——基于多智能体竞赛的LLM响应优化方法

Omer Jauhar Khan

机构 * Department of Computer Science(计算机科学系) National University of Computer and Emerging Sciences (FAST-NUCES)(计算机与新兴科学国立大学(FAST-NUCES))

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ART通过多智能体竞赛机制优化LLM响应,提升准确性和一致性,实现8.4%的质量提升和R²超过0.96的收敛效果。

Comments 14 pages, 11 figures, 5 tables. IEEE conference-style paper with appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20789 2025-12-25 eess.SY cs.AI cs.SY 85%

X-GridAgent: An LLM-Powered Agentic AI System for Assisting Power Grid Analysis

X-GridAgent: 一种基于大语言模型的代理AI系统,用于协助电力 grid 分析

Yihan, Wen, Xin Chen

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 X-GridAgent是一种基于大语言模型的代理AI系统,通过自然语言查询实现电力系统分析的自动化,结合提示优化和混合检索增强生成算法,提升电网分析的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20664 2025-12-25 cs.AI cs.LO 85%

Eidoku: A Neuro-Symbolic Verification Gate for LLM Reasoning via Structural Constraint Satisfaction

Eidoku:一种通过结构约束满足的神经符号验证门用于LLM推理

Shinobu Miya

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Eidoku通过结构约束满足方法有效检测LLM推理中的结构不一致幻觉,提供神经符号验证机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21250 2025-12-25 cs.CR cs.MA 78%

CoTDeceptor:Adversarial Code Obfuscation Against CoT-Enhanced LLM Code Agents

CoTDeceptor:对抗增强CoT的LLM代码代理的对抗性代码混淆

Haoyang Li, Mingjin Li, Jinxin Zuo, Siqi Li, Xiao Li, Hao Wu, Yueming Lu, Xiaochuan He

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 CoTDeceptor通过构建多阶段混淆策略链,有效对抗增强CoT的LLM检测器,实现对14个漏洞类别的绕过。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14582 2025-12-25 cs.CL 77%

Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning

剪枝能否提升推理?基于能力对齐的Long-Cot压缩以获得更好的推理

Shangziqi Zhao, Jiahao Yuan, Jinyang Wu, Zhenglin Wang, Guisong Yang, Usman Naseem

机构 * XJTU(西安交通大学) ECNU(华东师范大学) THU(清华大学) SEU(上海师范大学) USST(上海师范大学)

专题命中 推理与问题求解 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.CL

AI总结 本文提出Prune-on-Logic框架,通过结构感知剪枝提升Long-CoT推理效率,发现验证剪枝在保持准确性的同时减少令牌使用,揭示剪枝与模型容量对齐的重要性。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20812 2025-12-25 cs.CL 70%

Semantic Deception: When Reasoning Models Can't Compute an Addition

语义欺骗:当推理模型无法计算加法时

Nathaniël de Leeuw, Marceau Nahon, Mathis Reymond, Raja Chatila, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) CNRS(法国国家科学研究中心) Sorbonne University(索邦大学) Paris Cité University(巴黎城市大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现LLMs在面对语义欺骗时表现不佳,揭示其在符号操作上的局限性及对表面语义的依赖。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17019 2025-12-25 cs.CV cs.AI cs.CY 70%

Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework

让安卓梦见电羊:一种受人类启发的图像隐喻理解和推理框架

Chenhao Zhang, Yazhe Niu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出LAD框架,通过三阶段方法解决图像隐喻理解问题,在多个基准测试中取得优异成绩,推动视觉语言推理和人机交互发展。

Comments 19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20934 2025-12-25 cs.CV cs.AI cs.CL cs.MA 62%

Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning

归纳式视觉编程:从经验中演化工具库以进行空间推理

Shengguang Wu, Xiaohan Wang, Yuhui Zhang, Hao Zhu, Serena Yeung-Levy

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过从经验中归纳学习工具库,TVP在空间推理任务中实现了更高效的工具发现和重用,优于现有方法。

Comments Project Website: https://transductive-visualprogram.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20135 2025-12-25 cs.AI 57%

MolAct: An Agentic RL Framework for Molecular Editing and Property Optimization

MolAct:一种用于分子编辑和性质优化的代理强化学习框架

Zhuo Yang, Yeyun Chen, Jiaqing Xie, Ben Gao, Shuaike Shen, Wanhao Liu, Liujia Yang, Beilun Wang, Tianfan Fu, Yuqiang Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xidian University(西安电子科技大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 MolAct框架通过代理强化学习方法,实现了分子编辑和性质优化的多步骤、工具增强过程,提升了分子设计的可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 50%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02622 2025-12-25 cs.CV 50%

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏