arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 131 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 6 篇

2602.17930 2026-02-23 cs.LG cs.AI 86%

MIRA: Memory-Integrated Reinforcement Learning Agent with Limited LLM Guidance

MIRA: 集成记忆的强化学习智能体与有限LLM指导

Narjes Nourzad, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MIRA通过集成记忆图减少对LLM的依赖,提升稀疏奖励环境中的强化学习性能。

Comments International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18374 2026-02-23 cs.RO cs.AI 70%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14434 2026-02-23 cs.SE 67%

CMind: An AI Agent for Localizing C Memory Bugs

CMind:一种用于定位C内存错误的人工智能代理

Chia-Yi Su, Collin McMillan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 CMind通过模拟人类程序员行为,利用大语言模型和引导决策方法,定位C程序中的内存错误。

Comments 4 pages, 2 figures. To be published in 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18007 2026-02-23 cs.DC 67%

Joint Training on AMD and NVIDIA GPUs

在AMD和NVIDIA GPU上联合训练

Jon Hu, Thomas Jia, Jing Zhu, Zhendong Yu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种在AMD和NVIDIA GPU上实现高效异构混合训练的技术方案,通过设备直接通信机制提升训练吞吐量至接近同构系统的98%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 18 篇

2602.18232 2026-02-23 cs.CL cs.AI 86%

Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning

通过减法思考:基于置信度的对比解码用于大语言模型推理

Lexiang Tang, Weihao Gao, Bingchen Zhao, Lu Ma, Qiao jin, Bang Yang, Yuexian Zou

机构 * Peking University, Beijing, China(北京大学) University of Edinburgh, Edinburgh, UK(爱丁堡大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过置信度驱动的对比解码方法提升大语言模型推理可靠性,减少输出长度并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14556 2026-02-23 cs.AI cs.ET cs.LG cs.RO 86%

LLM-Enabled In-Context Learning for Data Collection Scheduling in UAV-assisted Sensor Networks

基于大语言模型的上下文学习用于无人机辅助传感器网络中的数据采集调度

Yousef Emami, Hao Zhou, SeyedSina Nabavirazani, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时与嵌入式计算系统研究中心(CISTER)) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Knight Foundation School of Computing and Information Sciences, Florida International University(国际大学计算与信息科学学院(Knight基金会))

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于大语言模型的上下文学习数据采集调度系统,用于解决无人机辅助传感器网络中的紧急调度问题,通过自然语言任务描述和安全验证机制提升调度效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17937 2026-02-23 cs.CL cs.PL 85%

Analyzing LLM Instruction Optimization for Tabular Fact Verification

分析用于表格事实验证的LLM指令优化

Xiaotang Du, Giwon Hong, Wai-Chung Kwan, Rohit Saxena, Ivan Titov, Pasquale Minervini, Emily Allaway

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了指令优化在表格事实验证中的应用,发现MiPROv2在CoT中表现最佳,SIMBA在ReAct中效果显著,且CoT在小模型中仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10134 2026-02-23 cs.AI 85%

FRSICL: LLM-Enabled In-Context Learning Flight Resource Allocation for Fresh Data Collection in UAV-Assisted Wildfire Monitoring

FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教智利大学) Instituto de Telecomunicações(电信研究院) Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 81%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 80%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10855 2026-02-23 cs.LG 79%

ExPairT-LLM: Exact Learning for LLM Code Selection by Pairwise Queries

ExPairT-LLM:通过成对查询实现LLM代码选择的精确学习

Tom Yuviler, Dana Drachsler-Cohen

机构 * Tom Yuviler(独立研究者) Dana Drachsler-Cohen(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 ExPairT-LLM通过成对查询提升LLM代码选择的精确性,实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04108 2026-02-23 cs.CL 79%

Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models

批量提示抑制约束下的过度推理:如何通过批量提示抑制推理模型中的过度推理

Saurabh Srivastava, Janit Bidhan, Hao Yan, Abhishek Dey, Tanu Kansal, Paras Kath, Sina Mansouri, Mohit Marvania, Vamsi Shankar Simhadri, Gaurav Singh

机构 * George Mason University(乔治·马歇尔大学) Google(谷歌) eBay

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.CL

AI总结 批量提示通过减少推理标记和抑制过度推理行为,提升推理模型的效率和可靠性。

Comments New version with updated author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18307 2026-02-23 cs.SE cs.CL cs.LG cs.PL 79%

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

VeriSoftBench: 仓库级形式验证基准测试用于Lean

Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

机构 * New York University(纽约大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 VeriSoftBench通过500个Lean 4证明义务评估LLM和证明器在仓库级形式验证中的表现,揭示了依赖闭包对证明成功率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18424 2026-02-23 cs.CV cs.RO 78%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18429 2026-02-23 cs.CL cs.IR 77%

VIRAASAT: Traversing Novel Paths for Indian Cultural Reasoning

VIRAASAT:为印度文化推理开辟新路径

Harshul Raj Surana, Arijit Maji, Aryan Vats, Akash Ghosh, Sriparna Saha, Amit Sheth

机构 * AI Institute, University of South Carolina(AI研究所,南卡罗来纳大学) Indian Institute of Technology Patna(帕纳大学印度理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 VIRAASAT通过半自动化多跳方法生成印度文化多跳问题-答案数据集,提出SCoM框架提升文化推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18095 2026-02-23 cs.AI 77%

Neurosymbolic Language Reasoning as Satisfiability Modulo Theory

神经符号语言推理作为可满足性模理论

Hyunseok Oh, Sam Stern, Youngki Lee, Matthai Philipose

机构 * Seoul National University(首尔国立大学) U. Mass. Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Logitext通过结合LLM和SMT求解,实现自然语言与逻辑推理的联合处理,提升内容审核和法律任务的准确性和覆盖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08364 2026-02-23 cs.CL 77%

Structure-Augmented Reasoning Generation

结构增强的推理生成

Jash Rajesh Parekh, Pengcheng Jiang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 结构增强的推理生成通过显式推理结构提升多跳查询的准确性和连贯性,兼容现有RAG流程,无需定制检索器或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17037 2026-02-23 cs.SE cs.AI cs.HC cs.PL 70%

Wink: Recovering from Misbehaviors in Coding Agents

Wink: 代码代理中行为失误的恢复

Rahul Nanda, Chandra Maddila, Smriti Jha, Euna Mehnaz Khan, Matteo Paltenghi, Satish Chandra

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17734 2026-02-23 cs.SE cs.AI 70%

Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects

五项致命假设:为何T恤 sizing 系统性地失败于AI项目

Raja Soundaramourty, Ozkan Kilic, Ramu Chenchaiah

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出T恤 sizing在AI项目中失效的五项致命假设,并提出Checkpoint Sizing作为更人性化的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18297 2026-02-23 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory

通过信息论分析和改进链式思维可监控性

Usman Anwar, Tim Bakker, Dana Kianfar, Cristina Pinneri, Christos Louizos

机构 * University of Cambridge(剑桥大学) Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息论分析,提出两种方法改进链式思维监控器的可监控性,以提高监控准确性并防止奖励黑客问题。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18351 2026-02-23 cs.CL cs.AI 62%

Validating Political Position Predictions of Arguments

验证论证中政治立场预测的准确性

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。

Comments 13 pages, 6 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17688 2026-02-23 cs.LG cs.PL 57%

AnCoder: Anchored Code Generation via Discrete Diffusion Models

AnCoder:通过离散扩散模型实现锚定代码生成

Anton Xue, Litu Rout, Constantine Caramanis, Sanjay Shakkottai

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 AnCoder通过结构化锚定扩散模型实现高质量代码生成,解决了传统方法无法尊重编程语言结构的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 评测与基准 27 篇

2602.17791 2026-02-23 cs.CY 89%

The Digital Divide in Generative AI: Evidence from Large Language Model Use in College Admissions Essays

生成式AI的数字鸿沟:来自大学录取文书使用大型语言模型的证据

Jinsook Lee, Conrad Borchers, AJ Alvero, Thorsten Joachims, Rene F. Kizilcec

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了生成式AI在大学录取文书中的使用差异及其对录取结果的影响,发现低社会经济地位学生更依赖AI写作工具,但其录取成功率下降更明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 86%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25860 2026-02-23 cs.AI cs.CL cs.HC 86%

Through the Judge's Eyes: Inferred Thinking Traces Improve Reliability of LLM Raters

通过裁判之眼:推断的思考轨迹提升LLM评分器的可靠性

Xingjian Zhang, Tianhong Gao, Suliang Jin, Tianhao Wang, Teng Ye, Eytan Adar, Qiaozhu Mei

机构 * University of Michigan(密歇根大学) University of California, San Diego(加州大学圣地亚哥分校) University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过人与LLM协作框架推断思考轨迹,提升LLM评分器的可靠性及人类与LLM之间的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03283 2026-02-23 cs.SE 86%

Exploring Generalizable Automated Program Repair with Large Language Models

探索大型语言模型在通用自动程序修复中的应用

Viola Campos, Ridwan Shariffdeen, Adrian Ulges, Yannic Noller

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文探讨了大型语言模型在自动程序修复中的应用,发现不同模型在不同语言上表现各异,需结合多个模型以提高修复效果,并指出故障定位的不完美会显著影响修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18372 2026-02-23 cs.HC cs.AI 85%

"How Do I ...?": Procedural Questions Predominate Student-LLM Chatbot Conversations

如何做到?

Alexandra Neagu, Marcus Messer, Peter Johnson, Rhodri Nelson

机构 * Imperial College London, London, United Kingdom(伦敦帝国学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了学生与LLM聊天机器人对话中程序性问题的主导地位,发现其在总结性评估中更为突出,但现有分类方案存在局限性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17696 2026-02-23 cs.LG cs.AI 84%

Can LLM Safety Be Ensured by Constraining Parameter Regions?

通过约束参数区域能否确保大语言模型的安全性?

Zongmin Li, Jian Su, Farah Benamara, Aixin Sun

机构 * Nanyang Technological University(南洋理工大学) Institute for Infocomm Research (I 2 R)(信息通信研究所) IRIT, Université de Toulouse, CNRS, Toulouse INP(图卢兹大学IRIT研究所、法国国家科学研究中心) IPAL, CNRS-NUS-A*STAR(IPAL、法国国家科学研究中心-南洋理工大学-A*STAR)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了四种安全区域识别方法,发现其在不同粒度和数据集下重叠程度低,表明现有方法难以可靠地识别稳定的安全区域。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18031 2026-02-23 cs.CV cs.AI cs.LG 84%

ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks

ViGText: 基于视觉-语言模型解释和图神经网络的深度伪造图像检测

Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

机构 * New Jersey Institute of Technology(新泽西理工学院) Old Dominion University(旧 Dominion 大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 ViGText结合视觉-语言模型解释和图神经网络,提升深度伪造检测的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17770 2026-02-23 cs.CV cs.LG 83%

CLUTCH: Contextualized Language model for Unlocking Text-Conditioned Hand motion modelling in the wild

CLUTCH:解锁野外文本条件手部运动建模的上下文化语言模型

Balamurugan Thambiraja, Omid Taheri, Radek Danecek, Giorgio Becherini, Gerard Pons-Moll, Justus Thies

机构 * Technical University of Darmstadt(德累斯顿技术大学) Max-Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tuebingen(图宾根大学) Tubingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 CLUTCH通过引入3D-HIW数据集和SHIFT架构,提出基于LLM的手部动画系统,提升野外手部运动建模的保真度与泛化能力。

Comments ICLR2026; Project page: https://balamuruganthambiraja.github.io/CLUTCH/

详情

展开后加载摘要…

URL PDF HTML 收藏