arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-13 至 2026-02-13 共收录 225 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2602.09070 2026-02-13 cs.SD cs.AI eess.AS 57%

NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control

NarraScore: 通过分层情感控制弥合视觉叙事与音乐动态

Yufan Wen, Zhaocheng Liu, YeGuo Hua, Ziyi Guo, Lihua Zhang, Chun Yuan, Jian Wu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 NarraScore通过分层情感控制,实现视觉叙事与音乐动态的融合,以高密度压缩叙事逻辑,提升长视频配乐生成的连贯性与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 13 篇

2602.12158 2026-02-13 cs.LG 89%

SafeNeuron: Neuron-Level Safety Alignment for Large Language Models

SafeNeuron: 大语言模型的神经层面安全对齐

Zhaoxin Wang, Jiaming Liang, Fengbin Zhu, Weixiang Zhao, Junfeng Fang, Jiayi Ji, Handing Wang, Tat-Seng Chua

机构 * Xidian University, Xi'an, China(西安电子科技大学) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) National University of Singapore,Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.LG

AI总结 SafeNeuron通过神经层面安全对齐框架提升模型鲁棒性,减少攻击风险并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05703 2026-02-13 cs.LG 87%

Provably Convergent Primal-Dual DPO for Constrained LLM Alignment

可证明收敛的约束语言模型对齐的对偶直接偏好优化

Yihan Du, Seo Taek Kong, R. Srikant

机构 * SUTD ESD(新加坡科技设计大学电子与计算机工程系) UIUC ECE(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出了一种可证明收敛的约束LLM对齐方法,通过改进的DPO技术减少训练模型数量和内存消耗,同时保证约束条件和优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11902 2026-02-13 cs.LG cs.AI 86%

Mitigating Mismatch within Reference-based Preference Optimization

缓解基于参考的偏好优化中的不匹配

Suqin Yuan, Xingrui Yu, Jiyang Zheng, Lei Feng, Dadong Wang, Ivor Tsang, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) CFAR, A*STAR(CFAR,A*STAR) CSIRO, Data61(CSIRO,Data61) Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HyPO通过有条件地去偏参考信号缓解基于参考的偏好优化中的不匹配问题,提升推理对齐性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12180 2026-02-13 cs.LG cs.GT 85%

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11779 2026-02-13 cs.LG 85%

Temperature as a Meta-Policy: Adaptive Temperature in LLM Reinforcement Learning

温度作为元策略:LLM强化学习中的自适应温度

Haoran Dang, Cuiling Lan, Hai Wan, Xibin Zhao, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TAMPO通过将温度控制转化为可学习的元策略,实现了LLM强化学习中的自适应探索,优于固定或启发式温度方法。

Comments Accepted at ICLR 2026. 10 pages (main text) + supplementary material, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01511 2026-02-13 cs.CL cs.LG 85%

Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training

交替强化学习用于非可验证大语言模型后训练的评分标准建模

Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang

机构 * Emory University(埃默里大学) Purdue University(普渡大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.CL、cs.LG

AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12530 2026-02-13 cs.CL cs.LG 84%

Translate Policy to Language: Flow Matching Generated Rewards for LLM Explanations

将策略翻译为语言:通过生成连续归一化流生成的奖励用于LLM解释

Xinyi Yang, Liang Zeng, Heng Dong, Chao Yu, Xiaoran Wu, Huazhong Yang, Yu Wang, Milind Tambe, Tonghan Wang

机构 * AIPD, Tencent, Shenzhen, China(腾讯人工智能与大数据研究院,深圳,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) EE, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) CS, Tsinghua University, Beijing, China(清华大学计算机系,北京,中国) SEAS, Harvard University, Cambridge, USA(哈佛大学工程学院,剑桥,美国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过生成连续归一化流生成奖励,训练LLM生成更准确、逻辑严谨且认知负担更低的解释,以提升智能体与人类共存的可靠性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11596 2026-02-13 cs.AI 83%

MAPLE: Modality-Aware Post-training and Learning Ecosystem

MAPLE: 多模态感知的后训练与学习生态系统

Nikhil Verma, Minjung Kim, JooYoung Yoo, Kyung-Min Jin, Manasa Bharadwaj, Kevin Ferreira, Ko Keun Kim, Youngjoon Kim

机构 * LG Electronics Toronto AI Lab, Toronto, Canada(LG电子多伦多AI实验室) LG Electronics CTO AI Lab, Seoul, Republic of Korea(LG电子CTO AI实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI

AI总结 MAPLE通过模态感知的后训练与学习生态系统,提升多模态强化学习的准确性、收敛速度和稳定性。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03441 2026-02-13 cs.LG cs.AI cs.CR 81%

PBP: Post-training Backdoor Purification for Malware Classifiers

PBP: 事后训练后门净化用于恶意软件分类器

Dung Thuy Nguyen, Ngoc N. Tran, Taylor T. Johnson, Kevin Leach

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 PBP是一种后训练方法,通过调节批量归一化层统计特性,有效净化恶意软件分类器中的后门,显著降低攻击成功率。

Comments The Network and Distributed System Security (NDSS) Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11523 2026-02-13 cs.LG 79%

Unifying Stable Optimization and Reference Regularization in RLHF

统一稳定优化与参考正则化在RLHF中

Li He, Qiang Qu, He Zhao, Stephen Wan, Dadong Wang, Lina Yao, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心、悉尼大学) CSIRO, Data61(澳大利亚联邦科学与工业研究组织、Data61) University of New South Wales(新南威尔士大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

AI总结 本文提出了一种统一正则化方法,通过平衡防止奖励黑客和稳定策略更新,提升RLHF的对齐性能和稳定性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12116 2026-02-13 cs.CL 70%

P-GenRM: Personalized Generative Reward Model with Test-time User-based Scaling

P-GenRM:具有测试时用户基于缩放的个性化生成奖励模型

Pinyi Zhang, Ting-En Lin, Yuchuan Wu, Jingyang Chen, Zongqi Wang, Hua Yang, Ze Xu, Fei Huang, Kai Zhang, Yongbin Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 P-GenRM通过测试时用户基于缩放机制,实现个性化生成奖励模型,提升用户偏好适应性和泛化能力。

Comments Accepted as ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23396 2026-02-13 physics.comp-ph cs.AI 57%

PINNs for Electromagnetic Wave Propagation

用于电磁波传播的PINNs

Nilufer K. Bulut

机构 * Izmir, Turkiye(土耳其伊兹密尔)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出混合训练策略,使PINNs在电磁波传播中实现与FDTD相当的精度和能量守恒性能。

Comments v2: corrected typos and improved wording; corrected Poynting loss weight; added an additional high-frequency scenario with corresponding results and discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11328 2026-02-13 cs.CL 57%

Evaluating Alignment of Behavioral Dispositions in LLMs

评估大语言模型中行为倾向的对齐情况

Amir Taubenfeld, Zorik Gekhman, Lior Nezry, Omri Feldman, Natalie Harris, Shashir Reddy, Romina Stella, Ariel Goldstein, Marian Croak, Yossi Matias, Amir Feder

机构 * Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本研究通过情境判断测试评估大语言模型行为倾向与人类倾向的对齐情况,发现模型在不同共识场景下表现出过度自信、偏离共识及跨模型特质模式,揭示了LLMs声明价值与实际行为之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 9 篇

2602.12108 2026-02-13 cs.AI 83%

The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context

Pensieve范式:具备状态的语言模型掌握自身上下文

Xiaoyuan Liu, Tian Liang, Dongyang Ma, Deyu Zhou, Haitao Mi, Pinjia He, Yan Wang

机构 * Tencent AI Lab(腾讯人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 长上下文与记忆 :language model(title);LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 StateLM 通过内部推理循环和记忆工具,使语言模型具备状态管理能力,从而在长文档问答、聊天记忆和深度研究任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11598 2026-02-13 cs.RO cs.AI cs.CV 83%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 长上下文与记忆 :foundation model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11607 2026-02-13 cs.CL 77%

Scene-Aware Memory Discrimination: Deciding Which Personal Knowledge Stays

场景感知的记忆辨别:决定哪些个人知识应被保留

Yijie Zhong, Mengying Guo, Zewei Wang, Zhongyang Li, Dandan Tu, Haofen Wang

机构 * College of Design and Innovation, Tongji University(同济大学设计与创新学院) Huawei Technologies Co. Ltd.(华为技术有限公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出了一种场景感知的记忆辨别方法,通过门控单元和聚类提示模块提升记忆处理效率与准确性,有效组织个人知识。

Comments Accepted by Knowledge-Based Systems. Lincense: CC BY-NC-ND

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12278 2026-02-13 cs.IR cs.AI 70%

AttentionRetriever: Attention Layers are Secretly Long Document Retrievers

AttentionRetriever: 注意力层其实是秘密的长文档检索器

David Jiahao Fu, Lam Thanh Do, Jiayu Li, Kevin Chen-Chuan Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AttentionRetriever通过结合注意力机制和实体检索,实现高效长文档检索,优于现有方法并保持高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07348 2026-02-13 cs.CL cs.AI cs.NE 62%

Controlled Self-Evolution for Algorithmic Code Optimization

算法代码优化的受控自演进

Tu Hu, Ronghao Chen, Shuo Zhang, Jianghao Yin, Mou Xiao Feng, Jingping Liu, Shaolei Zhang, Wenqi Jiang, Yuqi Fang, Sen Hu, Huacan Wang, Yi Xu

机构 * NJU(南京大学) PKU(北京大学) Midea-AIRC(美的人工智能研究院) ECNU(华东师范大学) SYSU(南方科技大学) RUC(中国人民大学) QuantaAlpha(量子Alpha) QuantML(量子机器学习)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 受控自演进通过改进初始化、反馈引导和经验记忆,提升算法代码优化的效率和效果。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11185 2026-02-13 cs.LG cs.AI 62%

Spectra: Rethinking Optimizers for LLMs Under Spectral Anisotropy

Spectra: 重新思考在谱各向异性下大语言模型的优化器

Zhendong Huang, Hengjie Cao, Fang Dong, Ruijun Huang, Mengyi Chen, Yifeng Yang, Xin Zhang, Anrui Chen, Mingzhi Dong, Yujiang Wang, Jinlong Hou, Qin Lv, Robert P. Dick, Yuan Cheng, Fan Yang, Tun Lu, Li Shang

机构 * Fudan University, Shanghai, China(复旦大学) University of Bath, Bath, United Kingdom(巴斯大学) Oxford Suzhou Centre for Advanced Research, Suzhou, China(牛津苏格兰先进研究中心) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Department of Computer Science, University of Colorado Boulder, Colorado, USA(计算机科学系,科罗拉多大学博尔德分校) Department of Electrical Engineering and Computer Science, University of Michigan(电气工程与计算机科学系,密歇根大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Spectra通过抑制主导低秩尖峰子空间并减少优化器状态内存,提升了大语言模型的训练效率和下游准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11808 2026-02-13 cs.LG 57%

Deep Kernel Fusion for Transformers

基于变压器的深度核融合

Zixi Zhang, Zhiwen Mo, Yiren Zhao, Robert Mullins

机构 * Imperial College London(帝国理工学院伦敦分校) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 本研究提出DeepFusionKernel,通过深度融合内核减少HBM流量并提高缓存复用,实现大语言模型在长上下文推理中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17311 2026-02-13 cs.AI 57%

Phase Transition for Budgeted Multi-Agent Synergy

预算多智能体协同的相变

Bang Liu, Linglong Kong, Jian Pei

机构 * Department of Computer Science and Operations Research Université de Montréal & Mila - Quebec AI Institute(计算机科学与运筹学系,蒙特利尔大学及魁北克人工智能研究所) Department of Mathematical & Statistical Science University of Alberta(数学与统计学系,阿尔伯塔大学) Department of Computer Science Duke University(计算机科学系,杜克大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 该研究提出了一种理论,通过分析上下文窗口、通信损失和共享失败等约束,揭示了预算多智能体系统在不同相变状态下的表现,并给出了计算分配规则和预算阈值。

Comments 55 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11622 2026-02-13 cs.IR 50%

Evolutionary Router Feature Generation for Zero-Shot Graph Anomaly Detection with Mixture-of-Experts

进化路由器特征生成用于混合专家的零样本图异常检测

Haiyang Jiang, Tong Chen, Xinyi Gao, Guansong Pang, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出EvoFG框架,通过进化特征生成和增强记忆路由器,解决零样本图异常检测中的分布偏移问题,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 40 篇

2602.11609 2026-02-13 cs.AI q-bio.GN 90%

scPilot: Large Language Model Reasoning Toward Automated Single-Cell Analysis and Discovery

scPilot:面向自动化单细胞分析与发现的大型语言模型推理

Yiming Gao, Zhen Wang, Jefferson Chen, Mark Antkowiak, Mengzhou Hu, JungHo Kong, Dexter Pratt, Jieyuan Liu, Enze Ma, Zhiting Hu, Eric P. Xing

机构 * UC San Diego(UC圣地亚哥大学) MBZUAI CMU(卡内基梅隆大学) Texas A&M(德克萨斯A&M大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 scPilot通过组学原生推理提升单细胞分析的准确性与可解释性,实现自动化细胞类型注释和轨迹重建。

Comments Accepted at NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11541 2026-02-13 cs.AI cs.LG 88%

Budget-Constrained Agentic Large Language Models: Intention-Based Planning for Costly Tool Use

预算约束下的代理型大语言模型:基于意图的规划以应对昂贵的工具使用

Hanbing Liu, Chunhao Tian, Nan An, Ziyuan Wang, Pinyan Lu, Changyuan Yu, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Shanghai University of Finance(上海财经大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出INTENT框架,通过意图感知的分层世界模型,在预算约束下提升工具使用任务的成功率并保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12013 2026-02-13 cs.AI 88%

InjectRBP: Steering Large Language Model Reasoning Behavior via Pattern Injection

InjectRBP: 通过模式注入引导大语言模型推理行为

Xiuping Wu, Zhao Yu, Yuxin Cheng, Ngai Wong, Liangjun Ke, Tapas Mishra, Konstantinos V. Katsikopoulos

机构 * Xi'an Jiaotong University(西安交通大学) University of Southampton(南安普顿大学) University of Hongkong(香港大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 InjectRBP通过注入行为模式提升大语言模型推理能力,无需参数更新,实验显示在多种推理任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11860 2026-02-13 cs.AI 88%

Talk2DM: Enabling Natural Language Querying and Commonsense Reasoning for Vehicle-Road-Cloud Integrated Dynamic Maps with Large Language Models

Talk2DM: 通过大语言模型实现车辆-道路-云集成动态地图的自然语言查询与常识推理

Lu Tao, Jinxuan Luo, Yousuke Watanabe, Zhengshu Zhou, Yuhuan Lu, Shen Ying, Pan Zhang, Fei Zhao, Hiroaki Takada

机构 * School of Resource and Environmental Sciences, Wuhan University(武汉大学资源与环境科学学院) School of Earth Sciences, Yunnan University(云南大学地球科学学院) College of Artificial Intelligence, Tianjin University of Science & Technology(天津科技大学人工智能学院) Department of Computer and Information Engineering, Khalifa University(卡利法大学计算机与信息工程系) NVIDIA Institutes of Innovation for Future Society, Nagoya University(名古屋大学创新未来社会研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Talk2DM通过大语言模型实现车辆-道路-云集成动态地图的自然语言查询与常识推理,提升人机交互效率与准确性。

Comments Submitted to IEEE TITS. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11170 2026-02-13 cs.CL 88%

PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models

PRIME:基于策略强化的迭代多智能体执行框架用于大语言模型中的算法推理

Jiawei Xu, Zhenyu Yu, Ziqian Bi, Minh Duc Pham, Xiaoyi Qu, Danyang Zhang

机构 * Purdue University(普渡大学) University of Malaya(马来亚大学) Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院) School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) Department of Industrial and Systems Engineering, Lehigh University(莱斯大学工业与系统工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PRIME通过多智能体框架提升大语言模型在算法推理中的性能,显著提高复杂任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08520 2026-02-13 cs.AI cs.LG 88%

Reinforcement Inference: Leveraging Uncertainty for Self-Correcting Language Model Reasoning

强化推断:利用不确定性进行自我修正的语言模型推理

Xinhai Sun

机构 * Programme of Management Engineering, Politecnico di Milano(米兰理工学院管理工程项目)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本研究提出强化推断方法,通过利用模型不确定性进行自我修正推理,提升语言模型在零样本设置下的准确性,同时减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18095 2026-02-13 cs.AI cs.CL 88%

SMaRT: Select, Mix, and ReinvenT -- A Strategy Fusion Framework for LLM-Driven Reasoning and Planning

SMaRT: 选择、混合与再发明 -- 一种用于大语言模型驱动推理与规划的策略融合框架

Nikhil Verma, Manasa Bharadwaj, Wonjun Jang, Harmanpreet Singh, Yixiao Wang, Homa Fashandi, Chul Lee

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SMaRT框架通过融合多样化推理策略,提升大语言模型在推理与规划任务中的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏