arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 258 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 13 篇

2509.17816 2026-01-30 cs.CV 50%

Enhancing Semantic Segmentation with Continual Self-Supervised Pre-training

通过持续自监督预训练增强语义分割

Brown Ebouky, Ajad Chhatkuli, Cristiano Malossi, Christoph Studer, Roy Assaf, Andrea Bartezzaghi

机构 * ETH Zurich(苏黎世联邦理工学院) IBM Research – Zurich(IBM瑞士研究实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出GLARE,一种持续自监督预训练任务,用于提升语义分割性能,通过块级增强和区域一致性约束,结合轻量级适配器模块,实现低数据域下的高效适应。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 14 篇

2509.17866 2026-01-30 cs.LG cs.AI 92%

Understanding Post-Training Structural Changes in Large Language Models

理解大型语言模型的训练后结构变化

Xinyu He, Xianghui Cao

机构 * School of Automation, Southeast University, Nanjing, China(自动化学院,东南大学,南京,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 本研究通过SVD分析揭示了大型语言模型训练后参数空间的结构变化,发现奇异值缩放和奇异向量旋转机制,为理解训练后调节机制提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12991 2026-01-30 cs.LG cs.AI stat.AP 89%

Bridging Performance Gaps for ECG Foundation Models: A Post-Training Strategy

弥合ECG基础模型性能差距:一种训练后策略

Ya Zhou, Yujie Yang, Xiaohan Fan, Wei Zhao

机构 * Department of Information Center, Fuwai Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(信息中心部门,阜外医院,中国医学科学院和北京协和医学院) Function Test Center, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(功能测试中心,阜外医院,国家心血管疾病中心,中国医学科学院和北京协和医学院) Cardiac Arrhythmia Center, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(心律失常中心,阜外医院,国家心血管疾病中心,中国医学科学院和北京协和医学院) Center for Health Statistics and Information, National Health Commission People’s Republic of China(健康统计与信息中心,中华人民共和国国家卫生健康委员会)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种训练后策略,通过提升ECG基础模型的性能,使其在多个任务中表现优于基线微调方法。

Comments A Transformer-based model is used as an example; the proposed post-training strategy may also be applicable to CNN-based models. The manuscript is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11311 2026-01-30 cs.AI cs.CY 87%

Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble

通过紧凑的LLM集合模拟人类偏好:提示到代理

Bingchen Wang, Zi-Yu Khoo, Jingtan Wang

机构 * Independent Researcher, China(中国独立研究者) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 通过紧凑的LLM集合模拟人类偏好,P2P方法在无需微调和敏感数据的情况下,有效重建目标人群偏好并实现高质量预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06411 2026-01-30 cs.AI cs.LG 86%

SofT-GRPO: Surpassing Discrete-Token LLM Reinforcement Learning via Gumbel-Reparameterized Soft-Thinking Policy Optimization

SofT-GRPO:通过Gumbel-重新参数化软思考策略优化超越离散标记LLM强化学习

Zhi Zheng, Yu Gu, Wei Liu, Yee Whye Teh, Wee Sun Lee

机构 * School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) School of Intelligence Science(智能科学学院) Technology, Nanjing University, China(技术学院,南京大学,中国)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SofT-GRPO通过引入Gumbel噪声和重新参数化技巧,在软思考模式下提升LLM推理性能,使其在Pass@1和Pass@32任务中分别优于离散标记GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15596 2026-01-30 cs.LG 83%

Corrective Diffusion Language Models

纠正扩散语言模型

Shuibai Zhang, Fred Zhangzhi Peng, Yiheng Zhang, Jin Pan, Grigorios G. Chrysos

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Duke University(杜克大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 纠正扩散语言模型通过明确监督可见错误token,实现判别性置信度和针对性细化,显著提升代码修订和并行解码任务性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20966 2026-01-30 cs.RO cs.AI 83%

Parallels Between VLA Model Post-Training and Human Motor Learning: Progress, Challenges, and Trends

VLA模型后训练与人类运动学习的类比:进展、挑战与趋势

Tian-Yu Xiang, Ao-Qun Jin, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Sheng-Bin Duan, Fu-Chao Xie, Wen-Kai Wang, Si-Cheng Wang, Ling-Yun Li, Tian Tu, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Grainger College of Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院) CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) Joint Laboratory of Intelligence Science and Technology, Institute of Systems Engineering, Macau University of Science and Technology(澳门科技大学系统工程学院智能科学与技术联合实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文从人类运动学习角度综述了VLA模型后训练的进展、挑战与趋势,提出四类后训练方法并探讨了其在机器人操作中的应用与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21268 2026-01-30 cs.NE 82%

Reinforcement Learning from Meta-Evaluation: Aligning Language Models Without Ground-Truth Labels

基于元评估的强化学习:无需真实标签对齐语言模型

Micah Rentschler, Jesse Roberts

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 本研究提出RLME方法,通过元评估生成奖励,实现无需真实标签的LLM训练,提升准确性和样本效率,支持多目标权衡与可靠推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23596 2026-01-30 cs.CL 77%

Think Twice: Branch-and-Rethink Reasoning Reward Model

再思两次:分支与再思考推理奖励模型

Yizhu Jiao, Jiaqi Zeng, Julien Veron Vialard, Oleksii Kuchaiev, Jiawei Han, Olivier Delalleau

机构 * NVIDIA(NVIDIA公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 BR-RM通过两轮次的分支与再思考机制,改进奖励模型的判断准确性与敏感性,实现更精确的推理能力。

Comments Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01027 2026-01-30 cs.LG 77%

DBellQuant: Breaking the Bell with Double-Bell Transformation for LLMs Post Training Binarization

DBellQuant: 通过双铃变换打破贝尔限制以实现LLMs预训练后二值化

Zijian Ye, Wei Huang, Yifei Yu, Tianhe Ren, Zhongrui Wang, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 DBellQuant通过双铃变换实现LLMs预训练后量化,显著提升压缩性能与模型效果。

Comments 19 pages; Appendix added

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18531 2026-01-30 eess.AS cs.AI cs.CL cs.SD 62%

No Verifiable Reward for Prosody: Toward Preference-Guided Prosody Learning in TTS

无可验证的语调奖励:迈向基于偏好的语调学习在TTS中

Seungyoun Shin, Dongha Ahn, Jiwoo Kim, Sungwook Jeon

机构 * Channel Corporation(Channel公司) Kernelspace(Kernelspace公司) Sungkyunkwan University(成均馆大学) NAVER Cloud(NAVER云公司)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于人类偏好的语调优化方法,在KoCC-TTS数据集上实现了更高的语音偏好评分和更优的CER表现,优于传统GRPO方法。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17850 2026-01-30 cs.LG cs.AI 62%

GEPO: Group Expectation Policy Optimization for Stable Heterogeneous Reinforcement Learning

GEPO:用于稳定异构强化学习的群体期望策略优化

Han Zhang, Ruibin Zheng, Zexuan Yi, Zhuo Zhang, Hanyang Peng, Hui Wang, Zike Yuan, Cai Ke, Shiwei Chen, Jiacheng Yang, Yangning Li, Xiang Li, Jiangyue Yan, Yaoqi Liu, Liwen Jing, Jiayin Qi, Ruifeng Xu, Binxing Fang, Yue Yu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 GEPO通过解耦参数学习与回放采样,提升去中心化异构强化学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21985 2026-01-30 cs.LG 57%

Elign: Equivariant Diffusion Model Alignment from Foundational Machine Learning Force Fields

Elign:从基础机器学习力场中等效扩散模型对齐

Yunyang Li, Lin Huang, Luojia Xia, Wenhe Zhang, Mark Gerstein

机构 * Department of Computer Science, Yale University, New Haven, USA(计算机科学系,耶鲁大学,新 Haven,USA) Program in Computational Biology and Biomedical Informatics, Yale University, New Haven, USA(计算生物学与生物医学信息学项目,耶鲁大学,新 Haven,USA) IQuestLab

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 Elign通过结合基础机器学习力场和强化学习优化,实现了等效扩散模型的对齐,提升分子构象生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21943 2026-01-30 cs.LG cs.IT math.IT 57%

Entropy-Based Dimension-Free Convergence and Loss-Adaptive Schedules for Diffusion Models

基于熵的无维度收敛和损失自适应调度方法用于扩散模型

Ahmad Aghapour, Erhan Bayraktar, Ziqing Zhang

机构 * Department of Mathematics, University of Michigan(数学系,密歇根大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出基于熵的无维度收敛方法和损失自适应调度,通过信息论方法提升扩散模型的采样效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11144 2026-01-30 cs.IR cs.AI 57%

Deep GraphRAG: A Balanced Approach to Hierarchical Retrieval and Adaptive Integration

深度图RAG:一种面向层次检索与自适应整合的平衡方法

Yuejie Li, Ke Yang, Tao Wang, Bolin Chen, Bowen Li, Chengjun Mao

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 Deep GraphRAG通过分层检索与自适应整合方法,在效率与全面性之间取得平衡,利用动态奖励机制提升知识整合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 6 篇

2601.21744 2026-01-30 cs.CL 88%

Temporal Guidance for Large Language Models

时间指导用于大语言模型

Hong-Kai Zheng, Piji Li

机构 * College of Artificial Intelligence, MIIT Key Laboratory of Pattern Analysis(人工智能学院,模式分析与机器智能关键实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, Nanjing University of Aeronautics(脑机智能技术关键实验室,教育部,南京航空航天大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出时间指导策略,通过多令牌预测和轻量级投影器提升大语言模型生成质量,同时保持低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21545 2026-01-30 cs.AI cs.CL 86%

ShardMemo: Masked MoE Routing for Sharded Agentic LLM Memory

ShardMemo: 用于分片代理LLM内存的遮蔽MoE路由

Yang Zhao, Chengxiao Dai, Yue Xiu, Mengying Kou, Yuliang Zheng, Dusit Niyato

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ShardMemo通过遮蔽MoE路由优化分片代理LLM内存,提升F1分数并减少检索工作和延迟

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00570 2026-01-30 cs.CL cs.AI 73%

FreqKV: Key-Value Compression in Frequency Domain for Context Window Extension

FreqKV: 频域中的键值压缩用于上下文窗口扩展

Jushi Kai, Yixuan Wang, Boyi Zeng, Haoli Bai, Bo Jiang, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab, Shanghai Jiao Tong University(上海交通大学LUMIA实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FreqKV通过频域键值压缩技术,实现长上下文处理,使LLaMA-2-7B的上下文窗口扩展至256K个令牌,同时保持稳定的困惑度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22716 2026-01-30 cs.AI cs.CV cs.LG 73%

Memento 2: Learning by Stateful Reflective Memory

Memento 2: 通过状态化反思记忆进行学习

Jun Wang

机构 * UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Memento 2通过状态化反思记忆机制,实现无需参数更新的持续学习,提升代理在开放任务中的泛化能力。

Comments 35 pages, four figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21609 2026-01-30 cs.AI 70%

RecNet: Self-Evolving Preference Propagation for Agentic Recommender Systems

RecNet: 为代理推荐系统设计的自进化偏好传播

Bingqian Li, Xiaolei Wang, Junyi Li, Weitao Li, Long Zhang, Sheng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * GSAI, Renmin University of China(清华大学) Department of Data Science, City University of Hong Kong(城市大学数据科学系)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RecNet通过自进化机制实现代理推荐系统的实时偏好传播,利用路由代理和反馈驱动优化提升偏好传播的准确性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01774 2026-01-30 cs.CV 50%

Evaluating SAM2 for Video Semantic Segmentation

评估SAM2用于视频语义分割

Syed Hesham Syed Ariff, Yun Liu, Guolei Sun, Jing Yang, Henghui Ding, Xue Geng, Xudong Jiang

机构 * School of EEE(电子工程系) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research(信息通信研究所) A*STAR College of Computer Science(计算机科学学院) Nankai University(南开大学) State Key Laboratory of Public Big Data(公共大数据国家重点实验室) Guizhou University(贵州大学) Fudan Vision and Learning Lab(复旦大学视觉与学习实验室)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文评估了SAM2在视频语义分割中的应用,通过两种方法提升分割性能,利用SAM2的精确边界预测增强整体效果。

Comments 17 pages, 3 figures and 7 tables

Journal ref Machine Intelligence Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 36 篇

2601.21212 2026-01-30 cs.AI cs.CY 89%

Intelli-Planner: Towards Customized Urban Planning via Large Language Model Empowered Reinforcement Learning

Intelli-Planner: 通过大型语言模型赋能的强化学习实现定制化城市规划

Xixian Yong, Peilin Sun, Zihe Wang, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence\ University of China Beijing China Gaoling School of Artificial Intelligence\ University of China

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Intelli-Planner通过结合深度强化学习与大型语言模型,实现定制化城市规划,提升规划方案的参与度和满意度。

Comments The Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21181 2026-01-30 cs.AI 88%

MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models

MAD:用于减轻多模态大语言模型中跨模态幻觉的模态自适应解码

Sangyun Chung, Se Yeon Kim, Youngchae Chee, Yong Man Ro

机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国科学技术院集成视觉语言实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 MAD通过自适应加权对比解码分支,有效减少多模态大语言模型中的跨模态幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21210 2026-01-30 cs.AI 85%

Uncovering Hidden Correctness in LLM Causal Reasoning via Symbolic Verification

通过符号验证揭示LLM因果推理中的隐藏正确性

Paul He, Yinya Huang, Mrinmaya Sachan, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DoVerifier,通过符号验证揭示LLM因果推理中的隐藏正确性,提升因果推理评估的严谨性与信息量。

Comments EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21113 2026-01-30 cs.AI cs.MA 85%

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

计划-审核双胞胎:基于FHIR的LLM计划、指南回忆、可选缓存和自我改进的代理出院计划

Kaiyuan Wu, Aditya Nagori, Rishikesan Kamaleswaran

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 基于FHIR的LLM计划与审核框架,通过自我改进和缓存优化,提升临床出院计划的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20090 2026-01-30 cs.AI 85%

Should I Have Expressed a Different Intent? Counterfactual Generation for LLM-Based Autonomous Control

我本应表达不同的意图?基于LLM的自主控制的反事实生成

Amirmohammad Farzaneh, Salvatore D'Oro, Osvaldo Simeone

机构 * Department of Engineering, King's College London, London, UK(伦敦大学金史密斯学院工程系) Intelligent Networked Systems Institute (INSI), Northeastern University, Boston, MA, USA(东北大学智能网络系统研究所) Intelligent Networked Systems Institute (INSI), Northeastern University, London, UK(伦敦大学东北大学智能网络系统研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于结构因果模型的反事实生成方法,通过概率性反事实生成和离线校准,为LLM驱动的自主控制提供可靠反事实推理,展示了在无线网络控制中的显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19510 2026-01-30 cs.RO cs.CL 85%

ALRM: Agentic LLM for Robotic Manipulation

ALRM:用于机器人操作的代理LLM

Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ALRM提出了一种基于LLM的代理框架,通过ReAct推理循环实现机器人操作的模块化执行,支持代码生成和工具规划模式,实验表明其在多步骤推理和语言多样性任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21876 2026-01-30 cs.RO 85%

LLM-Driven Scenario-Aware Planning for Autonomous Driving

基于大语言模型的场景感知规划用于自动驾驶

He Li, Zhaowei Chen, Rui Gao, Guoliang Li, Qi Hao, Shuai Wang, Chengzhong Xu

机构 * University of Macau(澳门大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Southern University of Science and Technology(南方科技大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LAP,一种基于大语言模型的自适应规划方法,通过场景理解与联合优化实现自动驾驶中的高速与精确驾驶平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09101 2026-01-30 cs.HC 85%

A Survey of LLM Alignment: Instruction Understanding, Intention Reasoning, and Reliable Generation

大型语言模型对齐综述:指令理解、意图推理和可靠生成

Zongyu Chang, Feihong Lu, Ziqin Zhu, Qian Li, Cheng Ji, Tao Yang, Zhuo Chen, Hao Peng, Yang Liu, Ruifeng Xu, Yangqiu Song, Jianxin Li, Shangguang Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了大型语言模型在指令理解、意图推理和可靠生成方面的挑战与解决方案,旨在提升模型在现实应用中的可靠性与适应性。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01203 2026-01-30 cs.SI 85%

HetGCoT: Heterogeneous Graph-Enhanced Chain-of-Thought LLM Reasoning for Academic Question Answering

HetGCoT:异构图增强的链式思考LLM推理用于学术问答

Runsong Jia, Mengjia Wu, Ying Ding, Jie Lu, Yi Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 HetGCoT通过异构图增强链式思考LLM推理,提升学术问答的可解释性和准确性。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏