arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-06 至 2026-02-06 共收录 201 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2602.05890 2026-02-06 cs.LG cs.CL 88%

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO:通过分布流扩展价值建模以实现鲁棒且可泛化的LLM后训练

Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 DFPO通过分布流扩展价值建模,提升LLM后训练的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00166 2026-02-06 cs.LG cs.AI 88%

Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints

带有预算约束的本地语言模型与云卸载决策的联合持续学习

Evan Chen, Wenzhi Fang, Shiqiang Wang, Christopher Brinton

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University, West Lafayette, IN(电子与计算机工程学院,普渡大学) Department of Computer Science, University of Exeter, UK(计算机科学系,埃克塞特大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);small language model(abstract);post-training(abstract)

AI总结 本文提出DA-GRPO方法,通过联合学习本地语言模型和云卸载决策,有效解决持续学习中的预算约束问题,提升任务准确性并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05933 2026-02-06 cs.LG 84%

Approximation of Log-Partition Function in Policy Mirror Descent Induces Implicit Regularization for LLM Post-Training

在策略镜像下降中近似对数分区函数诱导隐式正则化以提升LLM训练

Zhenghao Xu, Qin Lu, Changlong Yu, Tuo Zhao

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);分类 cs.LG

AI总结 PMD-mean通过近似对数分区函数实现隐式正则化,提升LLM训练的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05113 2026-02-06 cs.AI cs.LG 84%

Democratic Preference Alignment via Sortition-Weighted RLHF

通过排序加权RLHF实现民主偏好对齐

Suvadip Sana, Jinzhou Wu, Martin T. Wells

机构 * cornell(康奈尔大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 DemPO通过算法排序机制优化偏好对齐,确保民主代表性,提升模型对代表性公众价值观的反映能力。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 84%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05910 2026-02-06 cs.LG 83%

Chunky Post-Training: Data Driven Failures of Generalization

块状后训练:数据驱动的泛化失败

Seoirse Murray, Allison Qi, Timothy Qian, John Schulman, Collin Burns, Sara Price

机构 * Thinking Machines Lab(思维机器实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究发现大语言模型在后训练过程中因数据块的不平衡或不明确导致泛化失败,提出SURF和TURF工具用于检测和追溯这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13579 2026-02-06 cs.LG cs.AI 82%

Learning to summarize user information for personalized reinforcement learning from human feedback

学习总结用户信息以实现基于人类反馈的个性化强化学习

Hyunji Nam, Yanming Wan, Mickel Liu, Peter Ahnn, Jianxun Lian, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) DoorDash Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 PLUS通过学习用户信息摘要实现个性化强化学习,提升奖励模型准确性并实现零样本个性化。

Comments 10 pages for main text, 10 pages for appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11298 2026-02-06 cs.LG cs.AI cs.CL 82%

When Are Two RLHF Objectives the Same?

何时两个强化学习中的偏好优化目标是相同的?

Madhava Gaikwad

专题命中 后训练与偏好优化 :RLHF(title);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Opal算法,用于判断强化学习中不同偏好优化目标是否等价,揭示多数常用方法实际优化相同目标,部分方法则存在本质差异。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05125 2026-02-06 cs.LG cs.AI 81%

Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks

重新思考评估标准生成以改进LLM评判与开放任务的奖励建模

William F. Shen, Xinchi Qiu, Chenxi Whitehouse, Lisa Alazraki, Shashwat Goel, Francesco Barbieri, Timon Willi, Akhil Mathur, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 RRD通过递归分解-过滤循环优化评估标准,提升LLM评判准确性和奖励建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04349 2026-02-06 cs.CL cs.AI 79%

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

GTPO和GRPO-S:基于策略熵的token和序列级奖励塑造

Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTPO和GRPO-S两种算法,通过引入熵权机制实现token和序列级的细粒度奖励塑造,提升大型语言模型在长链推理任务中的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04912 2026-02-06 cs.IR cs.CL cs.LG 79%

Atomic Information Flow: A Network Flow Model for Tool Attributions in RAG Systems

原子信息流:一种用于RAG系统工具归因的网络流模型

James Gao, Josh Zhou, Qi Sun, Ryan Huang, Steven Yoo

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 原子信息流通过分解工具输出和LLM调用为原子单元,提升RAG系统中工具归因的准确性和上下文压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05261 2026-02-06 cs.CL 70%

Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR

长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化

Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 14 篇

2602.05430 2026-02-06 cs.AI cs.LG 81%

Day-Ahead Electricity Price Forecasting for Volatile Markets Using Foundation Models with Regularization Strategy

利用正则化策略的基础模型进行日提前电力价格预测

Kritchanat Ponyuenyong, Pengyu Tu, Jia Wei Tan, Wei Soon Cheong, Jamie Ng Suat Ling, Lianlian Jiang

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种正则化策略,利用基础模型在波动市场中提升电力价格预测的准确性。

Comments Accepted to AI4TS Workshop @ AAAI'26 (Oral and Poster), see https://ai4ts.github.io/aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11007 2026-02-06 cs.CV cs.AI cs.LG 81%

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15075 2026-02-06 cs.AI cs.CL 79%

The Why Behind the Action: Unveiling Internal Drivers via Agentic Attribution

行动背后的缘由:通过代理归因揭示内部驱动因素

Chen Qian, Peng Wang, Dongrui Liu, Junyao Yang, Dadi Guo, Ling Tang, Jilin Mei, Qihan Ren, Shuai Shao, Yong Liu, Jie Fu, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通用代理归因框架,通过分层方法识别代理行为的内部驱动因素,提升代理系统的安全性和可问责性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05665 2026-02-06 cs.AI 77%

Graph-based Agent Memory: Taxonomy, Techniques, and Applications

基于图的智能体记忆:分类、技术与应用

Chang Yang, Chuang Zhou, Yilin Xiao, Su Dong, Luyao Zhuang, Yujing Zhang, Zhu Wang, Zijin Hong, Zheng Yuan, Zhishang Xiang, Shengyuan Chen, Huachi Zhou, Qinggang Zhang, Ninghao Liu, Jinsong Su, Xinrun Wang, Yi Chang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) School of Information(信息学院) Xiamen University(厦门大学) School of Computing and Information Systems(计算与信息学院) Singapore Management University(新加坡国立管理学院) School of Artificial Intelligence(人工智能学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统综述了基于图的智能体记忆,涵盖分类、关键技术、应用及挑战,旨在推动更高效可靠的图基智能体记忆系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05524 2026-02-06 cs.MA cs.AI 77%

AI Agent Systems for Supply Chains: Structured Decision Prompts and Memory Retrieval

供应链中的AI代理系统:结构化决策提示与记忆检索

Konosuke Yoshizato, Kazuma Shimizu, Ryota Higa, Takanobu Otsuka

机构 * National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Nagoya Institute of Technology(名古屋技术大学) NEC Corporation(日本电讯公司)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AIM-RM代理,通过相似性匹配提升基于LLM的多代理系统在供应链中的适应性和鲁棒性。

Comments A full version of the extended abstract accepted by the 25th International Conference on Autonomous Agents and Multiagent Systems(AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20900 2026-02-06 cs.CL 77%

Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization

通过学习提问来学习总结:对抗性代理协作用于长文档摘要

Weixuan Wang, Minghao Wu, Barry Haddow, Alexandra Birch

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SummQ通过对抗性代理协作提升长文档摘要质量,利用生成和评审代理以及问题生成机制实现摘要的迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05258 2026-02-06 cs.CL cs.AI cs.LG 75%

CoPE: Clipped RoPE as A Scalable Free Lunch for Long Context LLMs

CoPE:剪裁RoPE作为长上下文LLM的可扩展免费午餐

Haoran Li, Sucheng Ren, Alan Yuille, Feng Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoPE通过软剪裁RoPE的低频成分,有效提升长上下文LLM的性能,实现可扩展的免费午餐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05191 2026-02-06 cs.LG cs.AI 73%

Double-P: Hierarchical Top-P Sparse Attention for Long-Context LLMs

Double-P: 分层Top-P稀疏注意力机制用于长上下文LLM

Wentao Ni, Kangqi Zhang, Zhongming Yu, Oren Nelson, Mingu Lee, Hong Cai, Fatih Porikli, Jongryool Kim, Zhijian Liu, Jishen Zhao

机构 * ucsd(加州大学圣迭戈分校) umich(密歇根大学) qualcomm(高通AI研究) nvidia

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Double-P通过分层Top-P稀疏注意力机制,优化长上下文LLM的解码效率,实现更高的准确性和更快的处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05004 2026-02-06 cs.CL cs.AI 73%

CoWork-X: Experience-Optimized Co-Evolution for Multi-Agent Collaboration System

CoWork-X:面向多智能体协作系统的经验优化共进化

Zexin Lin, Jiachen Yu, Haoyang Zhang, Yuzhao Li, Zhonghang Li, Yujiu Yang, Junjie Wang, Xiaoqiang Ji

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Tsinghua University(清华大学) AutoGame Research(AutoGame研究) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CoWork-X通过主动共进化框架,优化多智能体协作系统的实时协调与多轮适应,实现稳定性能提升和降低延迟与令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05853 2026-02-06 cs.CL 70%

RRAttention: Dynamic Block Sparse Attention via Per-Head Round-Robin Shifts for Long-Context Inference

RRAttention: 通过每头轮换位移实现动态块稀疏注意力以支持长上下文推理

Siran Liu, Guoxia Wang, Sa Wang, Jinle Zeng, HaoYang Xie, Siyu Lou, JiaBin Yang, DianHai Yu, Haifeng Wang, Chao Yang

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RRAttention通过轮换位移策略实现动态块稀疏注意力,提升长上下文推理效率,实现99%的完整注意力性能和2.4倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05366 2026-02-06 cs.IR cs.CL 70%

Multi-Field Tool Retrieval

多领域工具检索

Yichen Tang, Weihang Su, Yiqun Liu, Qingyao Ai

机构 * DCST, Tsinghua University(清华大学北京研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多领域工具检索框架,通过细粒度多字段建模解决工具检索中的文档不完整、语义不匹配和多方面效用问题,实现更高效的任务解决。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05758 2026-02-06 cs.CL 57%

LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards

LongR: 通过密集效用奖励的强化学习解锁长上下文推理

Bowen Ping, Zijun Chen, Yiyao Yu, Tingfeng Hui, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 LongR通过整合动态'思考与阅读'机制和上下文密度奖励,提升长上下文推理性能,在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05085 2026-02-06 cs.CL 57%

Locas: Your Models are Principled Initializers of Locally-Supported Parametric Memories

Locas: 您的模型是局部支持的参数记忆的原理性初始化器

Sidi Lu, Zhenwen Liang, Dongyang Ma, Yan Wang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯人工智能实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 Locas通过原理化初始化方法,实现参数记忆的高效持续学习,减少灾难性遗忘,提升模型泛化能力。

Comments Tencent AI Lab Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05132 2026-02-06 cs.CV 50%

ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation

ARGaze:用于在线第一人称注视估计的自回归变换器

Jia Li, Wenjie Zhao, Shijian Deng, Bolin Lai, Yuheng Wu, RUijia Chen, Jon E. Froehlich, Yuhang Zhao, Yapeng Tian

机构 * Department of Computer Science, University of Texas at Dallas, Richardson, TX, USA.(德克萨斯大学达拉斯分校计算机科学系) College of Computing, Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院计算机学院) Department of Computer Science, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系) Allen School of Computer Science, University of Washington, USA(华盛顿大学阿伦计算机科学学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 ARGaze通过自回归变换器模型,利用时间连续性提升在线第一人称注视估计的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 38 篇

2602.05385 2026-02-06 cs.CL 89%

IESR:Efficient MCTS-Based Modular Reasoning for Text-to-SQL with Large Language Models

IESR:基于MCTS的高效模块化推理用于文本到SQL with大型语言模型

Tao Liu, Jiafan Lu, Bohan Yu, Pengcheng Wu, Liu Haixin, Guoyu Xu, Li Xiangheng, Lixiao Li, Jiaming Hou, Zhao Shijun, Xinglin Lyu, Kunli Zhang, Yuxiang Jia, Hongyin Zan

机构 * Zhengzhou University(郑州大学) Tianjin University(天津大学) Zhongshan University(中山大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SLM(abstract);分类 cs.CL

AI总结 IESR提出一种基于MCTS的高效模块化推理框架,用于文本到SQL任务,通过信息增强和结构化推理提升复杂查询处理能力。

Comments 25 pages, 16 figures, 8 tables. Hongyin Zan is corresponding author, Jiafan Lu is first co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05279 2026-02-06 cs.AI cs.CR 89%

Hallucination-Resistant Security Planning with a Large Language Model

具备抗幻觉能力的安全规划与大语言模型

Kim Hammar, Tansu Alpcan, Emil Lupu

机构 * The University of Melbourne(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种抗幻觉的安全规划框架,通过迭代循环和上下文学习优化LLM决策,减少恢复时间30%。

Comments Accepted to IEEE/IFIP Network Operations and Management Symposium 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04919 2026-02-06 cs.LG 89%

Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog

逐步压缩大型语言模型以像沸 frog 一样进行推理

Yiran Zhao, Shengyang Zhou, Zijian Wu, Tongyan Hu, Yuhui Xu, Rengan Dou, Kenji Kawaguchi, Shafiq Joty, Junnan Li, Michael Qizhe Shieh

机构 * Salesforce AI Research(Salesforce AI研究部) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21826 2026-02-06 cs.CL 88%

Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models

Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试

Aadi Palnitkar, Mingyang Mao, Nicholas Waytowich, Vinicius G. Goecks, Xiaomin Lin

机构 * University of Maryland, College Park MD, USA(马里兰大学) ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏