arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-19 至 2026-02-19 共收录 181 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 11 篇

2602.05298 2026-02-19 stat.ML cs.LG math.OC 79%

Logarithmic-time Schedules for Scaling Language Models with Momentum

用于大规模语言模型的对数时间调度

Damien Ferbach, Courtney Paquette, Gauthier Gidel, Katie Everett, Elliot Paquette

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.LG

AI总结 ADANA通过引入对数时间调度和阻尼机制,在大规模语言模型训练中提升性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07274 2026-02-19 cs.LG cs.AI 79%

Forget Forgetting: Continual Learning in a World of Abundant Memory

遗忘遗忘:在充足记忆世界中的持续学习

Dongkyu Cho, Taesup Moon, Rumi Chunara, Kyunghyun Cho, Sungmin Cha

机构 * New York University(纽约大学) Seoul National University(首尔国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种轻量级方法,通过权重空间巩固在充足内存环境下提升持续学习性能,挑战传统假设并提供低计算成本的替代方案。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16534 2026-02-19 cs.CR cs.AI 77%

Targeting Alignment: Extracting Safety Classifiers of Aligned LLMs

针对对齐:提取对齐LLM的安全分类器

Jean-Charles Noirot Ferrand, Yohan Beugin, Eric Pauley, Ryan Sheatsley, Patrick McDaniel

机构 * 2 Department of Computer Science Virginia Tech Blacksburg, VA, USA

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种提取对齐LLM安全分类器的方法,通过构建候选分类器并评估其在对抗性攻击中的有效性,展示了替代分类器在提高攻击成功率方面的优势。

Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14299 2026-02-19 cs.CL cs.AI cs.CY 73%

Does Socialization Emerge in AI Agent Society? A Case Study of Moltbook

人工智能代理社会中社会化是否会出现?Moltbook案例研究

Ming Li, Xirui Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Moltbook研究揭示AI代理社会在规模和交互密度下难以形成稳定结构和共识,表明社会化需要更复杂的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16704 2026-02-19 cs.CL 70%

Reinforced Fast Weights with Next-Sequence Prediction

增强型快速权重与下序列预测

Hee Seung Hwang, Xindi Wu, Sanghyuk Chun, Olga Russakovsky

专题命中 长上下文与记忆 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 REFINE通过强化学习框架在下序列预测目标下训练快速权重模型,提升长上下文建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06051 2026-02-19 cs.CL 57%

CAST: Character-and-Scene Episodic Memory for Agents

CAST:基于角色和场景的事件记忆用于智能体

Kexin Ma, Bojun Li, Yuhua Tang, Liting Sun, Ruochun Jin

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 CAST通过构建3D场景和角色档案,结合图结构语义记忆,提升智能体对连贯事件的回忆能力,实验结果显示在多个数据集上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15927 2026-02-19 cs.CV cs.LG 57%

Visual Memory Injection Attacks for Multi-Turn Conversations

多轮对话中的视觉记忆注入攻击

Christian Schlarmann, Matthias Hein

机构 * Tübingen AI Center, University of Tübingen, Germany(图宾根人工智能中心,图宾根大学,德国)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出一种多轮对话中的视觉记忆注入攻击,通过操控用户输入实现隐蔽的信息操控,展示了对大视觉-语言模型的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15010 2026-02-19 cs.RO cs.LG 57%

BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

BPP: 通过聚焦关键历史帧实现长上下文机器人模仿学习

Max Sobol Mark, Jacky Liang, Maria Attarian, Chuyuan Fu, Debidatta Dwibedi, Dhruv Shah, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 BPP通过聚焦关键历史帧,提升机器人模仿学习在长上下文任务中的表现,成功率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16493 2026-02-19 cs.CV 50%

MMA: Multimodal Memory Agent

MMA:多模态记忆代理

Yihao Lu, Wanru Cheng, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 33 篇

2602.15867 2026-02-19 cs.CL cs.AI 90%

Playing With AI: How Do State-Of-The-Art Large Language Models Perform in the 1977 Text-Based Adventure Game Zork?

玩转AI:当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现如何?

Berry Gerrits

机构 * University of Twente(特文特大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现,发现其在问题解决和推理能力上存在显著局限。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15858 2026-02-19 cs.CL cs.AI 88%

State Design Matters: How Representations Shape Dynamic Reasoning in Large Language Models

状态设计至关重要:表示如何塑造大语言模型中的动态推理

Annie Wong, Aske Plaat, Thomas Bäck, Niki van Stein, Anna V. Kononova

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型中状态表示设计对动态推理的影响,发现自然语言表示和空间编码对性能至关重要,但长期任务仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16105 2026-02-19 cs.AI 88%

GPSBench: Do Large Language Models Understand GPS Coordinates?

GPSBench: 大型语言模型是否理解GPS坐标?

Thinh Hung Truong, Jey Han Lau, Jianzhong Qi

机构 * University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 GPSBench通过评估14种LLMs在地理空间推理中的表现,揭示了其在GPS坐标理解和现实地理推理上的挑战与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15863 2026-02-19 cs.CL cs.AI 88%

Not the Example, but the Process: How Self-Generated Examples Enhance LLM Reasoning

不是例子,而是过程:如何自动生成的例子增强LLM推理

Daehoon Gwak, Minseo Jung, Junwoo Park, Minho Park, ChaeHun Park, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过对比不同提示策略,发现自动生成例子的过程增强了LLM推理性能,而非例子本身。

Comments Presented at AACL-IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13912 2026-02-19 cs.AI cs.CL cs.GR 84%

From Pixels to Policies: Reinforcing Spatial Reasoning in Language Models for Content-Aware Layout Design

从像素到政策:为内容感知布局设计增强语言模型的空间推理能力

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen

机构 * Virginia Tech(弗吉尼亚理工学院) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 LaySPA通过强化学习框架增强语言模型的空间推理能力,实现内容感知布局设计,提升布局结构有效性与视觉质量,同时减少标注样本需求和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15194 2026-02-19 cs.LG cs.CL 84%

Evolving Language Models without Labels: Majority Drives Selection, Novelty Promotes Variation

无需标签的进化语言模型:多数驱动选择,新颖性促进变异

Yujun Zhou, Zhenwen Liang, Haolin Liu, Wenhao Yu, Kishan Panaganti, Linfeng Song, Dian Yu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(圣母大学) University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 EVOL-RL通过结合多数稳定性与新颖性探索,实现无需标签的自我改进语言模型,提升推理能力和领域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24157 2026-02-19 cs.LG cs.AI 82%

Experience-based Knowledge Correction for Robust Planning in Minecraft

基于经验的知识修正以实现Minecraft中的鲁棒规划

Seungjoon Lee, Suhwan Kim, Minhyeon Oh, Youngsik Yoon, Jungseul Ok

机构 * Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 XENON通过经验修正知识,提升Minecraft中的鲁棒规划能力,优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18825 2026-02-19 cs.AI cs.CL cs.GT 81%

EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agents

EconEvals: 用于LLM代理经济决策的基准测试和litmus测试

Sara Fish, Julia Shephard, Minkai Li, Ran I. Shorrer, Yannai A. Gonczarowski

机构 * Harvard University(哈佛大学) Penn State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 EconEvals提出了一种用于评估LLM经济决策能力的基准测试和litmus测试框架,通过多个冲突目标任务量化LLM的权衡响应和可靠性,为经济决策中的LLM评估提供了新方法。

Comments v3 was a major revision with updated experiments and analysis; v4 consists of minor edits

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15896 2026-02-19 cs.CL 79%

Every Little Helps: Building Knowledge Graph Foundation Model with Fine-grained Transferable Multi-modal Tokens

每一点帮助都有价值:通过细粒度可迁移多模态标记构建知识图谱基础模型

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University, Zhejiang, China(浙江大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL

AI总结 本文提出TOFU模型,通过细粒度可迁移多模态标记提升多模态知识图谱推理的跨图谱迁移能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18318 2026-02-19 cs.AI 79%

Earth AI: Unlocking Geospatial Insights with Foundation Models and Cross-Modal Reasoning

Earth AI:利用基础模型和跨模态推理解锁地理空间洞察

Aaron Bell, Amit Aides, Amr Helmy, Arbaaz Muslim, Aviad Barzilai, Aviv Slobodkin, Bolous Jaber, David Schottlander, George Leifman, Joydeep Paul, Mimi Sun, Nadav Sherman, Natalie Williams, Per Bjornsson, Roy Lee, Ruth Alcantara, Thomas Turnbull, Tomer Shekel, Vered Silverman, Yotam Gigi, Adam Boulanger, Alex Ottenwess, Ali Ahmadalipour, Anna Carter, Behzad Vahedi, Charles Elliott, David Andre, Elad Aharoni, Gia Jung, Hassler Thurston, Jacob Bien, Jamie McPike, Jessica Sapick, Juliet Rothenberg, Kartik Hegde, Kel Markert, Kim Philipp Jablonski, Luc Houriez, Monica Bharel, Phing VanLee, Reuven Sayag, Sebastian Pilarski, Shelley Cazares, Shlomi Pasternak, Siduo Jiang, Thomas Colthurst, Yang Chen, Yehonathan Refael, Yochai Blau, Yuval Carny, Yael Maguire, Avinatan Hassidim, James Manyika, Tim Thelin, Genady Beryozkin, Gautam Prasad, Luke Barrington, Yossi Matias, Niv Efron, Shravya Shetty

机构 * Google Research(谷歌研究) Google X(谷歌X) Google Cloud(谷歌云)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 Earth AI通过基础模型和跨模态推理,提升地理空间数据分析能力,实现对地球的深入洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16154 2026-02-19 cs.CL cs.AI 79%

Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution

通过多听众软执行平衡忠实与性能

Nithin Sivakumaran, Shoubin Yu, Hyunji Lee, Yue Zhang, Ali Payani, Mohit Bansal, Elias Stengel-Eskin

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 REMUL通过多听众强化学习方法提升推理忠实性与性能,改进多个基准的忠实性指标和准确性。

Comments Code: https://github.com/nsivaku/remul

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15843 2026-02-19 cs.CL cs.AI 77%

The Perplexity Paradox: Why Code Compresses Better Than Math in LLM Prompts

困惑性悖论:为什么代码在LLM提示中比数学压缩得更好

Warren Johnson

机构 * Bona Opera Studios(博纳歌剧工作室)

专题命中 推理与问题求解 :LLM(title,comments);分类 cs.CL、cs.AI

AI总结 本文揭示代码在LLM提示中比数学压缩更有效的原因,并提出TAAC算法实现更高效的压缩。

Comments 19 pages, 5 figures, 4 tables. Second paper in TAAC research series. Code and data at https://github.com/micoverde/taac-llm-compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16671 2026-02-19 cs.SE cs.AI 77%

SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation

SPARC:面向自动化C单元测试生成的场景规划与推理

Jaid Monwar Chowdhury, Chi-An Fu, Reyhaneh Jabbarvand

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) National Taiwan University(台湾国立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPARC通过神经符号方法和场景规划,提升C语言单元测试生成的覆盖率和代码质量,显著优于传统方法。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15864 2026-02-19 cs.RO cs.CV 75%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16488 2026-02-19 cs.CL cs.AI 73%

Learning to Learn from Language Feedback with Social Meta-Learning

通过社会元学习学习语言反馈

Jonathan Cook, Diego Antognini, Martin Klissarov, Claudiu Musat, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过社会元学习方法,使大型语言模型在对话中更有效地学习和利用语言反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10992 2026-02-19 cs.LG cs.NI 70%

ReaCritic: Reasoning Transformer-based DRL Critic-model Scaling For Wireless Networks

ReaCritic: 基于推理的变压器DRL批评模型扩展用于无线网络

Feiran You, Hongyang Du

机构 * Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ReaCritic通过引入基于推理的变压器结构,提升DRL在无线网络中的适应性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16066 2026-02-19 cs.AI 70%

Improving Interactive In-Context Learning from Natural Language Feedback

通过自然语言反馈提升交互式上下文学习

Martin Klissarov, Jonathan Cook, Diego Antognini, Hao Sun, Jingling Li, Natasha Jaques, Claudiu Musat, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种框架,通过自然语言反馈提升模型交互式上下文学习能力,使模型在多轮交互中表现更优,并具备自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15918 2026-02-19 cs.CV cs.AI 70%

EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery

EarthSpatialBench: 多模态大语言模型在地球影像上空间推理能力的基准测试

Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang

机构 * University of Florida(佛罗里达大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EarthSpatialBench是一个用于评估多模态大语言模型在地球影像上空间推理能力的综合基准测试,涵盖空间距离、方向、拓扑关系及复杂几何查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15898 2026-02-19 cs.CL 70%

MultiCube-RAG for Multi-hop Question Answering

多跳问答的MultiCube-RAG

Jimeng Shi, Wei Hu, Runchu Tian, Bowen Jin, Wonbin Kweon, SeongKu Kang, Yunfan Kang, Dingqi Ye, Sizhe Zhou, Shaowen Wang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(韩国大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MultiCube-RAG通过多维立方体结构实现多跳问答的高效推理与检索,提升响应准确率并增强可解释性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15870 2026-02-19 cs.CL 70%

VDLM: Variable Diffusion LMs via Robust Latent-to-Text Rendering

VDLM: 通过鲁棒的潜在到文本渲染实现变量扩散语言模型

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 VDLM通过分离语义规划与文本渲染,利用嵌入空间后训练和鲁棒解码技术,在扩散语言模型中实现更高效的多步推理和长形式生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15857 2026-02-19 cs.CL 70%

Multi-source Heterogeneous Public Opinion Analysis via Collaborative Reasoning and Adaptive Fusion: A Systematically Integrated Approach

通过协同推理与自适应融合进行多源异构公共意见分析:一种系统整合方法

Yi Liu

机构 * Yi Liu School of Software Xi’an Jiaotong University(刘毅 软件学院 西安交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CRAF框架,通过协同推理与自适应融合整合传统方法与LLMs,提升多源异构公共意见分析的跨平台适应性与性能

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏