arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 299 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2501.18533 2026-02-04 cs.CV cs.CL cs.CR 79%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03085 2026-02-04 cs.CR cs.AI 79%

The Trigger in the Haystack: Extracting and Reconstructing LLM Backdoor Triggers

haystack中的触发器:提取和重建LLM后门触发器

Blake Bullwinkel, Giorgio Severi, Keegan Hines, Amanda Minnich, Ram Shankar Siva Kumar, Yonatan Zunger

机构 * Microsoft, Redmond, Washington, USA(微软)

专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.AI

AI总结 本文提出了一种无需先验知识的LLM后门触发器扫描方法,通过记忆提取和输出分布分析来检测和恢复后门触发器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03103 2026-02-04 cs.CL cs.AI 79%

Task--Specificity Score: Measuring How Much Instructions Really Matter for Supervision

任务特异性分数:衡量指令在监督中的实际重要性

Pritam Kadasi, Abhishek Upperwal, Mayank Singh

机构 * Lingo Research Group, Indian Institute of Technology Gandhinagar(林戈研究组,印度理工学院冈德hinagar分校) Soket AI(Soket人工智能公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 任务特异性分数用于衡量指令在监督学习中的重要性,通过对比真实指令与替代指令来提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03484 2026-02-04 cs.CL 77%

Preferences for Idiomatic Language are Acquired Slowly -- and Forgotten Quickly: A Case Study on Swedish

对习语语言的偏好是缓慢获得的——并且很快被遗忘:一项关于瑞典语的案例研究

Jenny Kunz

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(林雪平大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究发现,语言模型在习语识别能力上发展缓慢且易遗忘,尤其在从英语适应到瑞典语时,机器翻译数据的微调会迅速削弱其对习语的偏好。

Comments Accepted to TACL. Note that the arXiv version is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03645 2026-02-04 cs.LG 70%

Reinforcement Fine-Tuning for History-Aware Dense Retriever in RAG

强化微调用于历史感知密集检索器在RAG中

Yicheng Zhang, Zhen Qin, Zhaomin Wu, Wenqi Zhang, Shuiguang Deng

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过强化学习优化RAG中的检索器,通过引入随机采样和历史状态缓解状态别名问题,提升检索性能。

Comments On going work. Codes are released at https://github.com/zyc140345/HARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22254 2026-02-04 cs.AI 70%

Co-Evolving Agents: Learning from Failures as Hard Negatives

共进化代理:从失败中学习作为困难负例

Yeonsung Jung, Trilok Padhi, Sina Shaham, Dipika Khullar, Joonhyun Jeong, Ninareh Mehrabi, Eunho Yang

机构 * Georgia State University(佐治亚州立大学) Independent Researcher(独立研究者)

专题命中 指令微调 :foundation model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出共进化代理框架,通过辅助失败代理生成困难负例,提升目标代理的决策边界和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19263 2026-02-04 cs.CV 67%

DWIM: Towards Tool-aware Visual Reasoning via Discrepancy-aware Workflow Generation & Instruct-Masking Tuning

DWIM: 向工具感知的视觉推理迈进:通过差异感知的工作流生成与指令遮蔽微调

Fucai Ke, Vijay Kumar B G, Xingjian Leng, Zhixi Cai, Zaid Khan, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi, Manmohan Chandraker

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 DWIM通过差异感知的工作流生成与指令遮蔽微调,提升工具感知的视觉推理性能。

Comments ICCV 2025

Journal ref In Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03445 2026-02-04 cs.AI cs.LG cs.RO 62%

CRL-VLA: Continual Vision-Language-Action Learning

CRL-VLA:持续视觉-语言-动作学习

Qixin Zeng, Shuo Zhang, Hongyin Zhang, Renjie Wang, Han Zhao, Libang Zhao, Runze Li, Donglin Wang, Chao Huang

机构 * University of Southampton, UK(英国南安普顿大学) Westlake University, China(西湖大学)

专题命中 指令微调 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 CRL-VLA通过双批评者架构和目标条件价值公式,实现VLA模型在持续学习中的稳定与可塑性平衡,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03822 2026-02-04 cs.CL 57%

They Said Memes Were Harmless-We Found the Ones That Hurt: Decoding Jokes, Symbols, and Cultural References

他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考

Sahil Tripathi, Gautam Siddharth Kashyap, Mehwish Nasim, Jian Yang, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) The University of Western Australia(西澳大学) Stanford University(斯坦福大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。

Comments Accepted at the The Web Conference 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02615 2026-02-04 cs.CR cs.AI 57%

TinyGuard:A lightweight Byzantine Defense for Resource-Constrained Federated Learning via Statistical Update Fingerprints

TinyGuard:一种轻量级拜占庭防御机制,用于资源受限的联邦学习中的统计更新指纹

Ali Mahdavi, Santa Aghapour, Azadeh Zamanifar, Amirfarhad Farhadi

机构 * Islamic Azad University, Science and Research Branch(伊斯兰 Azad 大学,科学与研究分校) Tarbiat Modares University(塔里比亚特莫达雷斯大学) Iran University of Science and Technology(伊朗科学技术大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 TinyGuard通过统计更新指纹实现轻量级拜占庭防御,保持FedAvg收敛性并有效抵御多种攻击场景。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 13 篇

2504.03622 2026-02-04 cs.CL cs.AI cs.LG 90%

Align to Structure: Aligning Large Language Models with Structural Information

对齐结构:将大型语言模型与结构信息对齐

Zae Myung Kim, Anand Ramachandran, Farideh Tavazoee, Joo-Kyung Kim, Oleg Rokhlenko, Dongyeop Kang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。

Comments Accepted to AAAI 2026 AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02383 2026-02-04 cs.LG 87%

SLIME: Stabilized Likelihood Implicit Margin Enforcement for Preference Optimization

SLIME:偏好优化中的稳定性似然隐边界的隐式约束

Maksim Afanasyev, Illarion Iov

机构 * Floating Point Sigma Lab(浮点数Sigma实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SLIME通过引入稳定性似然隐边界的隐式约束,解决偏好优化中的目标不匹配问题,提升模型生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03806 2026-02-04 cs.LG cs.AI cs.CL cs.SE 80%

Bridging Online and Offline RL: Contextual Bandit Learning for Multi-Turn Code Generation

弥合在线与离线强化学习:多轮代码生成的上下文老虎机学习

Ziru Chen, Dongdong Chen, Ruinan Jin, Yingbin Liang, Yujia Xie, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Cobalt通过结合在线和离线强化学习,提出一种新的上下文老虎机学习方法,用于多轮代码生成任务,显著提升了模型性能并缓解了奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20534 2026-02-04 cs.LG cs.AI cs.CL 80%

Kimi K2: Open Agentic Intelligence

Kimi K2:开放代理智能

Kimi Team, Yifan Bai, Yiping Bao, Y. Charles, Cheng Chen, Guanduo Chen, Haiting Chen, Huarong Chen, Jiahao Chen, Ningxin Chen, Ruijue Chen, Yanru Chen, Yuankun Chen, Yutian Chen, Zhuofu Chen, Jialei Cui, Hao Ding, Mengnan Dong, Angang Du, Chenzhuang Du, Dikang Du, Yulun Du, Yu Fan, Yichen Feng, Kelin Fu, Bofei Gao, Chenxiao Gao, Hongcheng Gao, Peizhong Gao, Tong Gao, Yuyao Ge, Shangyi Geng, Qizheng Gu, Xinran Gu, Longyu Guan, Haiqing Guo, Jianhang Guo, Xiaoru Hao, Tianhong He, Weiran He, Wenyang He, Yunjia He, Chao Hong, Hao Hu, Yangyang Hu, Zhenxing Hu, Weixiao Huang, Zhiqi Huang, Zihao Huang, Tao Jiang, Zhejun Jiang, Xinyi Jin, Yongsheng Kang, Guokun Lai, Cheng Li, Fang Li, Haoyang Li, Ming Li, Wentao Li, Yang Li, Yanhao Li, Yiwei Li, Zhaowei Li, Zheming Li, Hongzhan Lin, Xiaohan Lin, Zongyu Lin, Chengyin Liu, Chenyu Liu, Hongzhang Liu, Jingyuan Liu, Junqi Liu, Liang Liu, Shaowei Liu, T. Y. Liu, Tianwei Liu, Weizhou Liu, Yangyang Liu, Yibo Liu, Yiping Liu, Yue Liu, Zhengying Liu, Enzhe Lu, Haoyu Lu, Lijun Lu, Yashuo Luo, Shengling Ma, Xinyu Ma, Yingwei Ma, Shaoguang Mao, Jie Mei, Xin Men, Yibo Miao, Siyuan Pan, Yebo Peng, Ruoyu Qin, Zeyu Qin, Bowen Qu, Zeyu Shang, Lidong Shi, Shengyuan Shi, Feifan Song, Jianlin Su, Zhengyuan Su, Lin Sui, Xinjie Sun, Flood Sung, Yunpeng Tai, Heyi Tang, Jiawen Tao, Qifeng Teng, Chaoran Tian, Chensi Wang, Dinglu Wang, Feng Wang, Hailong Wang, Haiming Wang, Jianzhou Wang, Jiaxing Wang, Jinhong Wang, Shengjie Wang, Shuyi Wang, Si Wang, Xinyuan Wang, Yao Wang, Yejie Wang, Yiqin Wang, Yuxin Wang, Yuzhi Wang, Zhaoji Wang, Zhengtao Wang, Zhengtao Wang, Zhexu Wang, Chu Wei, Qianqian Wei, Haoning Wu, Wenhao Wu, Xingzhe Wu, Yuxin Wu, Chenjun Xiao, Jin Xie, Xiaotong Xie, Weimin Xiong, Boyu Xu, Jinjing Xu, L. H. Xu, Lin Xu, Suting Xu, Weixin Xu, Xinran Xu, Yangchuan Xu, Ziyao Xu, Jing Xu, Jing Xu, Junjie Yan, Yuzi Yan, Hao Yang, Xiaofei Yang, Yi Yang, Ying Yang, Zhen Yang, Zhilin Yang, Zonghan Yang, Haotian Yao, Xingcheng Yao, Wenjie Ye, Zhuorui Ye, Bohong Yin, Longhui Yu, Enming Yuan, Hongbang Yuan, Mengjie Yuan, Siyu Yuan, Haobing Zhan, Dehao Zhang, Hao Zhang, Wanlu Zhang, Xiaobin Zhang, Yadong Zhang, Yangkun Zhang, Yichi Zhang, Yizhi Zhang, Yongting Zhang, Yu Zhang, Yutao Zhang, Yutong Zhang, Zheng Zhang, Haotian Zhao, Yikai Zhao, Zijia Zhao, Huabin Zheng, Shaojie Zheng, Longguang Zhong, Jianren Zhou, Xinyu Zhou, Zaida Zhou, Jinguo Zhu, Zhen Zhu, Weiyu Zhuang, Xinxing Zu

机构 * Kimi Team(Kimi 团队)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Kimi K2是一款开源大语言模型,通过混合专家架构和MuonClip优化器实现先进代理能力,表现优于现有非思考模型。

Comments tech report of Kimi K2, with minor updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07743 2026-02-04 cs.CL 79%

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment

OpenRubrics: 向奖励建模和大语言模型对齐的可扩展合成 rubric 生成迈进

Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang

机构 * Purdue University(普渡大学) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.CL

AI总结 OpenRubrics 提出了一种基于对比的 rubric 生成方法,通过大规模(提示,rubric)对提升奖励建模和大语言模型对齐的性能。

Comments The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03025 2026-02-04 cs.AI cs.CL 79%

RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents

RC-GRPO:基于奖励的组相对策略优化用于多轮工具调用智能体

Haitian Zhong, Jixiu Zhai, Lei Song, Jiang Bian, Qiang Liu, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所,中国科学院) School of Mathematics and Statistics(数学与统计学学院) Statistics, Lanzhou University(统计学,兰州大学) Shanghai Innovation Institute(上海创新研究院) Microsoft Research(微软研究院) Nanjing University(南京大学) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 RC-GRPO通过奖励条件化策略优化提升多轮工具调用性能,有效解决组内奖励稀疏导致的更新问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 77%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07326 2026-02-04 cs.CL cs.AI cs.CY cs.LG 75%

Reward Model Interpretability via Optimal and Pessimal Tokens

通过最优和最劣 tokens 实现奖励模型可解释性

Brian Christian, Hannah Rose Kirk, Jessica A. F. Thompson, Christopher Summerfield, Tsvetomira Dumbalska

机构 * University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析奖励模型对不同token的评分,揭示了模型间的异质性、评分不对称性及潜在偏见,挑战了奖励模型的可互换性及代理人类价值观的假设。

Comments Accepted for publication in Proceedings of the 2025 ACM Conference on Fairness, Accountability, and Transparency (FAccT '25), to appear June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07182 2026-02-04 cs.LG cs.AI 73%

PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization

PRPO:在策略优化中对过程奖励与结果奖励的对齐

Ruiyi Ding, Yongxuan Lv, Xianhui Meng, Jiahe Song, Chao Wang, Chen Jiang, Yuan Cheng

机构 * Shanghai University(上海大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PRPO通过结合结果可靠性与过程级指导,在无批评者框架中提升策略优化效率,实现对过程奖励与结果奖励的对齐,从而提高模型在多步推理任务中的性能。

Comments 8 pages, 2 figures Code is available at: https://github.com/SchumiDing/srpocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM 70%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02488 2026-02-04 cs.LG cs.AI cs.CL cs.CV 67%

RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System

RLAnything: 在完全动态的RL系统中动态生成环境、策略和奖励模型

Yinjie Wang, Tianbao Xie, Ke Shen, Mengdi Wang, Ling Yang

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLAnything通过动态生成环境、策略和奖励模型,在完全动态的RL系统中提升学习效果,显著提升多个任务的性能。

Comments Code: https://github.com/Gen-Verse/Open-AgentRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22950 2026-02-04 eess.AS 67%

DiffRhythm 2: Efficient and High Fidelity Song Generation via Block Flow Matching

DiffRhythm 2: 通过块流匹配实现高效高保真的歌曲生成

Yuepeng Jiang, Huakang Chen, Ziqian Ning, Jixun Yao, Zerui Han, Di Wu, Meng Meng, Jian Luan, Zhonghua Fu, Lei Xie

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract)

AI总结 DiffRhythm 2 通过块流匹配实现高效高保真的歌曲生成,解决歌词与 vocals 对齐及多偏好优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03304 2026-02-04 cs.IR 50%

To Search or Not to Search: Aligning the Decision Boundary of Deep Search Agents via Causal Intervention

是进行搜索还是不进行搜索:通过因果干预对深度搜索代理的决策边界进行对齐

Wenlin Zhang, Kuicai Dong, Junyi Li, Yingyi Zhang, Xiaopeng Li, Pengyue Jia, Yi Wen, Derong Xu, Maolin Wang, Yichao Wang, Yong Liu, Xiangyu Zhao

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出DAS方法,通过因果干预和偏好优化对深度搜索代理的决策边界进行对齐,以解决过度搜索和不足搜索问题,提升搜索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 9 篇

2602.00748 2026-02-04 cs.DC cs.AI cs.AR 89%

HyperOffload: Graph-Driven Hierarchical Memory Management for Large Language Models on SuperNode Architectures

HyperOffload: 图驱动的分层内存管理用于超节点架构上的大型语言模型

Fangxin Liu, Qinghua Zhang, Hanjing Shen, Zhibo Liang, Li Jiang, Haibing Guan, Chong Bao, Xuefeng Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 HyperOffload通过图驱动的编译器方法优化超节点架构上的LLM内存管理,减少峰值内存使用并提升计算效率。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11129 2026-02-04 cs.CV cs.AI 83%

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02559 2026-02-04 cs.AI cs.CV cs.LG cs.MA 79%

Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers

基于经验的多智能体系统是无需训练的上下文感知地球观测者

Pengyu Dai, Weihao Xuan, Junjue Wang, Hongruixuan Chen, Jian Song, Yafei Ou, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Hokkaido University(北海道大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GeoEvolver通过结构化交互使LLM代理无需训练即可获得地球观测专业知识,提升复杂任务的成功率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15540 2026-02-04 cs.LG cs.AI cs.CL physics.data-an 75%

PRISM: Deriving a White-Box Transformer as a Signal-Noise Decomposition Operator via Maximum Coding Rate Reduction

PRISM:通过最大编码率减少原理推导出白盒变换器作为信号-噪声分解算子

Dongchen Huang

机构 * Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Prism通过几何构造实现白盒变换器,通过信号-噪声分解提升模型可解释性与性能

Comments 12 pages, 6 figures. Derives Transformer as a signal-noise decomposition operator via Maximizing Coding Rate Reduction. Identifies 'Attention Sink' as spectral resonance (Arnold Tongues) and proposes $π$-RoPE for dynamical stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03200 2026-02-04 cs.CV cs.AI 70%

Hand3R: Online 4D Hand-Scene Reconstruction in the Wild

Hand3R: 在线4D手-场景重建

Wendi Hu, Haonan Zhou, Wenhao Hu, Gaoang Wang

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 Hand3R通过结合预训练手专家和4D场景基础模型,实现了在线4D手-场景重建,无需离线优化,提升了手部和场景的联合重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12992 2026-02-04 cs.CL 70%

MemoryFormer: Minimize Transformer Computation by Removing Fully-Connected Layers

MemoryFormer: 通过移除全连接层来减少Transformer计算

Ning Ding, Yehui Tang, Haochen Qin, Zhenli Zhou, Chao Xu, Lin Li, Kai Han, Heng Liao, Yunhe Wang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei HiSilicon(华为海思)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemoryFormer通过移除全连接层,利用内存查找表和哈希算法替代线性投影,显著降低Transformer计算复杂度并提升效率。

Comments NeurIPS 2024. Code available at https://github.com/ningding-o/MemoryFormer

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07891 2026-02-04 cs.LG cs.AI cs.CL 67%

KVzap: Fast, Adaptive, and Faithful KV Cache Pruning

KVzap:快速、自适应和忠实的KV缓存修剪

Simon Jegou, Maximilian Jeblick

机构 * NVIDIA(英伟达)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVzap通过快速且自适应的KV缓存修剪方法,在保持高精度的同时实现显著的缓存压缩,适用于长上下文和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏