arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-05 至 2026-01-05 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 6 篇

2506.01495 2026-01-05 cs.CL 88%

C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models

C-VARC:一个大规模的中文价值观规则语料库用于大语言模型的价值对齐

Ping Wu, Guobin Shen, Dongcheng Zhao, Yuwei Wang, Yiting Dong, Yu Shi, Enmeng Lu, Feifei Zhao, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所脑认知实验室,北京,中国) Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室,北京,中国) Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究所,北京,中国) The School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Long-term AI, Beijing, China(长期人工智能,北京,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 C-VARC通过构建大规模中文价值观规则语料库,提供了一种基于中国核心价值观的价值对齐方法,有效提升了大语言模型在不同文化背景下的伦理评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04454 2026-01-05 cs.CL 85%

Inner-Probe: Discovering Copyright-related Data Generation in LLM Architecture

Inner-Probe: 在LLM架构中发现与版权相关的数据生成

Qichao Ma, Rui-Jie Zhu, Peiye Liu, Renye Yan, Fahong Zhang, Ling Liang, Meng Li, Zhaofei Yu, Zongwei Wang, Yimao Cai, Tiejun Huang

机构 * School of Computer Science and the State Key Laboratory of Multimedia Information Processing, Peking University(计算机科学系和多媒体信息处理国家重点实验室,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) department of Electrical and Computer Engineering, University of California, Santa Cruz(电气与计算机工程系,加州大学圣克鲁兹分校) Alibaba DAMO Academy, Beijing(阿里巴巴达摩院,北京) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) School of Integrated Circuits, Peking University(集成电路系,北京大学) YanXin MicroElectronics Co., Ltd.(YXME), Shanghai, China(燕芯微电子有限公司(YXME),上海,中国)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Inner-Probe通过分析LLM生成过程中多头注意力机制,实现对受版权数据子集影响的高效检测与非受版权文本识别。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21043 2026-01-05 cs.AI cs.LG 73%

Combinatorial Creativity: A New Frontier in Generalization Abilities

组合创造力:一般化能力的新前沿

Samuel Schapiro, Sumuk Shashidhar, Alexi Gladstone, Jonah Black, Royce Moon, Dilek Hakkani-Tur, Lav R. Varshney

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science(计算与数据科学学院) Spiral Works AI Innovation Institute(人工智能创新研究所) Stony Brook University(石溪大学) Simons Institute for the Theory of Computing, Berkeley(伯克利理论计算研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出组合创造力的概念,通过理论框架和算法任务评估LLMs的创造力,并发现最优模型参数和新颖性-实用性权衡对提升创造力的重要性。

Comments Preprint. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14975 2026-01-05 cs.LG cs.AI cs.RO 73%

Flattening Hierarchies with Policy Bootstrapping

通过策略自举 flattening 层次结构

John L. Zhou, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种通过自举子目标策略训练平坦目标条件策略的方法,解决长horizon任务中GCRL扩展难题,实现高维控制性能提升。

Comments NeurIPS 2025 (Spotlight, top 3.2%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06696 2026-01-05 cs.CL cs.LG 73%

Simple and Effective Input Reformulations for Translation

简单而有效的输入改写用于翻译

Brian Yu, Hansen Lillemark, Kurt Keutzer

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文通过简单输入改写方法提升翻译任务的性能,实验表明在佛洛斯200基准测试中性能提升达3.5 chrF++。

Comments 13 pages, 6 figures. To be published in Empirical Methods in Natural Language Processing (Main) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18961 2026-01-05 cs.CV 50%

AnomalyCLIP: Object-agnostic Prompt Learning for Zero-shot Anomaly Detection

AnomalyCLIP:面向零样本异常检测的对象无关提示学习

Qihang Zhou, Guansong Pang, Yu Tian, Shibo He, Jiming Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡管理学院) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 AnomalyCLIP通过学习对象无关的文本提示,实现跨不同领域的零样本异常检测,提升异常识别的泛化能力。

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 16 篇

2601.00736 2026-01-05 cs.CL cs.AI 91%

Exploring the Performance of Large Language Models on Subjective Span Identification Tasks

探索大型语言模型在主观跨度识别任务中的性能

Alphaeus Dmonte, Roland Oruche, Tharindu Ranasinghe, Marcos Zampieri, Prasad Calyam

机构 * George Mason University(乔治·马歇尔大学) University of Missouri(密苏里大学) Lancaster University(兰卡斯特大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文探讨了大型语言模型在情感分析、攻击性语言识别和声明验证等任务中进行主观跨度识别的性能,评估了多种LLM策略的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00254 2026-01-05 cs.SE cs.AI 90%

An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems

基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统

Md Hasan Saju, Maher Muhtadi, Akramul Azim

机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 指令微调 :LLM(title,abstract);SFT(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22905 2026-01-05 cs.CV 88%

JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation

JavisGPT:一种用于声音-视频理解和生成的统一多模态大语言模型

Kai Liu, Jungang Li, Yuchong Sun, Shengqiong Wu, Jianzhang Gao, Daoan Zhang, Wei Zhang, Sheng Jin, Sicheng Yu, Geng Zhan, Jiayi Ji, Fan Zhou, Liang Zheng, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * ZJU(浙江大学) NUS(国立新加坡大学) HKUST(GZ)(香港科技大学(广州)) RUC(中国人民大学) HZCU(杭州电子科技大学) NTU(国立台湾大学) SMU(新加坡国立大学) USYD(澳大利亚悉尼大学) ANU(澳大利亚国立大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 JavisGPT是一种统一多模态大语言模型,通过三阶段训练流程在声音-视频理解和生成任务中表现出色,尤其在复杂和时间同步场景中表现更优。

Comments Accepted by NeurIPS as a Spotlight paper. Code: https://github.com/JavisVerse/JavisGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00777 2026-01-05 cs.SD cs.CV 88%

Investigating the Viability of Employing Multi-modal Large Language Models in the Context of Audio Deepfake Detection

探讨在音频深度伪造检测中使用多模态大语言模型的可行性

Akanksha Chuchra, Shukesh Reddy, Sudeepta Mishra, Abhijit Das, Abhinav Dhall

机构 * Indian Institute of Technology, Ropar, India(印度理工学院罗帕尔分校) Machine Intelligence Group, Birla Institute of Technology and Science, Pilani, Hyderabad Campus, India(比拉理工科学院帕利尼 Hyderabad 分校机器智能小组) Monash University, Melbourne, Australia(墨尔本大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文探讨了多模态大语言模型在音频深度伪造检测中的可行性,通过结合音频输入与多提示方法,展示了模型在域内数据上的良好表现及潜在应用价值。

Comments Accepted at IJCB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04862 2026-01-05 cs.CL 86%

EXAONE 3.5: Series of Large Language Models for Real-world Use Cases

EXAONE 3.5:面向实际应用场景的大型语言模型系列

Soyoung An, Kyunghoon Bae, Eunbi Choi, Kibong Choi, Stanley Jungkyu Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Yountae Jung, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Woohyung Lim, Sangha Park, Sooyoun Park, Yongmin Park, Sihoon Yang, Heuiyeen Yeen, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 EXAONE 3.5系列模型通过指令微调在现实场景中实现卓越的指令遵循能力,同时在长上下文理解和通用基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03541 2026-01-05 cs.CL cs.AI 84%

EXAONE 3.0 7.8B Instruction Tuned Language Model

EXAONE 3.0 7.8B 指令微调语言模型

Soyoung An, Kyunghoon Bae, Eunbi Choi, Stanley Jungkyu Choi, Yemuk Choi, Seokhee Hong, Yeonjung Hong, Junwon Hwang, Hyojin Jeon, Gerrard Jeongwon Jo, Hyunjik Jo, Jiyeon Jung, Yountae Jung, Euisoon Kim, Hyosang Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Youchul Kim, Edward Hwayoung Lee, Haeju Lee, Honglak Lee, Jinsik Lee, Kyungmin Lee, Moontae Lee, Seungjun Lee, Woohyung Lim, Sangha Park, Sooyoun Park, Yongmin Park, Boseong Seo, Sihoon Yang, Heuiyeen Yeen, Kyungjae Yoo, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 EXAONE 3.0 7.8B 指令微调语言模型在韩语和通用任务中表现优异,通过开源促进专家AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00088 2026-01-05 cs.LG 83%

Dynamic Bayesian Optimization Framework for Instruction Tuning in Partial Differential Equation Discovery

用于偏微分方程发现的动态贝叶斯优化框架用于指令微调

Junqi Qu, Yan Zhang, Shangqian Gao, Shibo Li

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 指令微调 :instruction tuning(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 NeuroSymBO通过动态贝叶斯优化框架提升偏微分方程发现任务中的指令微调效果,实现更优的解决方案和更高的恢复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00566 2026-01-05 cs.CR 82%

Low Rank Comes with Low Security: Gradient Assembly Poisoning Attacks against Distributed LoRA-based LLM Systems

低秩带来低安全:针对分布式LoRA-based LLM系统的梯度装配中毒攻击

Yueyan Dong, Minghui Xu, Qin Hu, Yinhao Xiao, Qi Luo, Yechao Zhang, Yue Zhang, Xiuzhen Cheng

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对分布式LoRA-based LLM系统,提出GAP攻击,通过构造无害的A和B矩阵乘积产生恶意更新,导致模型输出降级和错误增加。

Comments 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00446 2026-01-05 cs.LG 79%

A Comparative Study of Adaptation Strategies for Time Series Foundation Models in Anomaly Detection

时间序列基础模型在异常检测中的适应策略比较研究

Miseon Park, Kijung Yoon

机构 * Department of Electronic Engineering, Hanyang University, Seoul, Korea(电子工程系,翰阳大学,首尔,韩国) Department of Artificial Intelligence, Hanyang University, Seoul, Korea(人工智能系,翰阳大学,首尔,韩国)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了时间序列基础模型在异常检测中的适应策略,发现其在多种基准上表现优异,尤其在类别不平衡情况下,PEFT方法能有效提升性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00229 2026-01-05 cs.LG 79%

Robust Graph Fine-Tuning with Adversarial Graph Prompting

鲁棒图微调与对抗图提示

Ziyan Zhang, Bo Jiang, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室)

专题命中 指令微调 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出对抗图提示(AGP)方法,通过整合对抗学习提升图神经网络在对抗噪声下的鲁棒性,并在多个基准任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00583 2026-01-05 cs.LG cs.AI cs.NI 79%

HFedMoE: Resource-aware Heterogeneous Federated Learning with Mixture-of-Experts

HFedMoE: 带有专家混合的资源感知异构联邦学习

Zihan Fang, Zheng Lin, Senkang Hu, Yanan Ma, Yihang Tao, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HFedMoE通过定制专家子集和稀疏性感知聚合策略,实现高效异构联邦学习微调。

Comments 14 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00372 2026-01-05 cs.CR 78%

LLM-Powered Analysis of IoT User Reviews: Tracking and Ranking Security and Privacy Concerns

基于大语言模型的物联网用户评论分析:跟踪和排序安全与隐私问题

Taufiq Islam Protick, Sai Teja Peddinti, Nina Taft, Anupam Das

专题命中 指令微调 :LLM(title);prompting(abstract)

AI总结 本研究利用大语言模型分析物联网用户评论,识别和排序安全与隐私问题,发现安全摄像头的高关注度及持续存在的隐私问题,为开发者改进用户信任提供洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00146 2026-01-05 astro-ph.IM cs.LG 70%

Combining datasets with different ground truths using Low-Rank Adaptation to generalize image-based CNN models for photometric redshift prediction

利用低秩适应结合不同地面真实数据集来泛化基于图像的CNN模型以预测光度红移

Vikram Seenivasan, Srinath Saikrishnan, Andrew Lizarraga, Jonathan Soriano, Bernie Boscoe, Tuan Do

机构 * UCLA(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文利用LoRA技术结合不同红移数据集,提升CNN模型在光度红移预测中的泛化能力与准确性。

Comments 11 pages, 7 figures, 3 tables, Accepted to the Conference on Neural Information Processing Systems (NeurIPS), Machine Learning and the Physical Sciences (ML4PS) Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03402 2026-01-05 cs.CL 70%

Dual LoRA: Enhancing LoRA with Magnitude and Direction Updates

Dual LoRA: 通过幅度和方向更新增强LoRA

Yixing Xu, Chao Li, Xuanwu Yin, Spandan Tiwari, Dong Li, Ashish Sirasao, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Dual LoRA通过引入幅度和方向更新机制,改进LoRA在参数高效微调中的性能,实验表明其在多个NLP任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24652 2026-01-05 cs.CL cs.IR 70%

Optimizing Retrieval for RAG via Reinforcement Learning

通过强化学习优化RAG的检索

Jiawei Zhou, Lei Chen

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.CL

AI总结 通过强化学习优化RAG检索,提升检索性能并适应多样化环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11167 2026-01-05 cs.CL 70%

Cultural Palette: Pluralising Culture Alignment via Multi-agent Palette

文化调色板:通过多智能体调色板实现文化对齐的多元化

Jiahao Yuan, Zixiang Di, Shangzixin Zhao, Zhiqing Cui, Hanqing Wang, Guisong Yang, Usman Naseem

机构 * ECNU(华东师范大学) USST(上海理工大学) BNU(北京师范大学) HKUST–GZ(香港理工大学-广州)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Cultural Palette通过多智能体框架实现文化对齐的多元化,利用文化地理和颜色混合机制提升跨文化响应的适应性与准确性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 4 篇

2601.00647 2026-01-05 cs.CL cs.CE q-bio.QM 89%

Physio-DPO: Aligning Large Language Models with the Protein Energy Landscape to Eliminate Structural Hallucinations

Physio-DPO:将大型语言模型与蛋白质能量景观对齐以消除结构幻觉

QiWei Meng

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);SFT(abstract);preference optimization(abstract)

AI总结 Physio-DPO通过引入物理感知的目标,将蛋白质语言模型与热力学稳定性对齐,有效减少结构幻觉并提升折叠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02152 2026-01-05 cs.LG cs.CL 88%

Tabby: A Language Model Architecture for Tabular and Structured Data Synthesis

Tabby:一种用于表格和结构化数据合成的语言模型架构

Sonia Cromp, Satya Sai Srinath Namburi GNVV, Mohammed Alkhudhayri, Catherine Cao, Samuel Guo, Nicholas Roberts, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)

AI总结 Tabby是一种用于表格和结构化数据合成的语言模型架构,通过门控专家混合机制提升数据生成质量,结合新型训练技术实现44%的质量提升。

Comments 21 pages, 8 figures. Appearing in TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 85%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24818 2026-01-05 cs.LG 77%

Unregularized Linear Convergence in Zero-Sum Game from Preference Feedback

零和博弈中的无正则化线性收敛性:从偏好反馈出发

Shulun Chen, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) HKUST(香港科技大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种无正则化的OMWU算法,证明其在零和博弈中实现线性收敛,无需假设纳什均衡的唯一性,提升了对实例依赖常数的依赖性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2601.00756 2026-01-05 cs.LG cs.CL 90%

Memory Bank Compression for Continual Adaptation of Large Language Models

基于记忆库压缩的大型语言模型持续适应

Thomas Katraouras, Dimitrios Rafailidis

机构 * University of Thessaly(塞萨洛尼基大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 MBC通过代码本优化策略和键值低秩适应,实现大型语言模型持续适应中的记忆库压缩,有效减少内存占用并保持高准确性。

Comments Accepted to the 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09238 2026-01-05 cs.CL 70%

Training-free Context-adaptive Attention for Efficient Long Context Modeling

无需训练的上下文自适应注意力:用于高效长上下文建模

Zeng You, Yaofo Chen, Shuhai Zhang, Zhijie Qiu, Tingyu Wu, Yingjian Li, Yaowei Wang, Mingkui Tan

机构 * School of Future Technology, South China University of Technology, Guangzhou, China(未来技术学院,华南理工大学,广州,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) School of Software Engineering, South China University of Technology, Guangzhou, China(软件学院,华南理工大学,广州,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学,深圳,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出无需训练的上下文自适应注意力机制,通过轻量级阶段实现高效长上下文推理,减少内存占用并提升速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08872 2026-01-05 cs.AI 57%

Your Brain on ChatGPT: Accumulation of Cognitive Debt when Using an AI Assistant for Essay Writing Task

你的大脑在使用ChatGPT时:在使用AI助手写论文任务时积累的认知债务

Nataliya Kosmyna, Eugene Hauptmann, Ye Tong Yuan, Jessica Situ, Xian-Hao Liao, Ashly Vivian Beresnitzky, Iris Braunstein, Pattie Maes

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究发现使用LLM辅助写作会导致认知负担增加,长期依赖LLM可能影响学习效果。

Comments 216 pages, 102 figures, 4 tables and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24637 2026-01-05 cs.OS 50%

Towards Fully-fledged GPU Multitasking via Proactive Memory Scheduling

通过主动内存调度实现全面的GPU多任务处理

Weihang Shen, Yinqiu Chen, Rong Chen, Haibo Chen

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 MSched通过主动内存调度技术,提升GPU多任务处理效率,显著减少页面故障,优化内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏