arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-02-10 至 2026-02-10 共收录 35
2602.09003 2026-02-10 cs.AI cs.CL

Data Science and Technology Towards AGI Part I: Tiered Data Management

数据科学与技术迈向通用人工智能 Part I:分层数据管理

Yudong Wang, Zixuan Fu, Hengyu Zhao, Chen Zhao, Chuyue Zhou, Xinle Lin, Hongya Lyu, Shuaikang Xue, Yi Yi, Yingjiao Wang, Zhi Zheng, Yuzhou Zhang, Jie Zhou, Chaojun Xiao, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) ModelBest Inc.(ModelBest公司) Beijing Institute of Technology(北京理工大学) South China Agricultural University(华南农业大学)

AI总结 本文提出分层数据管理框架,通过数据与模型的协同进化提升大语言模型训练效率和性能。

Comments 16 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08984 2026-02-10 cs.CL cs.AI

Next Concept Prediction in Discrete Latent Space Leads to Stronger Language Models

在离散潜在空间中进行下一步概念预测可使语言模型更强大

Yuliang Liu, Yunchong Song, Yixuan Wang, Kewen Ge, Alex Lamb, Qipeng Guo, Kai Chen, Bowen Zhou, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Department of Electronic Engineering(电子工程系) College of Artificial Intelligence(人工智能学院) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 通过在离散潜在空间中进行下一步概念预测,ConceptLM在预训练任务中实现了更强大的语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08858 2026-02-10 cs.CV cs.AI

FlattenGPT: Depth Compression for Transformer with Layer Flattening

FlattenGPT: Transformer中基于层扁平化的深度压缩

Ruihan Xu, Qingpei Guo, Yao Zhu, Xiangyang Ji, Ming Yang, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Tsinghua University(清华大学)

AI总结 FlattenGPT通过层扁平化技术实现Transformer模型的深度压缩,有效提升效率并保持性能,适用于多种模型类型和参数规模。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08829 2026-02-10 cs.CL cs.AI

WildReward: Learning Reward Models from In-the-Wild Human Interactions

WildReward: 从真实世界的人类交互中学习奖励模型

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

AI总结 本文提出WildReward,通过真实世界用户交互直接学习奖励模型,无需偏好对,实现更优的校准和一致性,并在多种任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08776 2026-02-10 cs.RO

Mind the Gap: Learning Implicit Impedance in Visuomotor Policies via Intent-Execution Mismatch

注意间隙:通过意图-执行不匹配学习隐式阻抗

Cuijie Xu, Shurui Zheng, Zihao Su, Yuanfan Xu, Tinghao Yi, Xudong Zhang, Jian Wang, Yu Wang, Jinchen Yu

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Qiuzhen College, Tsinghua University(清华大学启晨学院) School of Mechanical and Aerospace Engineering, Jilin University(吉林大学机械与 aerospace 工程学院) EFORT Intelligent Robot Co., Ltd.(EFORT 智能机器人有限公司)

AI总结 通过意图-执行不匹配学习隐式阻抗,实现低成本硬件的鲁棒力感知与动态补偿。

Comments 14 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08592 2026-02-10 cs.LG

TFMLinker: Universal Link Predictor by Graph In-Context Learning with Tabular Foundation Models

TFMLinker:通过基于图的上下文学习进行通用链接预测的通用链接预测器

Tianyin Liao, Chunyu Hu, Yicheng Sui, Xingxuan Zhang, Peng Cui, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Beihang University(北航)

AI总结 TFMLinker通过表格基础模型的上下文学习能力,在不同图上进行通用链接预测,无需数据集特定微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08262 2026-02-10 cs.CV

Moving Beyond Functional Connectivity: Time-Series Modeling for fMRI-Based Brain Disorder Classification

超越功能连接:基于fMRI的脑部疾病分类的时间序列建模

Guoqi Yu, Xiaowei Hu, Angelica I. Aviles-Rivero, Anqi Qiu, Shujun Wang

机构 * PolyU South China University of Technology(南方科技大学) Tsinghua University(清华大学) YMSC, Tsinghua University(清华大学交叉信息学院) Dept. of Biomedical Engineering, PolyU(PolyU 生物医学工程系) Sch. of Future Technology, South China University of Technology(南方科技大学未来技术学院) Dept. of Health Technology and Informatics, PolyU(PolyU 健康技术与信息学系) Dept. of Biomedical Engineering and the Dept. of Data Science and Artificial Intelligence, PolyU(PolyU 生物医学工程系和数据科学与人工智能系)

AI总结 本文提出DeCI框架,通过周期和漂移分解及通道独立性建模,提升fMRI脑部疾病分类的准确性和泛化能力。

Comments This paper has been accepted by IEEE Transactions on Medical Imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08253 2026-02-10 cs.AI

G-LNS: Generative Large Neighborhood Search for LLM-Based Automatic Heuristic Design

G-LNS:基于生成式大邻域搜索的LLM自动启发式设计

Baoyun Zhao, He Wang, Liang Zeng

机构 * Software College, Northeastern University(东北大学软件学院) International Centre for Theoretical Physics Asia-Pacific, University of Chinese Academy of Sciences(中国科学院大学国际理论物理亚太中心) Taiji Laboratory for Gravitational Wave Universe, University of Chinese Academy of Sciences(中国科学院大学太极引力波宇宙实验室) Tsinghua University(清华大学)

AI总结 G-LNS通过生成式进化框架,结合LLM共同进化破坏与修复操作符,实现了大邻域搜索操作符的自动化设计,在复杂组合优化问题中表现出更强的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22896 2026-02-10 cs.AI

Game-Theoretic Co-Evolution for LLM-Based Heuristic Discovery

基于博弈论的LLM启发式发现共演化

Xinyi Ke, Kai Li, Junliang Xing, Yifan Zhang, Jian Cheng

机构 * C2DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

AI总结 本文提出ASRO框架,通过博弈论方法实现求解器与实例生成器的共演化,提升启发式发现的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04093 2026-02-10 cs.CL

SearchAttack: Red-Teaming LLMs against Knowledge-to-Action Threats under Online Web Search

SearchAttack: 对知识到行动威胁下对LLM进行红队攻击

Yu Yan, Sheng Sun, Mingfeng Li, Zheming Yang, Chiwei Zhu, Fei Ma, Benfeng Xu, Min Liu, Qi Li

机构 * Institute of Computing Technology, CAS(计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) People's Public Security University of China(中国人民公安大学) University of Science and Technology of China(中国科学技术大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东人工智能与数字经济实验室) Tsinghua University(清华大学)

AI总结 SearchAttack通过重新表述有害语义和测试奖励追逐偏差,揭示LLM在搜索增强任务中的安全漏洞。

Comments Misusing LLM-driven search for harmful information-seeking poses serious risks. We characterize its usability and impact through a comprehensive red-teaming and evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05377 2026-02-10 cs.LG cs.AI physics.ao-ph

China Regional 3km Downscaling Based on Residual Corrective Diffusion Model

基于残差校正扩散模型的中国区域3公里降尺度

Honglu Sun, Hao Jing, Zhixiang Dai, Sa Xiao, Wei Xue, Jian Sun, Qifeng Lu

机构 * State Key Laboratory of Severe Weather Meteorological Science and Technology(severe weather meteorological science and technology state key laboratory) CMA Earth System Modeling and Prediction Centre NVIDIA Tsinghua University

AI总结 本研究提出基于残差校正扩散模型的中国区域3公里降尺度方法,通过改进模型结构和扩大降尺度区域,提升天气预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13261 2026-02-10 cs.CV

Building Egocentric Procedural AI Assistant: Methods, Benchmarks, and Challenges

构建第一人称程序化AI助手:方法、基准和挑战

Junlong Li, Huaiyuan Xu, Sijie Cheng, Kejun Wu, Kim-Hui Yap, Lap-Pui Chau, Yi Wang

机构 * Department of EEE(电子工程系) The Hong Kong Polytechnic University(香港理工大学) RayNeo Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出第一人称程序化AI助手,探讨其核心任务、赋能维度及挑战,通过实验评估现有方法并指明未来研究方向。

Comments Under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26098 2026-02-10 cs.AI

GUI Knowledge Bench: Revealing the Knowledge Gap of VLMs in GUI Tasks

GUI知识基准:揭示VLMs在GUI任务中的知识差距

Chenrui Shi, Zedong Yu, Zhi Gao, Ruining Feng, Enqi Liu, Yuwei Wu, Yunde Jia, Liuyu Xiang, Zhaofeng He, Qing Li

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室) Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) Shenzhen MSU-BIT University, Shenzhen, China(深圳MSU-BIT大学)

AI总结 GUI知识基准揭示VLMs在GUI任务中的知识差距,通过提炼三个维度的GUI知识,评估现有模型的不足并指导更高效的任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07760 2026-02-10 cs.LG cs.AI

VAO: Validation-Aligned Optimization for Cross-Task Generative Auto-Bidding

VAO:面向跨任务生成自动出价的验证对齐优化

Yiqin Lv, Zhiyu Mou, Miao Xu, Jinghao Chen, Qi Wang, Yixiu Mao, Yun Qu, Rongquan Bai, Chuan Yu, Jian Xu, Bo Zheng, Xiangyang Ji

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Department of Automation, Tsinghua University(自动化系,清华大学)

AI总结 本文提出VAO方法,通过验证反馈自适应加权跨任务数据,缓解梯度偏差并提升生成式自动出价的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12281 2026-02-10 cs.CL

Legal$Δ$: Enhancing Legal Reasoning in LLMs via Reinforcement Learning with Chain-of-Thought Guided Information Gain

Legal$Δ$: 通过强化学习与链式思维引导信息增益提升大语言模型的法律推理

Xin Dai, Buqiang Xu, Zhenghao Liu, Yukun Yan, Huiyuan Xie, Xiaoyuan Yi, Shuo Wang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia(微软亚洲研究院)

AI总结 Legal$Δ$通过强化学习与链式思维引导信息增益提升法律推理的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16551 2026-02-10 cs.RO cs.SY eess.SY

SafeLink: Safety-Critical Control Under Dynamic and Irregular Unsafe Regions

SafeLink: 在动态和不规则不安全区域下的安全关键控制

Songqiao Hu, Zidong Wang, Zeyi Liu, Zhen Shen, Xiao He

机构 * Department of Automation, and the Institute for Embodied Intelligence and Robotics, Tsinghua University(自动化系,以及 embodied intelligence and robotics 研究所,清华大学) Department of Computer Science, Brunel University London(计算机科学系,布鲁内尔大学伦敦分校) State Key Laboratory of Multimodal Artificial Intelligence Systems, Beijing Engineering Research Center of Intelligent Systems and Technology, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,北京智能系统与技术工程研究中心,中国科学院自动化研究所)

AI总结 SafeLink通过成本敏感的增量随机向量函数链接神经网络,实现动态和不规则不安全区域下的安全关键控制,提升系统安全性和计算效率。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07960 2026-02-10 cs.CV

D-ORCA: Dialogue-Centric Optimization for Robust Audio-Visual Captioning

D-ORCA:面向鲁棒音频视觉描述的对话中心优化

Changli Tang, Tianyi Wang, Fengyun Rao, Jing Lyu, Chao Zhang

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

AI总结 D-ORCA通过对话中心优化,提升音频视觉描述的鲁棒性和准确性,填补开源生态关键空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07909 2026-02-10 cs.CL cs.LG

SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization

SparseEval: 通过稀疏优化高效评估大语言模型

Taolin Zhang, Hang Guo, Wang Lu, Tao Dai, Shu-Tao Xia, Jindong Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Microsoft Research Asia(微软亚洲研究院)

AI总结 SparseEval通过稀疏优化方法高效评估大语言模型,利用梯度下降和迭代细化策略提升基准测试效率,展现高鲁棒性和实用性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07865 2026-02-10 cs.HC cs.AI

Orchestrating Attention: Bringing Harmony to the 'Chaos' of Neurodivergent Learning States

协调注意力:为神经多样性学习状态的‘混乱’带来和谐

Satyam Kumar Navneet, Joydeep Chandra, Yong Zhang

机构 * Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学(RUDN大学)) Joint Institute for Nuclear Research(联合核子研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学) Independent Researcher(独立研究者) BNRIST, Tsinghua University(北京理工大学)

AI总结 AttentionGuard通过检测神经多样性学习者的注意力状态,实现界面自适应,降低认知负荷并提升学习理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07848 2026-02-10 cs.LG

MARTI-MARS$^2$: Scaling Multi-Agent Self-Search via Reinforcement Learning for Code Generation

MARTI-MARS$^2$:通过强化学习实现多智能体自搜索的扩展用于代码生成

Shijie Wang, Pengfei Li, Yikun Fu, Kaifeng Liu, Fangyuan Li, Yang Liu, Xiaowei Sun, Zonglin Li, Siyao Zhao, Jian Zhao, Kai Tian, Dong Li, Junqi Gao, Yutong Zhang, Yiqun Chen, Yuqiang Li, Zoe Li, Weinan Zhang, Peng Ye, Shuyue Hu, Lei Bai, Bowen Zhou, Kaiyan Zhang, Biqing Qi

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学) Institute of Automation(自动化研究所) Fudan University(复旦大学) High School Affiliated to Fudan University(复旦大学附属高中) Renmin University of China(中国人民大学) University of Washington(华盛顿大学)

AI总结 MARTI-MARS2通过多智能体强化学习实现代码生成的扩展,突破单智能体限制,提升性能和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07625 2026-02-10 cs.CV cs.AI

AD-MIR: Bridging the Gap from Perception to Persuasion in Advertising Video Understanding via Structured Reasoning

AD-MIR:通过结构化推理弥合从感知到说服的广告视频理解鸿沟

Binxiao Xu, Junyu Feng, Xiaopeng Lin, Haodong Li, Zhiyuan Feng, Bohan Zeng, Shaolin Lu, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

AI总结 AD-MIR通过结构化推理框架,结合语义检索与精确关键词匹配,有效解码广告意图,提升广告视频理解的准确性与说服策略分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07546 2026-02-10 cs.CL cs.LG

Improving Variable-Length Generation in Diffusion Language Models via Length Regularization

通过长度正则化改进扩散语言模型的变长生成

Zicong Cheng, Ruixuan Jia, Jia Li, Guo-Wei Yang, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Proxseer Inc.(Proxseer公司)

AI总结 本文提出LR-DLLM,通过长度正则化改进扩散语言模型的变长生成能力,提升了在未知长度下的生成效果。

Comments diffusion language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07517 2026-02-10 cs.CR cs.AI cs.CL cs.DB

MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots

MemPot:通过优化的陷阱来防御内存提取攻击

Yuhao Wang, Shengfang Zhai, Guanghao Jin, Yinpeng Dong, Linyi Yang, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Southern University of Science and technology(南方科技大学)

AI总结 MemPot通过优化陷阱文档和理论验证,有效防御内存提取攻击,提升检测性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07495 2026-02-10 cs.CV cs.MM

Learning Brain Representation with Hierarchical Visual Embeddings

通过层次化视觉嵌入学习大脑表示

Jiawen Zheng, Haonan Jia, Ming Li, Yuhui Zheng, Yufeng Zeng, Yang Gao, Chen Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北航大学) Tsinghua University(清华大学)

AI总结 本文提出了一种利用层次化视觉嵌入学习大脑表示的方法,通过对比学习和融合先验提升大脑信号与视觉嵌入的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05818 2026-02-10 cs.AI cs.DB

TKG-Thinker: Towards Dynamic Reasoning over Temporal Knowledge Graphs via Agentic Reinforcement Learning

TKG-Thinker: 向通过代理强化学习实现动态推理的时序知识图谱迈进

Zihao Jiang, Miao Peng, Zhenyan Shan, Wenjie Xu, Ben Liu, Gong Chen, Ziqi Gao, Min Peng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 TKG-Thinker通过代理强化学习实现动态推理,提升时序知识图谱问答的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01100 2026-02-10 cs.RO

StreamVLA: Breaking the Reason-Act Cycle via Completion-State Gating

StreamVLA: 通过完成状态门控打破原因-行动循环

Tongqing Chen, Hang Wu, Jiasen Wang, Xiaotao Li, Lu Fang

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Shanghai University(上海大学) Wuhan University(武汉大学)

AI总结 StreamVLA通过完成状态门控机制,实现高效机器人操作,减少推理延迟并提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00612 2026-02-10 cs.CL

Lookahead-then-Verify: Reliable Constrained Decoding for Diffusion LLMs under Context-Free Grammars

前瞻性验证:用于扩散大语言模型在无上下文自由文法下的可靠约束解码

Yitong Zhang, Yongmin Li, Yuetong Liu, Jia Li, Xiaoran Jia, Zherui Li, Ge Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 LAVE通过并行预测标记分布实现可靠的约束解码,提升扩散大语言模型在上下文无关文法下的生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20232 2026-02-10 cs.CV

Visual Prompt-Agnostic Evolution

视觉提示无关进化

Junze Wang, Lei Fan, Dezheng Zhang, Weipeng Jing, Donglin Di, Yang Song, Sidong Liu, Cong Cong

机构 * University of Science and Technology Beijing(北京科技大学) University of New South Wales(新南威尔士大学) Northeast Forestry University(东北林业大学) Tsinghua University(清华大学) Macquarie University(麦考瑞大学)

AI总结 PAE通过显式建模提示动态,提升视觉提示调优的收敛速度和准确性,适用于多种下游任务。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14042 2026-02-10 cs.RO

Sim-to-Real Dynamic Object Manipulation on Conveyor Systems via Optimization Path Shaping

通过优化路径塑形实现 conveyor 系统上的动态物体操控

Zhuoling Li, Jinrong Yang, Yong Zhao, Liangliang Ren, Xiaoyang Wu, Zhenhua Xu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) CVTE(中国建筑第三工程局) Tsinghua University(清华大学)

AI总结 本文提出GEM方法,通过优化路径塑形解决动态物体操控中的数据稀缺问题,实现跨环境背景和物体几何的泛化,成功应用于现实餐厅餐具收集任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19595 2026-02-10 cs.CL cs.AI

Efficient Attention Mechanisms for Large Language Models: A Survey

大型语言模型中的高效注意力机制:综述

Yutao Sun, Zhenyu Li, Yike Zhang, Tengyu Pan, Bowen Dong, Yuyi Guo, Jianyong Wang

机构 * Tsinghua University(清华大学)

AI总结 本文综述了大型语言模型中高效注意力机制的发展,包括线性注意力和稀疏注意力方法,并分析了其在大规模预训练模型中的应用与设计。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏