arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 112 篇

2603.05863 2026-04-21 cs.CL cs.LG cs.SE 88%

ReflexiCoder: Teaching Large Language Models to Self-Reflect on Generated Code and Self-Correct It via Reinforcement Learning

ReflexiCoder:通过强化学习教大语言模型自我反思和自我纠正生成的代码

Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Amazon AGI(亚马逊人工智慧实验室) NAVER Cloud(NAVER云)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReflexiCoder,一种基于强化学习的框架,使大语言模型在推理过程中自我反思和纠正代码,通过细粒度奖励函数优化整个反思-纠正过程,实现无需外部反馈的自我调试能力,实验表明其在多个基准测试中表现优异,且在推理效率上更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07794 2026-04-21 cs.CL cs.AI 88%

Emergent Structured Representations Support Flexible In-Context Inference in Large Language Models

涌现的结构化表示支持大型语言模型中的灵活上下文推理

Ningyu Xu, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai, China(中国上海)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大型语言模型在上下文推理中通过结构化表示动态构建和利用潜在表示,为灵活适应的计算过程提供新见解。

Comments 36 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16913 2026-04-21 cs.AI cs.CL cs.CR cs.DC 88%

The Cognitive Penalty: Ablating System 1 and System 2 Reasoning in Edge-Native SLMs for Decentralized Consensus

认知惩罚:在边缘原生SLM中消融系统1和系统2推理以实现去中心化共识

Syed Muhammad Aqdas Rizvi

机构 * Independent Researcher(独立研究者) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 效率与部署 :SLM(title_cn,summary_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了边缘原生SLM中系统1和系统2推理对去中心化共识的影响,发现系统1在对抗性环境中表现更优,而系统2导致计算准确率倒置和稳定性下降。

Comments Working paper. 14 pages, 3 figures, 6 tables. Code and dataset: https://github.com/smarizvi110/sentinel-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09025 2026-04-21 cs.CL cs.LG 88%

Lizard: An Efficient Linearization Framework for Large Language Models

Lizard:一种高效的大型语言模型线性化框架

Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 Lizard提出一种高效线性化框架,将预训练的Transformer大型语言模型转换为亚二次架构,通过亚二次注意力机制提升计算效率,实现模型质量与内存控制的平衡。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03052 2026-04-21 cs.LG cs.AI 88%

From 2:4 to 8:16 sparsity patterns in LLMs for Outliers and Weights with Variance Correction

从2:4到8:16稀疏模式在LLM中的应用:用于异常值和方差校正的权重

Egor Maximov, Yulia Kuzkina, Azamat Kanametov, Alexander Prutko, Aleksei Goncharov, Maxim Zhelnin, Egor Shvetsov

机构 * Moscow Independent Research Institute of Artificial Intelligence(莫斯科独立人工智能研究 institute) MIL Team(MIL 团队) MWS AI(MWS 人工智能) Applied AI(应用人工智能)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了8:16半结构化稀疏模式在LLM中的应用,通过方差校正和权重平等化技术提升稀疏模型性能,展示其在压缩与精度间的平衡优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18092 2026-04-21 cs.LG 88%

Generalization Boundaries of Fine-Tuned Small Language Models for Graph Structural Inference

微调小语言模型在图结构推断中的泛化边界

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.LG

AI总结 研究微调小语言模型在图结构推断中的泛化能力,通过图大小和图族分布两个维度评估其在超出训练条件时的表现,揭示模型在不同架构下的退化特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10154 2026-04-21 cs.CR cs.AI cs.MM 88%

PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models

PRISM-XR: 通过多模态大语言模型赋能隐私感知的扩展现实协作

Jiangong Chen, Mingyu Zhu, Bin Li

机构 * Department of Electrical Engineering, The Pennsylvania State University, University Park, PA 16802, USA(电气工程系,宾夕法尼亚州立大学,University Park,PA 16802,USA)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出PRISM-XR框架,通过边缘服务器智能预处理过滤敏感数据,实现隐私保护的多用户XR协作,实验表明其在准确性和隐私保护方面表现优异。

Comments Accepted to the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR)

Journal ref 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17087 2026-04-21 cs.CV cs.LG 88%

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

EvoComp: 通过语义引导的进化标注学习多模态大语言模型的视觉令牌压缩

Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na

机构 * OPPO CTG

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出EvoComp框架,通过语义引导的进化标注策略,有效压缩视觉令牌数量,同时保持任务精度,实验显示在3倍压缩下保持99.3%的准确率,并在移动设备上提升1.6倍速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14582 2026-04-21 cs.CV 88%

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip:面向快速多模态大语言模型的音频引导动态令牌压缩

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出OmniZip,一种无需训练的音频引导多模态令牌压缩框架,通过动态压缩音频视频令牌提升推理速度和内存效率,保持模型性能。

Comments [CVPR 2026] Code Link: https://github.com/KD-TAO/OmniZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18085 2026-04-21 cs.LG 87%

Predicting LLM Compression Degradation from Spectral Statistics

从谱统计预测大语言模型压缩退化

Mingxue Xu

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过分析四种低秩压缩方法,发现稳定秩和信息密度主导性能退化,提出γ·ρ_s交互项作为准确度退化的预测指标,实现了高相关性验证。

Comments Profoundly assisted by agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18519 2026-04-21 cs.AI 87%

LLM Safety From Within: Detecting Harmful Content with Internal Representations

从内部检测有害内容:利用内部表示进行LLM安全

Difan Jiao, Yilun Liu, Ye Yuan, Zhenwei Tang, Linfeng Du, Haolun Wu, Ashton Anderson

机构 * University of Toronto(多伦多大学) McGill University(麦吉尔大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 SIREN通过利用内部层特征提升有害内容检测性能,相比现有模型更高效且泛化能力强。

Comments 17 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18131 2026-04-21 cs.AI 87%

Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

通过世界知识探索训练具有自发、无奖励自我进化的LLM代理

Qifan Zhang, Dongyang Ma, Tianqing Fang, Jia Li, Jing Tang, Nuo Chen, Haitao Mi, Yan Wang

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一种无需外部监督的LLM代理自我进化方法,通过世界知识探索提升任务成功率,实验表明在WebVoyager和WebWalker上性能提升20%,并使紧凑型Qwen3模型超越Gemini-2.5-Flash。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04545 2026-04-21 cs.LG cs.DB 87%

An LLM-Guided Query-Aware Inference System for GNN Models on Large Knowledge Graphs

面向大规模知识图谱的LLM引导的查询感知推理系统

Waleed Afandi, Hussein Abdallah, Ashraf Aboulnaga, Essam Mansour

机构 * Concordia University(康科德大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出KG-WISE框架,通过将GNN模型分解为细粒度组件,并利用大语言模型生成查询模板,实现查询感知的高效推理,提升推理速度和降低内存使用。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17701 2026-04-21 cs.IT cs.AI math.IT 87%

WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference

WISV:无线感知语义验证用于设备-边缘分布式推测解码

Zixuan Liu, Zhiyong Chen, Nan Xue, Shengkang Chen, Jiangchao Yao, Meixia Tao, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center(联合中位网创新中心) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出WISV框架,通过通道感知语义接受策略优化分布式推测解码,提升接受长度和降低交互轮次,实验证明在设备边缘LLM推理中具有显著性能优势。

Comments submitted to IEEE Trans

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17091 2026-04-21 cs.CL 87%

GenericAgent: A Token-Efficient Self-Evolving LLM Agent via Contextual Information Density Maximization (V1.0)

GenericAgent:通过上下文信息密度最大化实现的高效自演化大语言模型代理(V1.0)

Jiaqing Liang, Jinyi Han, Weijia Li, Xinyi Wang, Zhoujia Zhang, Zishang Jiang, Ying Liao, Tingyun Li, Ying Huang, Hao Shen, Hanyu Wu, Fang Guo, Keyi Wang, Zhonghua Hong, Zhiyu Lu, Lipeng Ma, Sihang Jiang, Yanghua Xiao

机构 * Advantage AI Agent Lab (A3 Lab)(优势人工智能代理实验室(A3实验室)) Shenzhen Aquaintelling Technology(深圳Aquaintelling科技) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GenericAgent通过上下文信息密度最大化实现高效自演化,优于现有代理系统,且在token和交互上更节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16469 2026-04-21 cs.DC cs.AI 87%

B-PASTE: Beam-Aware Pattern-Guided Speculative Execution for Resource-Constrained LLM Agents

B-PASTE:面向资源受限LLM代理的束感知模式引导推测执行

Yanfei Song

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 B-PASTE通过束感知技术,在资源受限条件下实现局部分支假设的推测执行,优先执行快路径并利用安全并行,提升端到端效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16350 2026-04-21 cs.IR cs.AI 87%

LiteSemRAG: Lightweight LLM-Free Semantic-Aware Graph Retrieval for Robust RAG

LiteSemRAG: 轻量级无大语言模型的语义感知图检索用于鲁棒性RAG

Xiao Yue, Guangzhi Qu, Lige Gan

机构 * Oakland University(奥克兰大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LiteSemRAG,一种轻量级无大语言模型的语义感知图检索框架,通过构建异构语义图并分离表层词义与上下文依赖语义,提升检索鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18231 2026-04-21 cs.CR cs.OS 87%

AgenTEE: Confidential LLM Agent Execution on Edge Devices

AgenTEE: 在边缘设备上实现保密大语言模型代理执行

Sina Abdollahi, Mohammad M Maheri, Javad Forough, Amir Al Sadi, Josh Millar, David Kotz, Marios Kogias, Hamed Haddadi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出AgenTEE系统,通过在边缘设备上部署保密虚拟机实现安全代理管道执行,降低延迟并保护隐私,实验显示其性能接近原生水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16401 2026-04-21 cs.IR cs.AI 86%

GraphRAG-Router: Learning Cost-Efficient Routing over GraphRAGs and LLMs with Reinforcement Learning

GraphRAG-Router: 通过强化学习学习高效的图RAGs和LLM路由

Dongzhe Fan, Chuanhao Ji, Zimu Wang, Tong Chen, Qiaoyu Tan

机构 * Department of Computer Science, New York University (Shanghai)(纽约大学(上海)计算机科学系) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系)

专题命中 效率与部署 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出GraphRAG-Router,通过分层路由策略协调异构图RAGs和生成LLM,通过强化学习优化生成分配,降低大模型使用成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01936 2026-04-21 cs.CL cs.CY 86%

The Thin Line Between Comprehension and Persuasion in LLMs

在语言模型中理解与说服之间的微妙界限

Adrian de Wynter, Tangming Yuan

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过人机辩论探讨LLM的说服能力是否反映真实理解,发现其能维持连贯对话但缺乏深层对话结构理解,揭示了部署在解释关键场景中的伦理与实践问题。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17659 2026-04-21 cs.CL cs.AI 86%

Semantic Density Effect (SDE): Maximizing Information Per Token Improves LLM Accuracy

语义密度效应(SDE):最大化信息每token提升大语言模型准确性

Amr Ahmed

机构 * Public Health Department, Riyadh First Health Cluster Ministry of Health, Saudi Arabia(沙特阿拉伯利雅得第一健康集群卫生部)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出语义密度效应,通过提高每个token的语义信息量提升LLM准确性,实验显示高密度提示在多个模型和基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16625 2026-04-21 cs.CL cs.AI cs.LG 86%

AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation

AdaExplore: 基于失败的适应与多样性保持搜索用于高效内核生成

Weihua Du, Jingming Zhuo, Yixin Dong, Andre Wang He, Weiwei Sun, Zeyu Zheng, Manupa Karunaratne, Ivan Fox, Tim Dettmers, Tianqi Chen, Yiming Yang, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Arm Ltd(Arm有限公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 AdaExplore通过积累执行反馈实现自我改进,通过失败驱动适应和多样性保持搜索提升内核生成的正确性和优化性能,无需额外微调或外部知识。

Comments Preliminary work. The implementation is available at https://github.com/StigLidu/AdaExplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04278 2026-04-21 cs.CL cs.AI cs.CR cs.LG 85%

From Domains to Instances: Dual-Granularity Data Synthesis for LLM Unlearning

从领域到实例:双粒度数据合成用于大语言模型去学习

Xiaoyu Xu, Minxin Du, Zitong Li, Zi Liang, Zhibiao Guo, Shiyu Zhang, Peizhao Hu, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Huawei Technologies(华为技术)

专题命中 效率与部署 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BiForget框架,通过双粒度数据合成提升大语言模型去学习的效率与效果,实验显示其在相关性、多样性和效率方面表现优异。

Comments ACL 2026 (Findings), accepted to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18232 2026-04-21 cs.LG cs.AI cs.CL 83%

Two-Stage Regularization-Based Structured Pruning for LLMs

基于两阶段正则化的结构剪枝用于大语言模型

Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TRSP方法,通过两阶段正则化提升大语言模型结构剪枝效果,减少知识损失并无需重新训练,实验显示其优于现有方法,实现高效部署。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16957 2026-04-21 cs.LG 83%

Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon

Open-TQ-Metal:融合压缩域注意力的长上下文LLM推理

Sai Vegasena

机构 * Apple Silicon

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 Open-TQ-Metal在Apple Silicon上实现了首个融合压缩域注意力的实现,使Llama 3.1 70B在单台64GB Mac上实现128K上下文推理,通过量化KV缓存和自定义Metal计算着色器提升了推理效率和内存利用率。

Comments 8 pages, 8 figures, 8 tables. Code: https://github.com/svv232/gemma4metal and https://github.com/svv232/turboquant-llama3.170B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 82%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 82%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16952 2026-04-21 cs.CV 82%

Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder

更少的协同,更好的表现:通过条件和降质掩码自编码器解决异质多模态图像联合预训练

Bowen Peng, Yongxiang Liu, Jie Zhou, Xiaodong Chen, Tianpeng Liu, Xiaogang Yu, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology (NUDT)(电子科学与技术学院,国防科技大学) Beijing Institute of Remote Sensing Information(遥感信息研究所)

专题命中 效率与部署 :pretraining(title,abstract);foundation model(abstract)

AI总结 本文提出CoDe-MAE,通过Optical-anchored Knowledge Distillation和Conditioned Contrastive Learning解决高分辨率多模态联合预训练中的异质性-分辨率悖论,有效防止表示退化并在多个下游任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18296 2026-04-21 cs.CL 81%

Exploring Concreteness Through a Figurative Lens

通过隐喻视角探索具体性

Saptarshi Ghosh, Tianyu Jiang

机构 * University of Cincinnati(俄亥俄州立大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究探讨LLM如何区分字面与隐喻用法,发现早期层分离具体性,中后期层压缩为一维方向,该结构可提升隐喻分类和生成控制。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18159 2026-04-21 cs.CL 81%

FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs

FreezeEmpath: 基于冻结大语言模型的高效共情语音聊天机器人训练

Yun Hong, Yan Zhou, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所,中国科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 FreezeEmpath,通过冻结大语言模型参数,利用现有语音指令和情感识别数据高效训练共情语音聊天机器人,实现情感表达和对话性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏