arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-14 至 2026-01-14 共收录 188 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 29 篇

2601.08273 2026-01-14 cs.CV cs.AI 86%

HIPPO: Accelerating Video Large Language Models Inference via Holistic-aware Parallel Speculative Decoding

HIPPO:通过整体感知并行推测解码加速视频大语言模型推理

Qitan Lv, Tianyu Liu, Wen Wu, Xuenan Xu, Bowen Zhou, Feng Wu, Chao Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 HIPPO通过整体感知并行推测解码框架,有效提升视频大语言模型推理速度,实现高达3.51倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08742 2026-01-14 cs.CL 85%

Inferring Latent Intentions: Attributional Natural Language Inference in LLM Agents

推断潜在意图:在LLM代理中进行归因性自然语言推理

Xin Quan, Jiafeng Xiong, Marco Valentino, André Freitas

机构 * University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(国家生物标志物中心,CRUK-MI,曼彻斯特大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出归因性NLI框架,通过文本游戏实验展示其在多智能体环境中提升LLM推理能力的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07839 2026-01-14 cs.LG cs.AI 84%

Hierarchical Sparse Plus Low Rank Compression of LLM

层级稀疏加低秩压缩LLM

Pawan Kumar, Aditi Gupta

机构 * International Institute of Information Technology, Hyderabad(国际信息科技研究所,海得拉巴)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HSS压缩方法,通过稀疏和低秩分解实现LLM的高效压缩,实验表明在内存节省的同时保持高性能。

Comments 9 pages, 3 figures, Accepted in ACM International Conference on Data Science, CODS-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09629 2026-01-14 cs.LG stat.AP stat.ME stat.ML 83%

Quantization Error Propagation: Revisiting Layer-Wise Post-Training Quantization

量化误差传播:重新审视分层后训练量化

Yamato Arai, Yuma Ichikawa

机构 * Fujitsu Limited(富士通有限公司) Department of Basic Science(基础科学系) The University of Tokyo(东京大学) RIKEN center for AIP(理化学研究所AIP中心)

专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出QEP框架,通过显式传播量化误差以提升分层后训练量化在低比特下的性能。

Comments 29 pages, 3 figures, Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02369 2026-01-14 cs.CL cs.AI 81%

AutoContext: Instance-Level Context Learning for LLM Agents

AutoContext:LLM代理的实例级上下文学习

Kuntai Cai, Juncheng Liu, Xianglin Yang, Zhaojie Niu, Xiaokui Xiao, Xing Chen

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 AutoContext通过解耦探索与任务解决,为LLM代理构建结构化的实例上下文,显著提升了任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04403 2026-01-14 cs.CL 79%

Dialogue Response Prefetching Based on Semantic Similarity and Prediction Confidence of Language Model

基于语义相似度和语言模型预测置信度的对话响应预取

Kiyotada Mori, Seiya Kawano, Angel Fernando Garcia Contreras, Koichiro Yoshino

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) RIKEN(理化学研究所) Tokyo Institute of Technology(东京技术大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出基于语义相似度和语言模型预测置信度的对话响应预取方法,旨在减少用户感知延迟。

Comments Corrected typographical errors, including the number of subjects in the response evaluation experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08169 2026-01-14 cs.CL cs.LG 79%

Relational Knowledge Distillation Using Fine-tuned Function Vectors

基于微调函数向量的关系知识蒸馏

Andrea Kang, Yingnian Wu, Hongjing Lu

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过微调函数向量提升关系知识表示,增强语言模型的类比推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06926 2026-01-14 cs.SD eess.AS 78%

Continuous Audio Language Models

连续音频语言模型

Simon Rouard, Manu Orsini, Axel Roebel, Neil Zeghidour, Alexandre Défossez

机构 * Kyutai UMR STMS IRCAM-CNRS Sorbonne Univ.(Sorbonne University)

专题命中 效率与部署 :language model(title,abstract)

AI总结 连续音频语言模型通过避免有损压缩提升音频生成质量与效率,同时发布开源文本到语音模型

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05179 2026-01-14 cs.CV 78%

Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models

全局压缩指挥者:面向高分辨率大视觉-语言模型的即插即用推理加速

Xuyang Liu, Ziming Wang, Junjie Chen, Yuhang Han, Yingyao Wang, Jiale Yuan, Jun Song, Siteng Huang, Honggang Chen

机构 * Alibaba(阿里巴巴)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出GlobalCom²框架,通过全局缩略图引导局部裁剪压缩,实现高分辨率LVLMs的高效推理加速。

Comments Accepted by AAAI 2026. Code is available at \url{https://github.com/xuyang-liu16/GlobalCom2}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08539 2026-01-14 cs.PF cs.LG 77%

Reducing Compute Waste in LLMs through Kernel-Level DVFS

通过内核级DVFS减少LLM中的计算浪费

Jeffrey Spaan, Kuan-Hsun Chen, Ana-Lucia Varbanescu

机构 * University of Twente(特文特大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出内核级DVFS方法,通过优化频率配置显著降低LLM训练能耗,同时仅小幅牺牲性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08254 2026-01-14 cs.AI cs.SY eess.SY 77%

Large Artificial Intelligence Model Guided Deep Reinforcement Learning for Resource Allocation in Non Terrestrial Networks

大人工智能模型引导的深度强化学习用于非地面网络资源分配

Abdikarim Mohamed Ibrahim, Rosdiadee Nordin

机构 * Faculty of Engineering, Sunway University, Petaling Jaya, Malaysia(工程学院,Sunway大学,Petaling Jaya,马来西亚) Future Cities Research Institute, Sunway University, Petaling Jaya, Malaysia(未来城市研究 institute,Sunway大学,Petaling Jaya,马来西亚)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型引导深度强化学习,以提升非地面网络资源分配的性能,在极端天气下表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02371 2026-01-14 cs.CY cs.AI cs.MA cs.NI 77%

Permission Manifests for Web Agents

基于Web代理的权限声明

Samuele Marro, Alan Chan, Xinxing Ren, Lewis Hammond, Jesse Wright, Gurjyot Wanga, Tiziano Piccardi, Nuno Campos, Tobin South, Jialin Yu, Sunando Sengupta, Eric Sommerlade, Alex Pentland, Philip Torr, Jiaxin Pei

机构 * University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所) Centre for the Governance of AI(人工智能治理中心) Coral Protocol(珊瑚协议) Cooperative AI Foundation(协作人工智能基金会) Webair Johns Hopkins University(约翰霍普金斯大学) Witan Labs(Witan实验室) Stanford University(斯坦福大学) Microsoft(微软) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 agent-permissions.json,一种轻量级声明,用于规范 Web 代理的交互权限,以提升自动化应用与网站所有者的协调性。

Comments Authored by the Lightweight Agent Standards Working Group https://las-wg.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16151 2026-01-14 cs.AR cs.CL 77%

Hardwired-Neurons Language Processing Units as General-Purpose Cognitive Substrates

硬连线神经元语言处理单元作为通用认知基质

Yang Liu, Yi Chen, Yongwei Zhao, Yifan Hao, Zifu Zheng, Weihao Kong, Zhangmai Li, Dongchen Jiang, Ruiyang Xia, Zhihong Ma, Zisheng Liu, Zhaoyong Wan, Yunqi Lu, Ximing Liu, Hongrui Guo, Zhihao Yang, Zhe Wang, Tianrui Ma, Mo Zou, Rui Zhang, Ling Li, Xing Hu, Zidong Du, Zhiwei Xu, Qi Guo, Tianshi Chen, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Software, CAS(软件研究所,中国科学院) Cambricon Technologies

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出硬连线神经元语言处理单元,通过金属嵌入技术降低光掩模成本,实现高效能低能耗的语言处理基质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07892 2026-01-14 cs.LG cs.AI 73%

Sherry: Hardware-Efficient 1.25-Bit Ternary Quantization via Fine-grained Sparsification

Sherry:通过细粒度稀疏化实现高效的1.25位三元量化

Hong Huang, Decheng Wu, Qiangqiang Hu, Guanghua Yu, Jinhai Yang, Jianchen Zhu, Xue Liu, Dapeng Wu

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯) McGill University(麦吉尔大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Sherry通过细粒度稀疏化实现高效的1.25位三元量化,显著减少模型大小并提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08475 2026-01-14 cs.AI cs.HC 70%

SUMMPILOT: Bridging Efficiency and Customization for Interactive Summarization System

SUMMPILOT:在交互式摘要系统中平衡效率与定制化

JungMin Yun, Juhwan Choi, Kyohoon Jin, Soojin Jang, Jinhee Jang, YoungBin Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SUMMPILOT是一种通过交互式组件实现个性化摘要的系统,结合大型语言模型提升效率与定制化能力。

Comments Accepted to AAAI 2025 Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08412 2026-01-14 cs.AI 70%

Hybrid Distillation with CoT Guidance for Edge-Drone Control Code Generation

混合指导的蒸馏用于边缘-无人机控制代码生成

Yizhan Feng, Hichem Snoussi, Yuhang Wang, Jing Teng, Abel Cherouat, Tian Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出混合指导的蒸馏方法,通过知识蒸馏、思维链指导和监督微调,提升UAV多SDK控制任务的代码生成效率与准确性。

Comments 2nd International Conference on Drones and Unmanned Systems (DAUS' 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08800 2026-01-14 cs.DC 67%

MixServe: An Automatic Distributed Serving System for MoE Models with Hybrid Parallelism Based on Fused Communication Algorithm

MixServe: 一种基于融合通信算法的混合并行机制的自动分布式服务系统,用于高效部署MoE模型

Bowen Zhou, Jinrui Jia, Wenhao He, Yong Zhang, Fang Dong

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 MixServe通过融合AR-A2A通信算法的混合并行机制,实现MoE模型的高效部署,显著提升了推理性能和吞吐量。

Comments Submitted to ICDCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08113 2026-01-14 eess.SY cs.DC cs.SY 67%

Coordinated Cooling and Compute Management for AI Datacenters

AI数据中心的协调冷却与计算管理

Nardos Belay Abera, Yize Chen

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 本文提出了一种协调冷却与计算管理的方法,以提高AI数据中心的能效并减少碳排放。

Comments In Submission, 12 pages, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07778 2026-01-14 cs.AR cs.ET 67%

H3PIMAP: A Heterogeneity-Aware Multi-Objective DNN Mapping Framework on Electronic-Photonic Processing-in-Memory Architectures

H3PIMAP:一种异质性感知的多目标深度神经网络映射框架,用于电子-光子处理在内存架构

Ziang Yin, Aashish Poonia, Ashish Reddy Bommana, Xinyu Zhao, Zahra Hojati, Tianlong Chen, Krishnendu Chakrabarty, Farshad Firouzi, Jeff Zhang, Jiaqi Gu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 H3PIMAP框架通过混合电子-光子-PIM架构,实现异质性感知的多目标深度神经网络映射,提升AI加速的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08584 2026-01-14 cs.CL 57%

Ministral 3

Ministral 3:参数高效密集语言模型系列

Alexander H. Liu, Kartik Khandelwal, Sandeep Subramanian, Victor Jouault, Abhinav Rastogi, Adrien Sadé, Alan Jeffares, Albert Jiang, Alexandre Cahill, Alexandre Gavaudan, Alexandre Sablayrolles, Amélie Héliou, Amos You, Andy Ehrenberg, Andy Lo, Anton Eliseev, Antonia Calvi, Avinash Sooriyarachchi, Baptiste Bout, Baptiste Rozière, Baudouin De Monicault, Clémence Lanfranchi, Corentin Barreau, Cyprien Courtot, Daniele Grattarola, Darius Dabert, Diego de las Casas, Elliot Chane-Sane, Faruk Ahmed, Gabrielle Berrada, Gaëtan Ecrepont, Gauthier Guinet, Georgii Novikov, Guillaume Kunsch, Guillaume Lample, Guillaume Martin, Gunshi Gupta, Jan Ludziejewski, Jason Rute, Joachim Studnia, Jonas Amar, Joséphine Delas, Josselin Somerville Roberts, Karmesh Yadav, Khyathi Chandu, Kush Jain, Laurence Aitchison, Laurent Fainsin, Léonard Blier, Lingxiao Zhao, Louis Martin, Lucile Saulnier, Luyu Gao, Maarten Buyl, Margaret Jennings, Marie Pellat, Mark Prins, Mathieu Poirée, Mathilde Guillaumin, Matthieu Dinot, Matthieu Futeral, Maxime Darrin, Maximilian Augustin, Mia Chiquier, Michel Schimpf, Nathan Grinsztajn, Neha Gupta, Nikhil Raghuraman, Olivier Bousquet, Olivier Duchenne, Patricia Wang, Patrick von Platen, Paul Jacob, Paul Wambergue, Paula Kurylowicz, Pavankumar Reddy Muddireddy, Philomène Chagniot, Pierre Stock, Pravesh Agrawal, Quentin Torroba, Romain Sauvestre, Roman Soletskyi, Rupert Menneer, Sagar Vaze, Samuel Barry, Sanchit Gandhi, Siddhant Waghjale, Siddharth Gandhi, Soham Ghosh, Srijan Mishra, Sumukh Aithal, Szymon Antoniak, Teven Le Scao, Théo Cachet, Theo Simon Sorg, Thibaut Lavril, Thiziri Nait Saada, Thomas Chabal, Thomas Foubert, Thomas Robert, Thomas Wang, Tim Lawson, Tom Bewley, Tom Bewley, Tom Edwards, Umar Jamil, Umberto Tomasini, Valeriia Nemychnikova, Van Phung, Vincent Maladière, Virgile Richard, Wassim Bouaziz, Wen-Ding Li, William Marshall, Xinghui Li, Xinyu Yang, Yassine El Ouahidi, Yihan Wang, Yunhao Tang, Zaccharie Ramzi

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 Ministral 3系列提供三种参数规模的高效密集语言模型,支持图像理解,并通过级联蒸馏技术实现复杂问题解决能力。

Comments Release page: https://mistral.ai/news/mistral-3 ; Models available at https://huggingface.co/collections/mistralai/ministral-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08280 2026-01-14 cs.AI 57%

Greedy Is Enough: Sparse Action Discovery in Agentic LLMs

贪婪即足够:代理大语言模型中的稀疏动作发现

Angshul Majumdar

机构 * Angshul Majumdar(独立研究者)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于贪心算法的稀疏动作发现方法,通过结构稀疏性假设在代理大语言模型中有效识别关键动作,为动作修剪提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08128 2026-01-14 cs.AI 57%

Embedded AI Companion System on Edge Devices

边缘设备上的嵌入式AI伴侣系统

Rahul Gupta, Stephen D. H. Hsu

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 本文提出了一种在边缘设备上运行的AI伴侣系统,通过交替的内存活动和非活动阶段,实现低延迟实时对话与长期个性化,实验表明其在多个指标上优于无内存LLM,接近GPT-3.5性能。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07861 2026-01-14 cs.CL cs.IR 57%

EmbeddingRWKV: State-Centric Retrieval with Reusable States

EmbeddingRWKV: 基于可重用状态的检索方法

Haowen Hou, Jie Yang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Shenzhen Yuanshi Intelligence Co., Ltd(深圳元世智能科技有限公司)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 EmbeddingRWKV通过统一的嵌入模型和状态骨干,实现高效检索与重排序,提升系统效率。

Comments 23 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 50%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 17 篇

2512.20002 2026-01-14 cs.LG 92%

LoFT-LLM: Low-Frequency Time-Series Forecasting with Large Language Models

LoFT-LLM: 利用大语言模型进行低频时间序列预测

Jiacheng You, Jingcheng Yang, Yuhang Xie, Zhongxuan Wu, Xiucheng Li, Feng Li, Pengjie Wang, Jian Xu, Bo Zheng, Xinyang Chen

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学)

专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 LoFT-LLM通过整合大语言模型与低频学习,提升时间序列预测的准确性、鲁棒性和可解释性。

Comments This submission is withdrawn due to internal review and compliance considerations

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07954 2026-01-14 cs.CL 90%

A Human-Centric Pipeline for Aligning Large Language Models with Chinese Medical Ethics

面向中文医疗伦理的以人为本的大型语言模型对齐流水线

Haoan Jin, Han Ying, Jiacheng Ji, Hanhui Xu, Mengyue Wu

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文提出MedES基准和 guardian-in-the-loop 框架,通过监督微调和偏好优化,实现中文医疗伦理场景下的LLM对齐,提升伦理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08148 2026-01-14 cs.IR cs.AI cs.LG 90%

Enriching Semantic Profiles into Knowledge Graph for Recommender Systems Using Large Language Models

利用大语言模型丰富知识图谱中的语义轮廓以提升推荐系统

Seokho Ahn, Sungbok Shin, Young-Duk Seo

机构 * Inha University(成均馆大学) Sogang University(成均馆大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SPiKE模型,利用大语言模型生成知识图谱中的语义轮廓,通过轮廓聚合和偏好匹配提升推荐系统性能。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06780 2026-01-14 cs.CL cs.AI 86%

Foundations of LLM Knowledge Materialization: Termination, Reproducibility, Robustness

LLM知识材料化的基础:终止性、可重现性与鲁棒性

Luca Giordano, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(ScaDS.AI 德累斯顿/莱比锡及德累斯顿技术大学,德国)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM知识材料化的终止性、可重现性和鲁棒性,通过实验揭示了不同因素对知识提取效果的影响。

Comments Accepted and published in Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07935 2026-01-14 cs.LG cs.AI cs.CL 85%

Towards Specialized Generalists: A Multi-Task MoE-LoRA Framework for Domain-Specific LLM Adaptation

迈向专业化的通用者:一种多任务MoE-LoRA框架用于领域特定LLM适应

Yuxin Yang, Aoxiong Zeng, Xiangquan Yang

机构 * Shanghai University(上海大学) East China Normal University(东华大学)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Med-MoE-LoRA框架,通过结合MoE与LoRA实现高效多任务领域适应,尤其适用于医学场景,有效解决领域知识获取与通用能力保留的难题。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16041 2026-01-14 cs.LG cs.AI 81%

Explainable Molecular Property Prediction: Aligning Chemical Concepts with Predictions via Language Models

可解释性分子性质预测:通过语言模型对齐化学概念与预测

Zhenzhong Wang, Zehui Lin, Wanyu Lin, Ming Yang, Minggang Zeng, Kay Chen Tan

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Computing and Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(计算系和数据科学与人工智能系,香港理工大学) Department of Applied Physics, The Hong Kong Polytechnic University(应用物理系,香港理工大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科技研究局(A*STAR))

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Lamole通过结合自注意力权重和梯度,提供与化学概念对齐的解释,提升分子性质预测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏