arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 362 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 61 篇

2601.06566 2026-01-13 cs.CV cs.AI 77%

QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models

QCaption: 通过融合大多模态模型实现视频描述与问答

Jiale Wang, Gee Wah Ng, Lee Onn Mak, Randall Cher, Ng Ding Hei Ryan, Davis Wang

机构 * Department of Computer Science and Engineering, Nanyang Technological University, Singapore(南洋理工大学计算机科学与工程系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 QCaption通过融合关键帧提取、多模态模型和语言模型,提升视频描述和问答任务的性能,实现44.2%和48.9%的改进。

Journal ref Proceedings of the 27th International Conference on Information Fusion (FUSION), 2024, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06564 2026-01-13 cs.CL 77%

CSR-RAG: An Efficient Retrieval System for Text-to-SQL on the Enterprise Scale

CSR-RAG:面向企业级文本到SQL的高效检索系统

Rajpreet Singh, Novak Boškov, Lawrence Drabeck, Aditya Gudal, Manzoor A. Khan

机构 * Technical University of Munich(慕尼黑技术大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CSR-RAG通过结合上下文、结构和关系检索,高效支持企业级文本到SQL任务,实现高精度与低延迟的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06407 2026-01-13 cs.CL 77%

Value of Information: A Framework for Human-Agent Communication

信息价值:人类-智能体通信的框架

Yijiang River Dong, Tiancheng Hu, Zheng Hui, Caiqi Zhang, Ivan Vulić, Andreea Bobu, Nigel Collier

机构 * University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于信息价值的框架,使智能体在人类-智能体通信中动态权衡信息获取与用户认知成本,实现高效适应性决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16273 2026-01-13 eess.SP 75%

Fast Collaborative Inference via Distributed Speculative Decoding

通过分布式推测解码实现快速协同推理

Ce Zheng, Ke Zhang, Chen Sun, Wenqi Zhang, Qiong Liu, Angesom Ataklity Tesfay

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出截断稀疏日志传输策略,通过减少上行通信开销实现高效分布式LLM推理,在保持推理延迟和模型质量的同时提升通信效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18167 2026-01-13 eess.SP 75%

ICWLM: A Multi-Task Wireless Large Model via In-Context Learning

ICWLM:一种通过上下文学习的多任务无线大模型

Yuxuan Wen, Xiaoming Chen, Maojun Zhang, Zhaohui Yang, Chongwen Huang, Zhaoyang Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 ICWLM通过上下文学习实现多任务无线大模型,解决物理层多任务学习中的数据稀缺和泛化问题,提升无线网络的智能资源管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06652 2026-01-13 cs.RO 75%

Follow the Signs: Using Textual Cues and LLMs to Guide Efficient Robot Navigation

跟随标识:利用文本线索和大语言模型引导高效的机器人导航

Jing Cao, Nishanth Kumar, Aidan Curtis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型和符号模式提升机器人在稀疏环境中高效导航的能力,通过文本线索预测目标位置并优化路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06142 2026-01-13 cs.CL cs.AI cs.LG 75%

Is Sanskrit the most token-efficient language? A quantitative study using GPT, Gemini, and SentencePiece

梵语是最高效的token语言吗?使用GPT、Gemini和SentencePiece的定量研究

Anshul Kumar

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过GPT、Gemini和SentencePiece验证梵语在token效率上的优势,发现其在无偏分词下比英语/印地语更紧凑,但最新模型仍无法完全捕捉其紧凑性。

Comments 9 pages, 4 figures. Code and dataset available at: https://github.com/anshulkr713/sanskrit-token-efficiency

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07354 2026-01-13 cs.CL 74%

Semantic Compression of LLM Instructions via Symbolic Metalanguages

通过符号元语言实现大语言模型指令的语义压缩

Ernst van Gassen

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title);分类 cs.CL

AI总结 MetaGlyph通过符号元语言实现大语言模型指令压缩,显著减少token数量并提升解析效率。

Comments 12 pages and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06551 2026-01-13 cs.IR cs.AI cs.CL 73%

L-RAG: Balancing Context and Retrieval with Entropy-Based Lazy Loading

L-RAG:基于熵的惰性加载平衡上下文与检索

Sergii Voloshyn

机构 * Faculty of Computer Science and Cybernetics(计算机科学与自动化系) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) ClickUp(ClickUp公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 L-RAG通过基于熵的惰性加载机制,在准确率与效率之间提供可调节的权衡,有效减少检索开销并提升RAG系统的部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06463 2026-01-13 cs.LG cs.CL 73%

Gecko: An Efficient Neural Architecture Inherently Processing Sequences with Arbitrary Lengths

Gecko:一种高效神经架构,能够处理任意长度的序列

Xuezhe Ma, Shicheng Wen, Linghao Jin, Bilge Acun, Ruihang Lai, Bohan Hou, Will Lin, Hao Zhang, Songlin Yang, Ryan Lee, Mengxi Wu, Jonathan May, Luke Zettlemoyer, Carole-Jean Wu

机构 * University of Southern California(美国南加州大学) Meta AI Research(Meta人工智能研究) Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 效率与部署 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 Gecko通过改进的神经架构实现高效长序列处理,优于现有模型在效率和长上下文扩展性上的表现。

Comments 13 pages, 5 figure and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06123 2026-01-13 cs.LG cs.AI 73%

Latent Space Communication via K-V Cache Alignment

通过K-V缓存对齐实现潜在空间通信

Lucio M. Dery, Zohar Yahav, Henry Prior, Qixuan Feng, Jiajun Shen, Arthur Szlam

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过学习共享表示空间对齐多模型的k-v缓存,实现模型间高效协作与知识共享,提升整体性能与能力转移。

Comments 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06100 2026-01-13 cs.LG cs.CL cs.IT math.IT 73%

Filtering Beats Fine Tuning: A Bayesian Kalman View of In Context Learning in LLMs

过滤胜过微调:一种贝叶斯卡尔曼视角下的大语言模型上下文学习

Andrew Kiruluta

机构 * UC Berkeley School of Information(伯克利大学信息学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于贝叶斯卡尔曼滤波的理论框架,将大语言模型的上下文学习解释为在线状态估计,揭示了推理时学习的协方差塌陷机制,并提供了稳定性及样本效率的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02212 2026-01-13 cs.LG cs.AI 73%

DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning

DiFFPO:通过强化学习训练扩散大语言模型以快速且高效地推理

Hanyang Zhao, Dawen Liang, Wenpin Tang, David Yao, Nathan Kallus

机构 * Columbia University(哥伦比亚大学) Netflix

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DiFFPO通过强化学习训练扩散大语言模型,使其在推理速度和准确性上取得平衡,提升推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11837 2026-01-13 cs.LG cs.AI cs.CR 73%

On Membership Inference Attacks in Knowledge Distillation

在知识蒸馏中的成员推断攻击研究

Ziyao Cui, Minxing Zhang, Jian Pei

机构 * Department of Computer Science(计算机科学系) Duke University(杜克大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了知识蒸馏对成员推断攻击的影响,发现蒸馏可能增加隐私风险,并提出三种方法缓解这一问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07329 2026-01-13 cs.CL 70%

BayesRAG: Probabilistic Mutual Evidence Corroboration for Multimodal Retrieval-Augmented Generation

BayesRAG: 基于概率互证的多模态检索增强生成

Xuan Li, Yining Wang, Haocai Luo, Shengping Liu, Jerry Liang, Ying Fu, Weihuang, Jun Yu, Junnan Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Unisound AI Technology Co.Ltd(Unisound AI技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BayesRAG通过概率互证机制提升多模态检索增强生成的性能,有效解决异构模态的隔离问题。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00907 2026-01-13 cs.LG 70%

Transformers as Intrinsic Optimizers: Forward Inference through the Energy Principle

Transformer作为内在优化器:通过能量原理进行前向推断

Ruifeng Ren, Sheng Ouyang, Huayi Tang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于能量原理的Transformer统一框架,通过不同优化算法诱导新型注意力结构,探索Transformer作为内在优化器的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06211 2026-01-13 cs.IT math.IT 67%

Large Multimodal Model-Aided Scheduling for 6G Autonomous Communications

面向6G自主通信的大型多模态模型辅助调度

Sunwoo Kim, Byonghyo Shim

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出基于大型多模态模型的调度技术,通过预测信道参数提升6G自主通信的吞吐量性能。

Comments 16 pages

Journal ref IEEE Transactions on Cognitive Communications and Networking, vol. 12, pp. 3732-3747, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07316 2026-01-13 cs.LG cs.AI 62%

BEAT-Net: Injecting Biomimetic Spatio-Temporal Priors for Interpretable ECG Classification

BEAT-Net:注入生物仿生时空先验以实现可解释的ECG分类

Runze Ma, Caizhi Liao

机构 * School of Information Technology(信息科技学院) Monash University Malaysia(墨尔本大学马来西亚分校) Faculty of Biomedical Engineering(生物医学工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 BEAT-Net通过生物仿生时空先验实现ECG分类的可解释性与高效性

Comments 8 pages, 4 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06122 2026-01-13 cs.CV cs.AI cs.LG 62%

COVR:Collaborative Optimization of VLMs and RL Agent for Visual-Based Control

COVR:视觉控制中视觉语言模型与强化学习代理的协同优化

Canming Xia, Peixi Peng, Guang Tan, Zhan Su, Haoran Xu, Zhenxian Liu, Luntong Li

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 COVR通过协同优化视觉语言模型与强化学习代理,利用RL生成数据提升VLM语义推理能力,并通过动作先验引导策略学习,实现视觉控制任务中的高效优化。

Comments The paper was accepted by the Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07353 2026-01-13 cs.CL 57%

TALON: Confidence-Aware Speculative Decoding with Adaptive Token Trees

TALON:具有自适应令牌树的置信度感知推测解码

Tianyu Liu, Qitan Lv, Yuhao Shen, Xiao Sun, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 TALON通过自适应令牌树扩展框架,在不牺牲质量的前提下提升LLM推理速度,实现5.16倍的端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05269 2026-01-13 cs.IR cs.CV cs.LG 57%

Studying Illustrations in Manuscripts: An Efficient Deep-Learning Approach

研究手稿中的插图:一种高效的深度学习方法

Yoav Evron, Michal Bar-Asher Siegal, Michael Fire

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev, Be’er Sheva, Israel(计算机与信息科学学院,内盖夫本· Gurion大学,贝尔谢巴,以色列) The Goldstein-Goren Department of Jewish Thought, Ben-Gurion University of the Negev, Be’er Sheva, Israel(犹太思想Goldstein-Goren部门,内盖夫本· Gurion大学,贝尔谢巴,以色列)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种高效的深度学习方法,用于大规模分析历史插图手稿,通过多模态描述和共享表示空间揭示视觉模式和跨手稿关系。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02905 2026-01-13 cs.RO cs.AI 57%

LOST-3DSG: Lightweight Open-Vocabulary 3D Scene Graphs with Semantic Tracking in Dynamic Environments

LOST-3DSG: 轻量级开放词汇3D场景图在动态环境中的语义跟踪

Sara Micol Ferraina, Michele Brienza, Francesco Argenziano, Emanuele Musumeci, Vincenzo Suriani, Domenico D. Bloisi, Daniele Nardi

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) International University of Rome UNINT(罗马国际大学UNINT)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 LOST-3DSG通过语义跟踪方法实现轻量级开放词汇3D场景图,在动态环境中高效跟踪物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13742 2026-01-13 cs.DL cs.AI 57%

Review of Passenger Flow Modelling Approaches Based on a Bibliometric Analysis

基于文献计量分析的乘客流量建模方法综述

Jonathan Hecht, Weilian Li, Ziyue Li, Youness Dehbi

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文通过文献计量分析综述了乘客流量建模方法,揭示了研究趋势从传统方法向深度学习的转变,并指出现有数据融合、模型可解释性及实际应用平衡等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00023 2026-01-13 cs.AI 57%

ToolBrain: A Flexible Reinforcement Learning Framework for Agentic Tools

ToolBrain: 一种灵活的强化学习框架用于智能工具

Quy Minh Le, Minh Sao Khue Luu, Khanh-Tung Tran, Duc-Hai Nguyen, Hoang-Quoc-Viet Pham, Quan Le, Hoang Thanh Lam, Hoang D. Nguyen

机构 * ToolBrain Research(ToolBrain研究机构) University College Cork(大学学院科克) CeADAR University College Dublin(CeADAR大学学院都柏林) IBM Research Lab(IBM研究实验室)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 ToolBrain通过灵活的强化学习框架提升智能代理的工具使用能力,支持多种训练策略并提供高效微调和推理功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09930 2026-01-13 cs.CL 57%

Rethinking Prompt Optimizers: From Prompt Merits to Optimization

重新思考提示优化器:从提示优点到优化

Zixiao Zhu, Hanzhang Zhou, Zijian Feng, Tianjiao Li, Chua Jia Jim Deryl, Mak Lee Onn, Gee Wah Ng, Kezhi Mao

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Home Team Science and Technology Agency, Singapore(新加坡科技局)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 MePO通过显式和可解释的设计优化提示,提升响应质量,适用于多种任务和模型类型。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06309 2026-01-13 cs.CV cs.AI 57%

VideoWeave: A Data-Centric Approach for Efficient Video Understanding

VideoWeave:一种以数据为中心的高效视频理解方法

Zane Durante, Silky Singh, Arpandeep Khatua, Shobhit Agarwal, Reuben Tan, Yong Jae Lee, Jianfeng Gao, Ehsan Adeli, Li Fei-Fei

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) University of Wisconsin - Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 VideoWeave通过重新组织训练数据提升视频语言模型的数据效率,无需修改模型架构,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06097 2026-01-13 cs.CV cs.AI 57%

Semantic Event Graphs for Long-Form Video Question Answering

语义事件图用于长视频问答

Aradhya Dixit, Tianxi Liang

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 语义事件图通过轻量级符号接口提升长视频问答效率,减少令牌使用并保持推理能力。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18774 2026-01-13 cs.CL 57%

Zero-Shot Context-Aware ASR for Diverse Arabic Varieties

零样本上下文感知阿拉伯语自动语音识别用于多样化的阿拉伯方言

Bashar Talafha, Amin Abu Alhassan, Muhammad Abdul-Mageed

专题命中 效率与部署 :prompting(abstract);分类 cs.CL

AI总结 本文提出上下文感知解码和代理引导选择方法,用于零样本阿拉伯语自动语音识别,有效降低不同方言和口音的识别错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07366 2026-01-13 cs.CV 50%

HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression

HiVid-Narrator:基于场景优先的ASR锚定压缩的分层视频叙事生成

Haoxuan Li, Mengyan Li, Junjun Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 效率与部署 :prompting(abstract)

AI总结 HiVid-Narrator通过分阶段构建和SPA-Compressor压缩技术,在减少输入标记的同时生成高质量的电子商务视频叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07143 2026-01-13 cs.HC 50%

EZBlender: Efficient 3D Editing with Plan-and-ReAct Agent

EZBlender:基于计划与反应代理的高效3D编辑

Hao Wang, Wenhui Zhu, Shao Tang, Zhipeng Wang, Xuanzhao Dong, Xin Li, Xiwen Chen, Ashish Bastola, Xinhao Huang, Yalin Wang, Abolfazl Razi

专题命中 效率与部署 :language model(abstract)

AI总结 EZBlender通过结合计划与反应机制,实现高效且语义忠实的3D编辑,提升Human AI协作效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏