arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2049 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2049 篇

2606.11057 2026-06-10 cs.LG q-bio.BM stat.ML 新提交 57%

Flexible Kernels for Protein Property Prediction

用于蛋白质性质预测的灵活核函数

Martin Jankowiak, Yerdos Ordabayev, Rudraksh Tuwani, Henry N. Ward, Hunter Nisonoff, James M. McFarland, Gevorg Grigoryan

机构 * University of Cambridge(剑桥大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出利用进化替代矩阵和局部线性性的序列核函数,结合高斯过程实现数据高效的蛋白质性质预测,并融入结构信息进行多任务学习。

Comments 50 pages; to appear at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10368 2026-06-10 cs.SD cs.AI 新提交 57%

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

语音遇见ELF:用于语音识别和翻译的音频条件连续目标扩散

Xuanchen Li, Tianrui Wang, Yuheng Lu, Zikang Huang, Yu Jiang, Chenghan Lin, Chenrui Cui, Ziyang Ma, Xingyu Ma, Chunyu Qiang, Guochen Yu, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出ELF-S2T,一种基于预训练ELF骨干的音频条件连续目标生成模型,通过音频强制训练和分类器自由引导,在LibriSpeech和CoVoST2上实现竞争性ASR和S2TT性能,并揭示识别与翻译错误均源于连续潜空间中的近距离混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 57%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09605 2026-06-09 cs.AI 新提交 57%

Next-Token Prediction Learns Generalisable Representations of Sleep Physiology

下一个词预测学习睡眠生理学的可泛化表示

Jonathan F. Carter, Lionel Tarassenko

机构 * Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 提出Hypnos模型,通过下一个词预测目标,从多模态生理信号中学习可泛化表示,在睡眠阶段分类和房颤检测等任务上显著优于现有基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09019 2026-06-09 cs.SD cs.AI 新提交 57%

TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech

TLDR:压缩音频令牌以实现高效自回归文本到语音

Yejin Lee, Junwon Moon, Hyoeun Kim, Hyunjin Choi, Heeseung Kim, Kyuhong Shim

机构 * Sungkyunkwan University(成均馆大学) University of Seoul(首尔市立大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出TLDR框架,通过将因果建模从令牌级转移到补丁级,利用轻量级压缩器和LoRA适配的冻结预训练骨干,实现1.8倍推理加速和75% KV缓存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08542 2026-06-09 cs.RO cs.AI cs.CV 新提交 57%

When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA

当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏

Haizhou Ge, Yufei Jia, Yue Li, Zhixing Chen, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08184 2026-06-09 cs.CL 新提交 57%

TextEconomizer: Enhancing Lossy Text Compression with Denoising Transformers and Entropy Coding

TextEconomizer:利用去噪变换器和熵编码增强有损文本压缩

Mahbub E Sobhani, Anika Tasnim Rodela, Chowdhury Mofizur Rahman, Dewan Md. Farid, Swakkhar Shatabda

机构 * United International University(联合国际大学) BRAC University(BRAC大学) Southeast University(东南大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 提出TextEconomizer编码器-解码器框架,结合去噪变换器和熵编码,实现50%-80%的压缩率,参数减少153倍,在BLEU等指标上保持近完美文本质量。

Comments Published in Neural Networks (Elsevier), Vol. 203, 2026

Journal ref Neural Networks, Vol. 203, 109111, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07915 2026-06-09 cs.AI 新提交 57%

EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification

EditSR: 通过基于编辑的修正增强神经符号回归

Da Li, Xinxin Li, Xingyu Cui, Jin Xu, Juan Zhang, Junping Yin

机构 * Northeast Normal University(东北师范大学) East China Normal University(华东师范大学) Shenzhen Institute of Advanced Technology(深圳先进技术研究院) Graduate School of China Academy of Engineering Physics(中国工程物理研究院研究生院) Beihang University(北京航空航天大学) Institute of Applied Physics and Computational Mathematics(北京应用物理与计算数学研究所)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 提出EditSR双层框架,第一层神经符号回归模型生成表达式,第二层基于编辑的修正器通过预训练的状态转移链逐步修正错误,避免全局搜索重启,有效减少误差累积,提升复杂表达式生成的结构正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07881 2026-06-09 cs.LG 新提交 57%

Breaking the Bubble: Asynchronous Pipeline Parallel Training with Bounded Weight Inconsistency

打破气泡:具有有界权重不一致性的异步流水线并行训练

Itay Elam, Eliron Rahimi, Avi Mendelson, Chaim Baskin

机构 * Technion - Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(本·古里安大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 提出PACI方法,通过局部梯度累积控制版本漂移,实现无气泡异步流水线并行,在GPT风格语言模型预训练中匹配同步1F1B-flush的稳定性和困惑度,吞吐量完全利用,训练时间至准确率提升达1.69倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07669 2026-06-09 cs.CV cs.AI 新提交 57%

MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios

MemoVAD: 边缘计算场景下基于动态语义记忆的资源高效视频异常检测

Guo Li, Jiandian Zeng, Yang Li, Zihao Peng, Ke Chen, Tian Wang

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Engineering Research Center of Cloud-Edge Intelligent Collaboration on Big Data, Ministry of Education, Beijing Normal University(北京师范大学大数据云边智能协同教育部工程研究中心)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出MemoVAD边缘-云协同框架,通过不确定性感知门控策略选择性调用云端视觉语言模型,并设计动态语义记忆缓存原型,在降低通信开销的同时提升视频异常检测性能。

Comments Accepted by IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交 57%

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07414 2026-06-08 cs.LG cs.NE 新提交 57%

Sparsely gated tiny linear experts

稀疏门控的微型线性专家

Simon Schug

机构 * Princeton University(普林斯顿大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出稀疏门控线性神经元(sgatlin)网络,通过将每个专家缩减为单个神经元并去除非线性,在等计算量下提升语言模型困惑度,同时增强可解释性。

Comments Code available at https://github.com/smonsays/sparsely-gated-linear

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06566 2026-06-08 cs.SE cs.AI 新提交 57%

NTILC: Neural Tool Invocation via Learned Compression

NTILC: 通过学习的压缩实现神经工具调用

Andrew Krikorian, Yayuan Li, Jason J. Corso

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of ECE, University of Michigan(电子工程与计算机科学系,密歇根大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 提出NTILC框架,用学习的潜在检索替代上下文工具查找,将工具选择与参数生成解耦,通过签名感知复合损失函数提升选择精度,相比基线减少95%上下文消耗和74%延迟。

Comments 10 Pages, 4 Figures, 5 Tables, 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23204 2026-08-25 cs.RO 新提交 50%

Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers

引导式黎曼优化(GuRO):连接模型预测控制与决策Transformer

Hossein Abdi, Satya Prakash Dash, Mingfei Sun

机构 * The University of Manchester(曼彻斯特大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 本研究提出GuRO框架,将MPC与RL整合到序列决策框架,利用黎曼优化解决非凸损失问题,在四足机器人控制任务上优于TRPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23176 2026-08-25 cs.IR 新提交 50%

Evaluating Modern RAG: Textual, Multimodal, Dense, and Late Interaction Pipelines

评估现代RAG:文本、多模态、密集型与后期交互管道

Emre Kuru, Mehmet Onur Keskin

专题命中 效率与部署 :language model(abstract)

AI总结 该研究针对传统RAG在含视觉元素文档上的局限,提出数据驱动的RAG管道选择方法,评估了文本、多模态等现代RAG管道的性能与效率权衡,为实际应用提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22906 2026-08-25 cs.CV 新提交 50%

AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction

AquaFlow:用于水下流式重建的单目高斯溅射SLAM

Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对水下场景视觉退化导致的SLAM难题,提出AquaFlow框架,通过微调3D视觉基础模型等技术实现更优的水下重建,在62条水下轨迹数据集上相较WaterSplat-SLAM性能显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22883 2026-08-25 cs.CV 新提交 50%

FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding

FOVEA:面向缓存友好型多模态推测解码的聚焦式按需视觉证据适配

Hengjie Zhu, Dayan Wu, Zihao Zhang, Xinze Liu, Jingxuan Yu, Peng Fu, Zheng Lin, Weiping Wang, Ding Wang

专题命中 效率与部署 :language model(abstract)

AI总结 FOVEA是一种缓存友好型多模态推测解码方法,通过动态检索视觉记忆子集提升草稿接受率,使多模态生成速度最高提升2.13倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21244 2026-08-24 cs.CV 新提交 50%

A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection

VLM 的回答并非异常分数:无训练视频异常检测中的排名压缩

Inpyo Song, Jangwon Lee

机构 * SungKyunKwan University(成均馆大学)

专题命中 效率与部署 :language model(abstract)

AI总结 该研究针对基于VLM的无训练视频异常检测,发现生成式回答读出存在排名压缩问题,提出概率读出方法可提升性能,证明回答接口是该类检测器的关键组成部分。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21240 2026-08-24 cs.AR 新提交 50%

SPICE: Speculative Prefetching with Low-Rank Expert Surrogates and Heterogeneous Orchestration for MoE Inference Acceleration

SPICE:基于低秩专家代理与异构编排的MoE推理加速投机预取框架

Yongxiang Lyu, Ning Li, Bonian Jia

专题命中 效率与部署 :LLM(abstract_cn)

AI总结 SPICE是用于MoE推理加速的投机预取框架,通过轻量级专家预测与异构编排,在DeepSeek-V2-Lite等模型上实现最高3.12倍的TPOT加速,且质量损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20999 2026-08-24 cs.CV 新提交 50%

Latent Ordinal Evidence, Misaligned Outputs: Inference-Time Ordinal Lens Alignment for Multimodal LLMs

潜在有序证据与未对齐输出:多模态大语言模型的推理时有序视角对齐

Haiming Li, Yingsheng Liu, Jingmin Zhu, Siyuan Yan, Xieji Li, Jiajun Sun, Zhen Yu, Zongyuan Ge

机构 * Monash University(莫纳什大学) Faculty of Information Technology, Monash University(莫纳什大学信息技术学院)

专题命中 效率与部署 :language model(abstract)

AI总结 针对多模态大语言模型有序输出未对齐问题,本文提出推理时的Ordinal Lens Alignment方法,提升有序回归任务性能且优于现有基线。

Comments EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20748 2026-08-24 cs.CV 新提交 50%

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

为视觉几何接地Transformer生成多视角对抗样本

Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本研究针对3D基础模型VGGT的安全漏洞,提出MVAP-G多视角对抗扰动生成器,通过跨视角对抗对齐机制生成一致扰动,可无需迭代优化即可显著降低VGGT性能,为3D视觉系统鲁棒性研究提供了新方向。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20473 2026-08-24 cs.CV 新提交 50%

Aggregating Visual Information with Optimal Transport for VideoLM Token Compression

基于最优传输的视觉信息聚合用于视频语言模型的令牌压缩

Wenti Yin, Xiaotian Han, Junyuan Shang, Yuchen Ding, Shuohuan Wang, Dianhai Yu, Changxin Gao, Nong Sang

专题命中 效率与部署 :language model(abstract)

AI总结 该研究针对视频语言模型的视觉令牌冗余问题,提出AVIOT方法,将视频令牌压缩转化为最优传输问题,沿任务和空间轴调整表示构造,在多基准上实现了与未压缩基线相当或更优的性能,且高压缩率下表现稳定。

Comments Code: https://github.com/ernie-research/AVIOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19590 2026-08-21 eess.IV 新提交 50%

Loss-Resilient Semantic Communication over Packet-Loss Networks at Extreme-Low Bandwidth

极端低带宽丢包网络下的抗丢包语义通信

Shengshi Yao, Jincheng Dai, Sixian Wang, Guo Lu, Kai Niu, Wenjun Xu, Wenjun Zhang, Ping Zhang

专题命中 效率与部署 :language model(abstract)

AI总结 针对极端低带宽丢包网络的语义通信问题,提出ResiGLC框架,结合语言模型上下文预测与掩码学习,通过渐进式解码提升抗丢包性,可在低带宽下改善通信的感知质量。

Comments Accepted to appear in IEEE TMC. 14 pages, 15 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20208 2026-08-21 cs.CV 新提交 50%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 效率与部署 :post-training(abstract)

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20069 2026-08-21 cs.CV 新提交 50%

V-REX: Efficient Specialist VLM Training for Veterinary X-Rays

V-REX:面向兽医X光片的高效专用视觉语言模型(VLM)训练

Tim Elsner, Nicole McNally, Andre Dourson, Michael Fitzke

机构 * Vyyo AI Mars Petcare(玛氏宠物护理)

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究针对兽医X光片领域,提出高效专用VLM训练方案,无需依赖额外数据,用更少资源开发出能生成兽医X光诊断报告的模型,性能远超同类开源基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19871 2026-08-21 cs.CV 新提交 50%

DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations

DIFFCZSL:基于扩散表示正则化的组合零样本学习

Hangyu Tian, Zhenqi He, Yanghao Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(abstract)

AI总结 DIFFCZSL将预训练扩散模型的生成先验注入基于CLIP的组合零样本学习流程,通过对比对齐提升性能,在两类设置下均优于强基线,凸显了扩散表示与视觉-语言模型的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19837 2026-08-21 cs.AR 新提交 50%

Energy-Efficient Visual Inspection with FFT-Based CNNs and Adaptive Floating-Point Quantization

基于FFT的卷积神经网络与自适应浮点量化的节能视觉检测

Lukas Krupp, Marco Groß, Michael Graichen, Kim Ulrich, Norbert Wehn

专题命中 效率与部署 :post-training(abstract)

AI总结 该研究针对工业CPU-FPGA平台,结合FFT卷积与自适应FP8量化优化LeNet-5加速器,实现故障检测准确率提升与能效增强。

Comments Accepted for presentation at the 23rd International SoC Design Conference (ISOCC 2026). Proceedings to be included in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19589 2026-08-21 cs.RO cs.CV 新提交 50%

OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation

OrthoSkillVLA:通过梯度感知技能子空间自适应实现持续技能学习

Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Electronic Science and Engineering, Southeast University(东南大学电子科学与工程学院)

专题命中 效率与部署 :language model(abstract_cn)

AI总结 OrthoSkillVLA是一种参数高效的持续技能学习框架,通过对VLM和ActionHead施加独立子空间约束、引入特征感知MoE解码器,实现预训练VLA模型的技能学习,可缓解灾难性遗忘。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19553 2026-08-21 cs.CV 新提交 50%

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

IoU曲线上定位精度的核心所在:无标注推理时的边界优化

Bo Ma

机构 * Auckland University of Technology(奥克兰理工大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出无标注推理时的边界优化(LFPR)方法,在多个视觉-语言定位数据集上提升了IoU曲线各精度指标,证明指代选择与边界精度部分可分离,为定位精度优化提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18470 2026-08-20 cs.RO 新提交 50%

DevGRU: Depth-guided Visual Navigation using a Collision-aware Recurrent Model

DevGRU:基于碰撞感知循环模型的深度引导视觉导航

Kyung Min Han, Eunsom Kim, Young J. Kim

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对现有视觉导航模型易在复杂室内环境碰撞的问题,提出DevGRU导航系统,结合动作与碰撞预测器提升导航性能,在9种场景实验中优于多种基线模型,且模型规模小、推理速度快

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏