arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2608.26067 2026-08-27 cs.CV 新提交 67%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25936 2026-08-27 cs.LG cs.AI cs.CL 新提交 67%

One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

一种症状,三个杠杆:对在线策略自蒸馏的批判性综述

Justin Robert, Raheel Qader

机构 * OVHai LLM(OVHai大模型)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本综述针对在线策略自蒸馏(OPSD)存在的推理路径崩溃问题,从信号加权、特权信息性质、指导衰减三个杠杆展开分析,以数学推理为范围,提供统一术语并区分已确定与争议内容。

Comments 30 pages, 4 figures. Survey / critical review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 67%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25356 2026-08-27 cs.CV 新提交 67%

Where to Look Matters: On-Policy Self-Distillation for Long-Video Understanding

关注何处至关重要:面向长视频理解的策略内自蒸馏

Kaishen Wang, Dongdi Zhao, Yijun Liang, Dingqiang Ye, Ruibo Chen, Heng Huang, Di Fu

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 效率与部署 :language model(abstract);post-training(abstract)

AI总结 该研究针对长视频理解中全视频冗余干扰问题,提出Clue-OPSD线索特权策略内自蒸馏框架,无需线索标注,可提升模型准确率并优于相关基线。

Comments 15 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24204 2026-08-26 cs.NI 新提交 67%

WiCi: Wireless GPU Computing Infrastructure

WiCi:无线GPU计算基础设施

Yibin Shen, Wei Li, Kaiqiang Xu, Zili Meng

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对移动设备本地推理性能不足、云端推理成本高的问题,本文提出WiCi无线GPU计算基础设施,可让移动设备通过WiFi接入服务器级GPU,大幅提升推理性能并支持更大模型,性能接近服务器级GPU原生表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24173 2026-08-26 cs.CV 新提交 67%

SandwichQuant: Which Parameters Matter Before and After Quantization?

SandwichQuant:量化前后哪些参数起作用?

Peng Xia, Junbiao Pang

机构 * School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究提出SandwichQuant框架,发现归一化仿射参数子空间是量化校正的关键,该两阶段框架在视觉与大语言模型的低比特量化中均实现了性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23873 2026-08-26 cs.AI cs.CL cs.CR cs.LG 新提交 67%

Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors

语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击

Joshua Penman

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。

Comments 21 pages, 4 figures, 13 tables. Interactive demo: https://semantic-overlays.vercel.app. Code and released adapters: https://github.com/JoshuaSP/semantic-overlays

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22551 2026-08-25 cs.DB 新提交 67%

DAGSmith: Dependency-Aware Rewriting for dbt-Style SQL Pipelines

DAGSmith:面向dbt风格SQL流水线的依赖感知重写

Jie Liu, Lin Ma, Barzan Mozafari

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 DAGSmith是首个面向dbt风格SQL流水线DAG的依赖感知源到源重写系统,在Tuva dbt项目上可缩短运行时间、降低计算成本,效果优于现有单查询重写方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22500 2026-08-25 cs.CV 新提交 67%

Learning Sample-wise Rank-aware Interpolation Weights for Composed Visual Data Retrieval

面向组合视觉数据检索的逐样本感知插值权重学习

Boseung Jeong, Taegyu Park, Donghyeon Kwon, Hyunsouk Cho, Suha Kwak

机构 * AI Center, Samsung Electronics(三星电子AI中心) POSTECH(浦项科技大学) Ajou University(明知大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对组合视觉数据检索中基于MLLM方法延迟高的问题,提出SRAIN框架,通过批量排名感知权重估计和合成难负样本的内存库,实现低延迟且性能优异的检索。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22248 2026-08-25 cs.CR 新提交 67%

Beyond Over-Refusal: Defending Indirect Prompt Injection via Latent Instruction Manifolds

超越过度弃权:通过潜在指令流形防御间接提示注入攻击

Jiahao Chen, Rui Yin, Xinfeng Li, Qianli Ma, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对LLMs防御间接提示注入时的安全-效用权衡问题,提出AEGIS模型,通过指令敏感投影器与统一多层共识机制实现出色的攻击检测性能,缓解IPI攻击。

Comments Extended Content of EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21445 2026-08-25 cs.CV 新提交 67%

ViTexSZ: Heterogeneous Vision-Text Knowledge Distillation for EEG Seizure Detection

ViTexSZ:用于脑电图癫痫发作检测的异构视觉-文本知识蒸馏框架

Chenxi Liu, Mingzhao Li, Yicong Liu, Hao Miao, Hongyuan Zhang, Ziyi Chen, Gaofeng Meng

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ViTexSZ是用于EEG癫痫发作检测的异构视觉-文本知识蒸馏框架,通过多模态大语言模型对齐异构EEG与临床语义,在四个数据集上实现最高准确率,相对第二优基线提升达12.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21247 2026-08-24 cs.CV cs.RO 新提交 67%

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Bytedance Inc.(字节跳动公司) Shandong University(山东大学) CNRS(法国国家科学研究中心) CentraleSupelec(中央理工学院) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 效率与部署 :language model(abstract);foundation model(abstract)

AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 67%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20788 2026-08-24 cs.CV 新提交 67%

M2Depth: Unifying Monocular Depth Foundation Priors with Multi-View Stereo

M2Depth:统一单目深度基础先验与多视图立体匹配

Byeonggwon Lee, Sanggi Lee, Siwoo Lee, Khang Truong Giang, Soohwan Song

机构 * Dongguk University(东国大学) dot(42dot)

专题命中 效率与部署 :foundation model(abstract,abstract_cn)

AI总结 M2Depth框架通过双向互细化策略耦合深度基础模型与级联多视图立体匹配流程,引入先验引导的代价体细化机制,在标准基准上优于现有多视图立体匹配方法,且对稀疏视图设置泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20061 2026-08-21 cs.LG cs.AI cs.CL 新提交 67%

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

逐步扩展:面向大规模混合专家模型的计算高效超参数迁移

Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim

机构 * Kakao Corp.(Kakao公司) Upstage AI(Upstage人工智能公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出两步超参数迁移框架,利用小型代理模型外推大规模混合专家模型的最优学习率,仅需极低成本即可准确预测全规模模型的最优配置。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19202 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

Active Inference as Context Acquisition for AI Agents

主动推理作为AI智能体的上下文获取机制

Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Technical University of Munich(慕尼黑工业大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19098 2026-08-20 cs.LG cs.AI cs.CL 新提交 67%

Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

Open-MOPD:诊断与修复多教师在线蒸馏中的能力不平衡

Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR与字节跳动种子SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对多教师在线蒸馏(M-OPD)的能力不平衡问题,提出 Open-MOPD 框架,通过三种机制将提升空间恢复率从 35.6% 提升至 83.4%,并开源了相关方案与评估套件。

Comments Project page: https://bytedtsinghua-sia.github.io/Open-MOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 67%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与部署 :SFT(abstract,abstract_cn)

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14828 2026-08-18 cs.AI cs.CL cs.LG 新提交 67%

MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment

MINT:用于平衡多目标对齐的最小选择偏好蒸馏

Tony Tu, Sayan Chakraborty, Ruomeng Xu, Tony Qin, Austin Tian

机构 * Georgia Institute of Technology(佐治亚理工学院) Zillow Group(齐洛集团)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对多目标对齐的不平衡问题,提出MINT方法,通过按最弱目标排名候选替代加权和排名,在情感支持等任务中显著提升双目标表现并降低不平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12327 2026-08-14 cs.CL cs.AI cs.LG 新提交 67%

Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition

用于尼泊尔语自动语音识别的多语言预训练模型对比分析

Suman Paudel, Sarbin Sayami

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究微调6种多语言预训练模型开展尼泊尔语ASR对比实验,发现语系邻近性可替代模型规模,CTC解码器效率更高,MMS-1B鲁棒性更强,还提供了首个标准化参考基准。

Comments 9 pages, 6 figures, 7 tables. Based on M.Sc. thesis (Institute of Science and Technology, Tribhuvan University). Code and models: https://github.com/p-sumann/nepali-asr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11920 2026-08-13 cs.AR 新提交 67%

NITRO: High-Performance 3D NAND Flash-Based In-Storage Computing with Enhanced Activation Dataflow

NITRO:基于3D NAND闪存的高性能存内计算架构,具备增强型激活数据流

Sanghun Shin, Sangyeon Kim, Gisan Ji, Sungju Ryu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对NAND-PIM方案中间值数据流/缓冲的局限,提出带增强型激活缓冲的高性能NAND闪存ISC架构,结合分布式数据流方法,使推理延迟最高降低85%。

Comments Extended manuscript of DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11512 2026-08-13 cs.CY 新提交 67%

Cheap, Fallible Cognition and the Political Economy of Expertise

廉价、易出错的认知与专业知识的政治经济学

Christophe Kolb, Jim Caron

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文构建基于任务与制度的框架,引入任务脆弱性指数等,分析生成式AI对劳动力市场的影响,指出其命运是制度均衡,而非机械失业或自动充裕。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10454 2026-08-12 eess.SY cs.SY 新提交 67%

Nuclear fusion for AI: A pathway to power data centers sustainably

AI的核聚变:可持续为数据中心供电的途径

Layla Araiinejad, Vineet Jagadeesan Nair

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 67%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交 67%

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09376 2026-08-11 cs.DB 新提交 67%

"Will This Data Break My Task?" - Interactive Synthesis of Task-Aware Data Unit Tests

“这些数据会破坏我的任务吗?”——面向任务感知的数据单元测试的交互式综合

Hao Chen, Arnab Phani, Sebastian Schelter

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对现有数据单元测试框架忽略下游任务代码语义的问题,提出复合AI系统PrismaDV,联合分析数据与任务代码生成任务感知数据单元测试,通过交互式界面完成验证与优化。

Comments Accepted as a demo paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09055 2026-08-11 cs.GT cs.CR 新提交 67%

Repeated-Game Security for Restaking-Based Verifiable Inference

基于再质押的可验证推理的重复博弈安全性

Zhenhang Shang, Yingzhe Yu, Kani Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对基于再质押的可验证推理协议,发现其单轮罚没条件高估安全性,提出结合历史挑战、声誉加权罚没与质押归属的机制,可降低重复博弈偏差利润,减少审计率。

Comments Length: 29 pages total (15 pages main text, plus appendix and references). Figures: 5. Artifact: https://anonymous.4open.science/r/Repeated-Slashing-8031/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 67%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08751 2026-08-11 cs.DB 新提交 67%

InSituANN: Revisiting IVF for PCIe-Efficient Billion-Scale Vector Search

InSituANN:为PCIe高效的十亿级向量搜索重新审视IVF

Yuemeng Xu, Zongxi Liu, Junyu Long, Yiming Huang, Jiarui Guo, Yangyujia Wang, Jiachen Xu, Dongyuan Yu, Zongwei Lv, Tong Yang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 InSituANN是一种基于IVF的ANNS引擎,将基础向量存于主机内存、就地执行精细搜索,在单个商用GPU上实现十亿级向量搜索,大幅提升吞吐量并开源。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08425 2026-08-11 cs.NI cs.DC 新提交 67%

PSP: Low-Overhead Packet-Level Load Balancing for Stale-State and Bandwidth-Asymmetric Networks

PSP:面向 stale 状态与带宽非对称网络的低开销报文级负载均衡

Jiaqi Liu, Chunyang Zhang, Heng Pan, Yanbiao Li

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对数据中心网络微突发与高并发问题,提出概率状态比例(PSP)报文级负载均衡算法,其性能优于 JSQ、随机调度,与 Top-k 相当且硬件成本更低,实现性能、稳定性与开销的平衡。

Comments 12 pages, 10 figures, 5 tables. Accepted by IEEE LCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏