arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2049 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2049 篇

2606.09885 2026-06-10 cs.LG stat.ML 新提交 70%

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

TENP:用于混合专家的梯形专家神经元剪枝

Jiangyang He, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院 TJUNLP实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TENP框架,通过识别重要专家并对其余专家进行神经元剪枝,保留梯形参数模式,在40%路由专家稀疏度和平均63.76%激活参数下,DeepSeek模型准确率仅下降1点,代码生成任务提升10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09441 2026-06-09 cs.AI cs.AR 新提交 70%

SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance

SIFT: 利用注意力不变性实现RAG预填充快速计算的索引选择

Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja, Moinuddin Qureshi

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对RAG查询中文档重复导致预填充计算冗余和TTFT增加的问题,提出SIFT方法,通过离线提取文档高注意力分数位置并利用注意力不变性,在预填充时仅计算标记位置,将TTFT提升1.71倍且精度损失在1%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08702 2026-06-09 cs.AI 新提交 70%

ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems

ConMem: 无训练多智能体系统中的结构化记忆引导自适应

Zhixun Tan, Qiang Chen, Tairan Huang, Xiu Su, Yi Chen

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ConMem框架,通过结构化记忆卡片和关系感知记忆图实现多智能体系统的高效自适应,无需额外训练,在多个基准上提升性能并降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08295 2026-06-09 cs.CL 新提交 70%

TLRD: Teaching LLMs to Reason over Tabular Data with Tri-Level Rationale Distillation

TLRD: 通过三级理由蒸馏教授LLMs在表格数据上进行推理

Tianyuan Liang, Xuwei Tan, Lei Shi, Junsheng Zhong, Ziyu Hu, Tian Xie, Zhiqun Zuo, Xiaodong Yu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TLRD框架,通过三级理由蒸馏将表格数据集转换为结构化理由监督,使LLMs在仅基于原始特征的情况下实现零开销预测和可解释推理,显著缩小与树集成模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 70%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22551 2026-08-25 cs.DB 新提交 67%

DAGSmith: Dependency-Aware Rewriting for dbt-Style SQL Pipelines

DAGSmith:面向dbt风格SQL流水线的依赖感知重写

Jie Liu, Lin Ma, Barzan Mozafari

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 DAGSmith是首个面向dbt风格SQL流水线DAG的依赖感知源到源重写系统,在Tuva dbt项目上可缩短运行时间、降低计算成本,效果优于现有单查询重写方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22500 2026-08-25 cs.CV 新提交 67%

Learning Sample-wise Rank-aware Interpolation Weights for Composed Visual Data Retrieval

面向组合视觉数据检索的逐样本感知插值权重学习

Boseung Jeong, Taegyu Park, Donghyeon Kwon, Hyunsouk Cho, Suha Kwak

机构 * AI Center, Samsung Electronics(三星电子AI中心) POSTECH(浦项科技大学) Ajou University(明知大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对组合视觉数据检索中基于MLLM方法延迟高的问题,提出SRAIN框架,通过批量排名感知权重估计和合成难负样本的内存库,实现低延迟且性能优异的检索。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22248 2026-08-25 cs.CR 新提交 67%

Beyond Over-Refusal: Defending Indirect Prompt Injection via Latent Instruction Manifolds

超越过度弃权:通过潜在指令流形防御间接提示注入攻击

Jiahao Chen, Rui Yin, Xinfeng Li, Qianli Ma, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对LLMs防御间接提示注入时的安全-效用权衡问题,提出AEGIS模型,通过指令敏感投影器与统一多层共识机制实现出色的攻击检测性能,缓解IPI攻击。

Comments Extended Content of EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21445 2026-08-25 cs.CV 新提交 67%

ViTexSZ: Heterogeneous Vision-Text Knowledge Distillation for EEG Seizure Detection

ViTexSZ:用于脑电图癫痫发作检测的异构视觉-文本知识蒸馏框架

Chenxi Liu, Mingzhao Li, Yicong Liu, Hao Miao, Hongyuan Zhang, Ziyi Chen, Gaofeng Meng

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ViTexSZ是用于EEG癫痫发作检测的异构视觉-文本知识蒸馏框架,通过多模态大语言模型对齐异构EEG与临床语义,在四个数据集上实现最高准确率,相对第二优基线提升达12.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21247 2026-08-24 cs.CV cs.RO 新提交 67%

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Bytedance Inc.(字节跳动公司) Shandong University(山东大学) CNRS(法国国家科学研究中心) CentraleSupelec(中央理工学院) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 效率与部署 :language model(abstract);foundation model(abstract)

AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 67%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20788 2026-08-24 cs.CV 新提交 67%

M2Depth: Unifying Monocular Depth Foundation Priors with Multi-View Stereo

M2Depth:统一单目深度基础先验与多视图立体匹配

Byeonggwon Lee, Sanggi Lee, Siwoo Lee, Khang Truong Giang, Soohwan Song

机构 * Dongguk University(东国大学) dot(42dot)

专题命中 效率与部署 :foundation model(abstract,abstract_cn)

AI总结 M2Depth框架通过双向互细化策略耦合深度基础模型与级联多视图立体匹配流程,引入先验引导的代价体细化机制,在标准基准上优于现有多视图立体匹配方法,且对稀疏视图设置泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20061 2026-08-21 cs.LG cs.AI cs.CL 新提交 67%

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

逐步扩展:面向大规模混合专家模型的计算高效超参数迁移

Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim

机构 * Kakao Corp.(Kakao公司) Upstage AI(Upstage人工智能公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出两步超参数迁移框架,利用小型代理模型外推大规模混合专家模型的最优学习率,仅需极低成本即可准确预测全规模模型的最优配置。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19202 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

Active Inference as Context Acquisition for AI Agents

主动推理作为AI智能体的上下文获取机制

Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Technical University of Munich(慕尼黑工业大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19098 2026-08-20 cs.LG cs.AI cs.CL 新提交 67%

Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

Open-MOPD:诊断与修复多教师在线蒸馏中的能力不平衡

Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR与字节跳动种子SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对多教师在线蒸馏(M-OPD)的能力不平衡问题,提出 Open-MOPD 框架,通过三种机制将提升空间恢复率从 35.6% 提升至 83.4%,并开源了相关方案与评估套件。

Comments Project page: https://bytedtsinghua-sia.github.io/Open-MOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17512 2026-08-19 cs.RO 新提交 67%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 效率与部署 :language model(abstract);prompting(abstract)

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16585 2026-08-18 cs.CV 新提交 67%

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation

SQuad:用于高效视频生成的次二次注意力蒸馏

Animesh Karnewar, Denis Korzhenkov, Amirhossein Habibian, Mohsen Ghafoorian

专题命中 效率与部署 :SFT(abstract,abstract_cn)

AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14828 2026-08-18 cs.AI cs.CL cs.LG 新提交 67%

MINT: Min-Selection Preference Distillation for Balanced Multi-Objective Alignment

MINT:用于平衡多目标对齐的最小选择偏好蒸馏

Tony Tu, Sayan Chakraborty, Ruomeng Xu, Tony Qin, Austin Tian

机构 * Georgia Institute of Technology(佐治亚理工学院) Zillow Group(齐洛集团)

专题命中 效率与部署 :language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对多目标对齐的不平衡问题,提出MINT方法,通过按最弱目标排名候选替代加权和排名,在情感支持等任务中显著提升双目标表现并降低不平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12327 2026-08-14 cs.CL cs.AI cs.LG 新提交 67%

Comparative Analysis of Multilingual Pre-trained Models for Nepali Automatic Speech Recognition

用于尼泊尔语自动语音识别的多语言预训练模型对比分析

Suman Paudel, Sarbin Sayami

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究微调6种多语言预训练模型开展尼泊尔语ASR对比实验,发现语系邻近性可替代模型规模,CTC解码器效率更高,MMS-1B鲁棒性更强,还提供了首个标准化参考基准。

Comments 9 pages, 6 figures, 7 tables. Based on M.Sc. thesis (Institute of Science and Technology, Tribhuvan University). Code and models: https://github.com/p-sumann/nepali-asr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11920 2026-08-13 cs.AR 新提交 67%

NITRO: High-Performance 3D NAND Flash-Based In-Storage Computing with Enhanced Activation Dataflow

NITRO:基于3D NAND闪存的高性能存内计算架构,具备增强型激活数据流

Sanghun Shin, Sangyeon Kim, Gisan Ji, Sungju Ryu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对NAND-PIM方案中间值数据流/缓冲的局限,提出带增强型激活缓冲的高性能NAND闪存ISC架构,结合分布式数据流方法,使推理延迟最高降低85%。

Comments Extended manuscript of DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11512 2026-08-13 cs.CY 新提交 67%

Cheap, Fallible Cognition and the Political Economy of Expertise

廉价、易出错的认知与专业知识的政治经济学

Christophe Kolb, Jim Caron

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文构建基于任务与制度的框架,引入任务脆弱性指数等,分析生成式AI对劳动力市场的影响,指出其命运是制度均衡,而非机械失业或自动充裕。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10454 2026-08-12 eess.SY cs.SY 新提交 67%

Nuclear fusion for AI: A pathway to power data centers sustainably

AI的核聚变:可持续为数据中心供电的途径

Layla Araiinejad, Vineet Jagadeesan Nair

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究探讨核聚变能否为AI驱动型数据中心提供可持续电源,通过技术经济分析发现其适配数据中心需求,具备成本竞争力与可行性,应优先部署。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 67%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09789 2026-08-11 cs.CV 新提交 67%

ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection

ADOPD:面向多模态大语言模型(MLLM)的工业异常检测的参考特权在线策略蒸馏

Jingtai He, Shiyuan Meng, Wenchao Meng, Qinmin Yang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对工业异常检测问题,提出ADOPD参考特权在线策略蒸馏框架,通过参考感知教师监督仅查询的学生模型,在MMAD基准零样本推理下获77.31%平均准确率,优于Qwen3-VL-4B主干及其一样本设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09376 2026-08-11 cs.DB 新提交 67%

"Will This Data Break My Task?" - Interactive Synthesis of Task-Aware Data Unit Tests

“这些数据会破坏我的任务吗?”——面向任务感知的数据单元测试的交互式综合

Hao Chen, Arnab Phani, Sebastian Schelter

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 针对现有数据单元测试框架忽略下游任务代码语义的问题,提出复合AI系统PrismaDV,联合分析数据与任务代码生成任务感知数据单元测试,通过交互式界面完成验证与优化。

Comments Accepted as a demo paper at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09055 2026-08-11 cs.GT cs.CR 新提交 67%

Repeated-Game Security for Restaking-Based Verifiable Inference

基于再质押的可验证推理的重复博弈安全性

Zhenhang Shang, Yingzhe Yu, Kani Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对基于再质押的可验证推理协议,发现其单轮罚没条件高估安全性,提出结合历史挑战、声誉加权罚没与质押归属的机制,可降低重复博弈偏差利润,减少审计率。

Comments Length: 29 pages total (15 pages main text, plus appendix and references). Figures: 5. Artifact: https://anonymous.4open.science/r/Repeated-Slashing-8031/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 67%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08751 2026-08-11 cs.DB 新提交 67%

InSituANN: Revisiting IVF for PCIe-Efficient Billion-Scale Vector Search

InSituANN:为PCIe高效的十亿级向量搜索重新审视IVF

Yuemeng Xu, Zongxi Liu, Junyu Long, Yiming Huang, Jiarui Guo, Yangyujia Wang, Jiachen Xu, Dongyuan Yu, Zongwei Lv, Tong Yang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 InSituANN是一种基于IVF的ANNS引擎,将基础向量存于主机内存、就地执行精细搜索,在单个商用GPU上实现十亿级向量搜索,大幅提升吞吐量并开源。

Comments 16 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08425 2026-08-11 cs.NI cs.DC 新提交 67%

PSP: Low-Overhead Packet-Level Load Balancing for Stale-State and Bandwidth-Asymmetric Networks

PSP:面向 stale 状态与带宽非对称网络的低开销报文级负载均衡

Jiaqi Liu, Chunyang Zhang, Heng Pan, Yanbiao Li

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对数据中心网络微突发与高并发问题,提出概率状态比例(PSP)报文级负载均衡算法,其性能优于 JSQ、随机调度,与 Top-k 相当且硬件成本更低,实现性能、稳定性与开销的平衡。

Comments 12 pages, 10 figures, 5 tables. Accepted by IEEE LCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08340 2026-08-11 cs.DC 新提交 67%

OpRAG: A Resource-Deterministic Runtime for GPU-Backed Multi-Stage RAG Workflows

OpRAG:面向GPU支持的多阶段RAG工作流的资源确定性运行时

Arup Kumar Sarker, Mills Staylor, Aymen Alsaadi, Gregor von Laszewski, Shantenu Jha, Geoffrey Fox

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出OpRAG,一种面向GPU多阶段RAG的资源确定性分布式运行时,通过优化编排层降低非模型开销,在多模型多基准测试中显著提升RAG端到端性能。

Comments 14 pages, 6 figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏