arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2049 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2049 篇

2608.07971 2026-08-11 cs.DC 新提交 67%

ElastiCo: Elastic Configuration and Interference-Aware Orchestration for GPU Clusters

ElastiCo:面向GPU集群的弹性配置与感知干扰的编排

Jinghao Wang, Yihang Zhou, Xiaoyang Sun, Chunming Hu, Tianyu Wo, Xu Wang, Albert Y. Zomaya, Renyu Yang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 ElastiCo是一种基于Kubernetes的弹性共置框架,通过资源形态转换、弹性影子定价、感知干扰共置三种机制,实现训练与推理工作负载安全共享GPU,显著降低平均JCT、提升集群吞吐量与GPU利用率。

Comments 27 pages, 9 figures, 9 tables. Submitted to Performance Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05967 2026-08-07 cs.MM 新提交 67%

M$^3$Prune: Hierarchical Collaborative Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝

Taolin Zhang, Weizi shao, Zijie Zhou, Chen Chen, Daiyang Yu, Tingyuan Hu, Chengyu Wang, Xiaofeng He

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05917 2026-08-07 cs.SE 新提交 67%

Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness

跳出自修复陷阱:通过双上下文感知改进测试预言生成

Kefan Li, Hongyue Yu, Yuan Yuan

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对迭代自修复引发的自修复陷阱问题,提出非迭代高效框架DCAware,结合结构化静态上下文与动态状态,在低计算成本下提升测试预言的故障检测效果

Comments Accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04630 2026-08-06 eess.SP 新提交 67%

Generalizable and Computational Efficient Channel Extrapolation for 6G: A Configurable AI-Driven Framework Built from a Modular Perspective

面向6G的可泛化且计算高效的信道外推:一种从模块化视角构建的可配置AI驱动框架

Yuan Gao, Xinyi Wu, Jiang Jun, Yi Yu, Yanliang Jin, Shunqing Zhang, Zhu Han, Shugong Xu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对6G信道外推泛化差、复杂度高的问题,提出三阶段模块化可配置AI框架,降低了信道外推误差与复杂度,性能优于混合专家模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04450 2026-08-06 cs.DC 新提交 67%

CommBench: Can LLMs Write Correct and Efficient GPU Communication Code?

CommBench:大语言模型能编写正确且高效的GPU通信代码吗?

Shuang Ma, Yuyi Li, Yihan Zhang, Hezhi Xie, Danyang Chen, Shuyang Ji, Ziming Mao, Cheng Ji, Ansha Prashanth, Wenting Yang, Yiran Wang, Chihan Cui, Pei Yu Lin, Ion Stoica, Yang Zhou

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出GPU通信编程综合基准CommBench,评估发现最强代码生成模型GPT-5.5仅在30.7%任务中实现正确高效的GPU通信代码,凸显LLMs与专家水平的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04416 2026-08-06 cs.HC 新提交 67%

Preference-Driven Online Adaptation for Personalized Interaction Initiation in Proactive AI Assistants

主动式AI助手中个性化交互发起的偏好驱动在线适应

Yufeng Wang, Wei Zhang, Zhiquan Wen, Jinwu Hu, Linhui Xiao, Tianlu Pan, Qingfang Zheng, Mingkui Tan

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文针对主动式AI助手个性化交互时机难确定的问题,提出EOPA方法,在ProPerSim基准上较最强基线提升F1分数19.80个百分点,降低推理延迟与平均每日适应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03614 2026-08-05 eess.SP 新提交 67%

Test-Time Scalable AI-RAN: Inference Time Allocation for Cell-Free MIMO

测试时可扩展AI-RAN:无小区MIMO的推理时间分配

Seonghoon Yoo, Sangwoo Park, Seok-Hwan Park, Joonhyuk Kang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本研究针对无小区MIMO系统,提出通用框架以分配测试时可扩展AI-RAN各模块的最优推理时间资源,实验验证其可充分挖掘该系统的性能潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02608 2026-08-05 cs.DC 新提交 67%

Separating Intelligence from Inference: A Standard for Edge-Native AI Computing

将智能与推理分离:边缘原生AI计算的标准

Venkat Vinjam, Krishnaiah Narukulla

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出将AI的训练(智能)与推理分离的原则,设计了两类边缘设备及相关架构栈,可大幅降低大型语言模型推理的能源消耗与碳排放。

Comments 23 pages, preprint, Separating Intelligence from Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02336 2026-08-04 cs.CR 新提交 67%

Lost in Permissions: Exploring the Microsoft 365 App Ecosystem

在权限中迷失:探索Microsoft 365应用生态系统

Vincenzo Longo, Alberto Verna, Nikhil Jha, Marco Mellia

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文对Microsoft 365应用生态系统开展隐私安全测量,爬取8000余个应用,发现权限披露不一致、过度特权访问普遍,提出的主题感知异常检测框架可识别异常应用,为管理员提供安全见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01672 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Learning What to Remember: Test-Time Training via Context Distillation

学习该记住什么:基于上下文蒸馏的测试时训练

Zixuan Wang, Xingyu Dang, Rui-Jie Zhu, Zixin Wen, Hengyu Fu, Wenhao Chai, Jason D. Lee

机构 * Princeton University(普林斯顿大学) UC Berkeley(加州大学伯克利分校) UC Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有测试时训练未考虑保留信息未来效用的问题,提出TTCD框架及IP-TTCD变体,实验显示其在长上下文语言建模任务中性能优于多个基准方法,可助力架构持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01638 2026-08-04 cs.CV 新提交 67%

Dynamic Resolution Routing for Efficient Egocentric Grounding

面向高效自我中心 grounding 的动态分辨率路由

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01189 2026-08-04 cs.SE 新提交 67%

MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment

MADE:用于自主模型部署的信念驱动双智能体协调机制

Yicheng Liu, Bolin Zhang, Weiran Liu, Yakun Zhang, Yangqin Jiang, Zhiying Tu, Dianhui Chu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本研究针对自动模型部署任务提出MADE双智能体协调系统,构建M2ABench基准测试集,实验显示MADE部署成功率达68.85%,优于SWE-agent与OpenHands。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00650 2026-08-04 cs.DB 新提交 67%

TEngineDB-V: An OLAP-Native Vector Search System for Large-$k$ Workloads at Tencent

TEngineDB-V:腾讯面向大k workloads的原生OLAP向量搜索系统

Xufei Wu, Pengcheng Zhang, Yitong Song, Xiaobo Zhang, Anqi Liang, Kai Wang, Jijun Du, Yidi Xiong, Guangxu Cheng, Zhe Chen, Peng Chen, Guoliang Li, Xuanhe Zhou, Fan Wu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出TEngineDB-V,一款腾讯的原生OLAP向量搜索系统,通过全局分块解耦索引等技术解决大k向量搜索问题,实验显示其性能较竞品最高提升145倍,适配百亿级生产部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00458 2026-08-04 cs.MA 新提交 67%

BANDMAS: Causality-Inspired Semantic Packet Scheduling for Bandwidth-Efficient Multi-Agent Collaboration

BANDMAS:面向带宽高效多智能体协作的因果启发式语义分组调度

Jiangwen Dong, Wanyu Lin

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体协作中通信流量大、开销高的问题,提出BANDMAS框架,通过因果启发式语义分组调度减少应用层流量,在三类数据集上实现了显著的流量降低并取得最优任务指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29637 2026-08-03 cs.CV cs.SE 新提交 67%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28853 2026-08-03 cs.HC 新提交 67%

Spatial Visual Analytics for Multi-Document Summary Verification

面向多文档摘要验证的空间视觉分析技术

Jiahao Xu, Wei Liu, Yang Liu, Eric Krokos, Kirsten Whitley, Xuan Wang, Rebecca Faust, Chris North

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对多文档摘要验证难题,提出SVS视觉分析系统,含两种二维布局,实验表明其可提升验证准确性、降低工作量,SUMMARY-GUIDED布局综合表现最优。

Comments Accepted to IEEE VIS 2026; 13 pages, including appendices (11-page paper plus 2-page appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 67%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27667 2026-07-31 cs.CV 新提交 67%

Witness Evidence Portfolios: Single-Prefill Risk Detection for Closed Multimodal Answers

证据见证组合:针对闭集多模态答案的单预填充风险检测

Fexiang Liu, Shiye Wang, Qiang Qiu, Zheng Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究提出WEP方法,利用MLLM的白盒预填充路径,无需额外操作即可检测闭集视觉答案的推理风险,在3个MLLM和4个基准上提升了平均错误AP。

Comments 22 pages, 6 figures; includes supplementary material. Code: https://github.com/SouthWinter/WEP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 67%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26836 2026-07-30 cs.CR 新提交 67%

Before Agents Speak: Pre-hoc Failure Risk Inference in Multi-Agent Systems

智能体交流前:多智能体系统中的事前失败风险推断

Shi Lin, Chenpei Wang, Peng Qian, Dezhang Kong, Minghao Li, Yufeng Li, Xun Wang

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本研究针对多智能体系统中幻觉级联失败的问题,提出事前风险推断框架HalluProp,通过建模内在幻觉风险与传播机制实现早期诊断,性能优于事后方法,可提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26593 2026-07-30 cs.IR 新提交 67%

ASARL: Autonomous Social-Aware Relevance Learning for QQ Search

ASARL:面向QQ搜索的自主社交感知相关性学习

Tao Su, Jinjing Hu, Xiao Wang, Xingzhong Cao, Hui Wang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 该研究针对社交搜索的语境差异等挑战,提出ASARL框架,结合多智能体数据整理与三阶段训练,在QQ搜索平台实验中提升了相关性指标、用户参与度及标注效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 67%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 效率与部署 :pretraining(abstract);post-training(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25270 2026-07-29 cs.CL cs.AI cs.LG 新提交 67%

Where Steering Signals Come From: Activation Source Selection in Activation Steering

转向信号来自何处:激活转向中的激活源选择

Jiaran Ye, Lingxu Ran, Zijun Yao, Chenpeng Wang, Yong Jiang, Lei Hou, Juanzi Li, Liangming Pan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) YiXin-AILab(易信人工智能实验室)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究激活转向中转向信号的来源选择,通过实验表明改变源激活会影响转向成功率,有效转向信号来自执行边界状态,基于此提出尾部减法,揭示转向取决于模型即将做的事而非已出现的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25155 2026-07-29 eess.SY cs.SY 新提交 67%

VeraGrid-Agent: Tool-Augmented LLMs for Distribution Optimal Power Flow at the Grid Edge

VeraGrid-Agent:用于电网边缘分布式最优潮流的工具增强大语言模型

Shivanshu Tripathi, Hamed Mohsenian-Rad, Maziar Raissi

专题命中 效率与部署 :LLM(abstract);language model(abstract)

AI总结 研究针对电网边缘分布式最优潮流问题,提出工具增强大语言模型VeraGrid-Agent,通过自主编写模拟器输入、执行求解器并读取输出作答。引入VeraGrid-MCQ-150测试评估,相比无工具推理,该模型显著提升准确率,且剩余错误源于推理而非求解器执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24424 2026-07-28 cs.CV 新提交 67%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24098 2026-07-28 cs.CV 新提交 67%

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体

Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23631 2026-07-28 cs.CV 新提交 67%

PathSelect: Sequential Token Selection for Whole Slide Pathology

PathSelect:用于全切片病理学的序列令牌选择

Jingzhi Chen, Landi He, Zehong Chen, Peihang Wu, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对全切片图像给视觉语言模型带来的计算瓶颈,提出解耦路由框架PathSelect,将令牌剪枝重构成序列选择过程,训练时引入方差保持噪声门等,推理时模块分离,有效减少令牌数,提高准确率并优于基于采样的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23600 2026-07-28 cs.CV 新提交 67%

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习

Guo Yurong, He Yufei, Li Yonghao, Chang Dongliang, Zhang Ke, Ma Zhanyu

机构 * North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23561 2026-07-28 cs.IR 新提交 67%

Towards a Relevance Posterior in Neural Information Access

迈向神经信息访问中的相关性后验

Andrew Parry, Emmanouil Georgios Lionis, Debasis Ganguly, Sean MacAvaney

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 研究现代信息检索系统中相关性操作的局限,提出将其理解为近似后验推理,扩展经典概率检索形式,通过显式似然 - 先验分解转移计算,纳入查询独立文档效用,经实验证明能提升检索效果并给出研究方向。

Comments SIGIR 2026 Perspectives Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23046 2026-07-28 cs.CV 新提交 67%

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

机构 * LG Electronics(LG电子) Pusan National University(釜山国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏