arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 766 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 131 篇

2604.00491 2026-06-23 cs.PL cs.AI cs.SE 版本更新 87%

Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters

边生成边执行:在LLM代码解释器中隐藏执行延迟

Zhensu Sun, Zhihao Lin, Zhi Chen, Chengran Yang, Mingyi Zhou, Li Li, David Lo

机构 * Singapore Management University Singapore(新加坡国立管理学院新加坡) Beihang University China(北航大学中国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出并行执行范式,通过将生成、检测和执行三阶段流水线化,在代码生成过程中提前执行,显著降低端到端延迟。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22963 2026-06-23 cs.CR cs.AI 版本更新 87%

When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents

当压缩成为攻击面:针对提示压缩的LLM智能体的黑盒攻击

Zesen Liu, Zhixiang Zhang, Yuchong Xie, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出当可信与不可信输入共享压缩预算时,攻击者可通过扰动不可信输入导致压缩器丢弃关键证据或安全护栏,并设计黑盒攻击COMA,平均攻击成功率达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20571 2026-06-23 cs.CL cs.AI 新提交 87%

Less is More: Lightweight Prompt Compression for Question Answering Applications on Edge Devices

少即是多:面向边缘设备问答应用的轻量级提示压缩

Zihuai Xu, Ruofei Hou, Yang Xu, Hongli Xu, Yunming Liao, Ying Zhu

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出CORE,一种无需辅助语言模型的两阶段句子级提示压缩方法,通过NER和语义匹配构建答案集与线索集,结合正交残差检索和空间邻近度过滤,在边缘设备上显著提升准确率、降低内存和能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20576 2026-06-23 cs.NI 新提交 87%

Exploring LLM in Semantic Communication for V2X Networks

探索V2X网络中的语义通信大语言模型

Sihem Bakri, Navdeep Singh, Nicola Marchetti

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出将大语言模型与图知识表示结合的语义通信框架,通过传输高级语义消息而非原始数据,在V2X网络中平均降低33.54%带宽消耗。

Comments Accepted at: IEEE 103rd Vehicular Technology Conference (VTC2026-Spring) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02982 2026-06-23 cs.PF cs.DC cs.LG 版本更新 86%

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

DriftSched: 多租户GPU推理中运行时令牌漂移下的自适应QoS感知调度

Kathiravan Palaniappan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DriftSched框架,通过运行时反馈驱动的漂移补偿和自适应偏差校正,解决多租户LLM推理中令牌漂移导致的调度问题,在NVIDIA L4 GPU上实现平均38.8%的估计误差降低和42%的中位延迟改善。

Comments 19 pages, 34 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29299 2026-06-23 cs.CV cs.AI 版本更新 86%

Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models

口袋牙医:通过高效多模态大语言模型实现设备端牙科图像理解

Kai Bian, Xucheng Guo, Bin Chen, Lingyan Ruan, Yiran Shen, Ting Dang, Hong Jia

机构 * The University of Auckland, New Zealand(奥克兰大学) Shandong University, China(山东大学) The University of Melbourne, Australia(墨尔本大学)

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 提出Pocket-Dentist基准,通过评估14种视觉语言模型发现紧凑模型(2B参数)在牙科图像理解中精度更高且计算成本更低,并在iPhone 17 Pro上实现低延迟部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21847 2026-06-23 cs.LG cs.AI 新提交 86%

UniRank: Unified Rank Allocation for Low-Rank LLM Compression

UniRank: 面向低秩大语言模型压缩的统一秩分配方法

Chao Han, Haozhe Hu, Fei Ma, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UniRank方法,将全局低秩分配转化为排序截断流程,通过局部奇异能量比和全局功能重要性双准则评分各奇异分量,并引入秩保持微调避免信息损失,在一次性压缩中困惑度降低高达50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23539 2026-06-23 cs.CV 新提交 86%

LightSTAR: Efficient Visual Document Retrieval via Lightweight Selection with Vision-Adaptive Refinement

LightSTAR: 通过视觉自适应精炼的轻量级选择实现高效视觉文档检索

Tongkun Guan, Haocheng Wang, Wei Shen, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院人工智能研究院教育部人工智能重点实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出LightSTAR框架,通过免LLM的视觉选择快速筛选候选页,再经视觉自适应语义精炼进行细粒度匹配,在保持高检索精度的同时大幅降低延迟。

Comments Accpeted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23087 2026-06-23 cs.LG 新提交 85%

FlowTrain: Flow-Based Decoupled Training for Industrial-Grade Vision-Language Models

FlowTrain:面向工业级视觉-语言模型的基于流的解耦训练

Zhida Jiang, Zhaolong Xing, Yang Pei, Xiaolong Chen, Yuanhang Xiao, Chengzhi Huang, Xiyu Liu, Haopeng Liu, Qingyuan Sang, Lingfeng Zhou, Jiaxing Wang, Zicheng Zhang, Wenzhe Wang, Xinyu Liu, Yan Li, Zhen Chen, Ke Zhang

机构 * Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出FlowTrain框架,通过生产者-消费者数据流和统一内存池解耦编码器与主干网络训练,采用异构并行分配器和动态打包调度器,实现超过50% MFU和1.7倍吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23104 2026-06-23 cs.LG cs.AI 新提交 84%

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

Chen Lin, Kedi Chen, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ReNIO方法,通过学生-教师概率比识别错误推理轨迹中的关键令牌并加权,在不依赖最终答案正确性的情况下提升在线策略蒸馏效果,在数学推理和代码生成任务上取得显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20670 2026-06-23 cs.LG cs.AI cs.IT math.IT 新提交 84%

Towards CSI-Native Foundation Models: A Channel-Adaptive Roadmap for 6G

面向CSI原生的基础模型:6G的信道自适应路线图

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(北京邮电大学移动网络技术国家工程研究中心) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(中央民族大学教育部民族语言智能分析与安全治理重点实验室) China Telecom Corporation Limited Gansu Branch(中国电信股份有限公司甘肃分公司)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出信道自适应路线图,通过统一预训练、位置建模和注意力控制与信道需求对齐,实现CSI原生基础模型,在零样本泛化、尺度外推和推理效率上显著优于现有方法。

Comments 7 pages, 5 figures, submmited to IEEE WCM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19475 2026-06-23 cs.AI cs.CL 新提交 84%

Diffusion Language Models: An Experimental Analysis

扩散语言模型:一项实验分析

Thomas Bertolani, Davide Bucciarelli, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统比较了八种扩散语言模型在推理、编码、翻译等任务上的表现,分析了去噪步数、上下文长度等推理因素对性能与效率的影响,揭示了扩散语言模型在不同任务和预算下的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23280 2026-06-23 cs.RO 新提交 83%

Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation

因果奖励世界模型:面向自动化技能生成的零样本奖励设计

Yang Yang, Yuchuang Tong, Zhengtao Zhang, Xu Ding, Ning Yang, Yifan Zhang, Haipeng Li, Kehu Yang, Miao Xin

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Intelligent Manufacturing Institute, HFUT(合肥工业大学智能制造研究院) School of Electrical Engineering and Automation, Anhui University(安徽大学电气工程与自动化学院) School of Artificial Intelligence, China University of Mining and Technology (Beijing)(中国矿业大学(北京)人工智能学院) National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能全国重点实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出因果奖励世界模型(CRWM),通过离线预训练学习候选奖励组件与任务目标物理变量间的因果拓扑关系,结合显式机制解耦与置信感知软融合的联合优化模块构建因果骨架,使LLM在零样本下生成可执行奖励函数,无需反馈迭代,显著降低新技能设计延迟并保持或超越现有性能。

Comments 22 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22911 2026-06-23 cs.AI cs.LG cs.SY eess.SY 新提交 82%

ThermoLLM: Thermodynamics-Aware HVAC Control with Spatial-Semantic Knowledge Graph

ThermoLLM: 基于空间语义知识图谱的热力学感知HVAC控制

Kirtan Bhatt, Xiachong Lin, Matthew Amos, Flora D. Salim, Wen Hu

机构 * University of New South Wales(新南威尔士大学) CSIRO Energy Centre(澳大利亚联邦科学与工业研究组织能源中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出一种热力学感知的LLM控制框架,利用物理信息空间知识图谱和近期交互历史,实现多区域HVAC的节能与舒适度优化。

Comments 10 pages, 5 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14150 2026-06-23 cs.LG cs.CL 新提交 82%

Small LLMs: Pruning vs. Training from Scratch

小型LLM:剪枝 vs. 从头训练

Yufeng Xu, Taiming Lu, Kunjun Li, Jiachen Zhu, Mingjie Sun, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过六种剪枝方法在Llama-3.1-8B上比较剪枝与从头训练,发现有限预算下剪枝更优,预算充足时粗粒度剪枝可被超越。

Comments Our code is available at https://github.com/zlab-princeton/pruning-vs-scratch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22376 2026-06-23 quant-ph 新提交 82%

Vibe Calibration: Autonomous Bring-up of a 112-Qubit Superconducting Quantum Processor by a Skill-Orchestrating Language Agent

Vibe Calibration:通过技能编排语言代理自主启动112量子比特超导量子处理器

Huikai Xu, Jiaxiu Han, Shigang Ou, Cheng Ye, Zisong Shen, Jing Gao, Yijia Wang, Tianrui Che, Yu Song, Weiyang Liu, Lei Wang, Lin-Feng Zhang, Pan Zhang, Hai-Feng Yu

专题命中 效率与部署 :language agent(title);large language model(abstract);language model(abstract)

AI总结 提出Vibe Calibration系统,利用大语言模型代理将专家隐性知识转化为可复用的技能,在112量子比特处理器上实现4.7小时内自主校准108个量子比特,速度提升4-5倍,并跨设备迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27048 2026-06-23 cs.CV 版本更新 82%

MOOZY: A Patient-First Foundation Model for Computational Pathology

MOOZY: 一种以患者为先的计算病理学基础模型

Yousef Kotp, Vincent Quoc-Huy Trinh, Christopher Pal, Mahdi S. Hosseini

机构 * CSSE, Concordia University, Montr\' e al, Canada Mila -- Qu\' e bec AI Institute, Montr\' e al, Canada CHUM, Universit\' e de Montr\' e al, Montr\' e al, Canada IRIC, Universit\' e de Montr\' e al, Montr\' e al, Canada Universit\' e de Montr\' e al, Montr\' e al, Canada Canada CIFAR Chair, Polytechnique Montr\' e al, Montr\' e al, Canada Dept.\ of Pathology, McGill University, Montr\' e al, Canada

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 提出以患者为基本单位的病理基础模型MOOZY,通过病例变换器建模同一患者多张切片依赖,结合多阶段自监督与低成本任务监督,在16个保留任务上优于PRISM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16164 2026-06-23 cs.PF 82%

AI Application Benchmarking: Power-Aware Performance Analysis for Vision and Language Models

AI应用基准测试:面向视觉和语言模型的功耗感知性能分析

Martin Mayr, Sebastian Wind, Lukas Schröder, Mohammadmoein Moradi, Georg Hager, Harald Köstler, Gerhard Wellein

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出一个基准框架,分析不同GPU架构下视觉和语言模型的性能与能耗,发现无统一最优功耗限制,且不同GPU在性能能耗权衡上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21955 2026-06-23 cs.NI cs.AI 新提交 81%

From RAN Control to Agentic Intelligence: Architecture and Vision for Energy Efficient AI-RAN

从RAN控制到智能体智能:节能AI-RAN的架构与愿景

Sabrine Aroua, Alexis I. Aravanis, Ilias Chatzistefanidis, Hamza Abbar, Anh-Khoa Dang, Anastasios Giovanidis, Salah-Eddine El Ayoubi, Stephane Senecal, Martha Vlachou Konchylaki, Navid Nikaein

机构 * Ericsson Research(爱立信研究) Laboratory of Signals and Systems (L2S)(信号与系统实验室) Universite Paris-Saclay(巴黎-萨克雷大学) CentraleSupelec(中央超导大学) CNRS(国家科学研究中心) BubbleRAN Orange Innovation(Orange创新)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种智能体AI原生RAN架构,结合语义意图抽象和大语言模型驱动协调,实现异构工作负载的自适应编排和节能多目标优化,以降低6G网络能耗。

Comments preprint under review at IEEE Network Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03784 2026-06-23 cs.CL 版本更新 81%

Fix the Structural Bottleneck: Context Compression via Explicit Information Transmission

修复结构瓶颈:通过显式信息传输进行上下文压缩

Jiangnan Ye, Hanqi Yan, Zhenyi Shen, Heng Chang, Ye Mao, Yulan He

机构 * King’s College London(伦敦国王学院) Tsinghua University(清华大学) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文通过从结构角度重新审视上下文压缩,识别出标准LLM压缩方法中的两个关键瓶颈,并提出ComprExIT框架,通过显式信息传输提升压缩效率,实验表明其在多个数据集上表现优异,提升了F1分数并降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22074 2026-06-23 cs.AI cs.IR 81%

Real-Time Procedural Learning From Experience for AI Agents

实时经验学习的AI代理

Dasheng Bi, Yubin Hu, Mohammed N. Nasir

机构 * Altrina(阿尔特里纳)

专题命中 效率与部署 :LLM(abstract,abstract_cn);foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 PRAXIS通过实时存储和检索行动后果,提升AI代理在动态环境中的任务完成效率与可靠性。

Journal ref ICLR 2026 MemAgents Workshop; WWW '26 Agentic Web Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20587 2026-06-23 cs.NI cs.AI cs.LG 新提交 81%

Protocol-Aware Tokenization and Architecture Co-Design for Wireless Packet Foundation Models

协议感知分词与架构协同设计用于无线数据包基础模型

Swadhin Pradhan, Shazal Irshad, Jerome Henry

机构 * Cisco Systems(思科系统)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 通过2x2对比实验发现,协议感知分词是无线数据包基础模型性能的主要杠杆,改变分词器可使准确率波动32个百分点,而改变架构仅影响2个百分点。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23255 2026-06-23 cs.NI 新提交 80%

Wireless Personal Agent: Extending Wireless Intelligence from Networks to Terminals

无线个人代理:将无线智能从网络扩展到终端

Jiedan Tan, Fang Liu, Jingwen Tong, Shengli Zhang, Jun Zhang, Wing Shing Wong

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WISPA框架,利用基于大语言模型的智能体实现终端侧资源自动化管理,通过解耦在线执行与离线反思克服终端资源限制,在校园通勤场景中验证了其学习用户偏好并自适应接入决策的能力。

Comments 7 pages, 5 figures, submit to a possible journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21833 2026-06-23 eess.SY cs.SY 新提交 80%

Inference as Flexibility: Ramp Management for Transmission-Connected AI Data Centres

推理即灵活性:面向输电连接AI数据中心的管理

Zhirui Liang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对AI数据中心快速爬坡等挑战,提出利用大语言模型推理作为内生灵活性资源,与电池储能协调控制,减少71%储能放电能量和51%峰值放电功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06530 2026-06-23 cs.AR 新提交 80%

RTLScout: Joint Agentic Code and Synthesis Optimization for Efficient Digital Circuits

RTLScout:面向高效数字电路的联合智能体代码与综合优化

Felix Arnold, Ryan Amaudruz, Dimitrios Tsaras, Renzo Andri, Lukas Cavigelli

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。

Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21913 2026-06-23 cs.CV cs.AI 新提交 79%

Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation

重新思考视觉基础模型在高效细胞分割中的适应

Qing Xu, Xiangjian He, Wenting Duan, Jiebo Luo, Zhen Chen

机构 * School of Computer Science, University of Nottingham, UK(英国诺丁汉大学计算机科学学院) School of Computer Science, University of Nottingham Ningbo China, China(中国宁波诺丁汉大学计算机科学学院) School of Engineering and Physical Science, University of Lincoln, UK(英国林肯大学工程与物理科学学院) Department of Computer Science, University of Rochester, USA(美国罗切斯特大学计算机科学系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 提出EffiCell-Seg框架,利用冻结的视觉基础模型中的全局显著性和局部形态先验,通过细胞结构提示编码器和协同掩码解码器实现高效细胞分割,仅需约5M可训练参数。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21212 2026-06-23 cs.LG 新提交 79%

DCD-PFN: A Decoupling-Aware Foundation Model for Causal Discovery

DCD-PFN:一种面向因果发现的解耦感知基础模型

Zhengkang Guan, Yikang Chen, Yi He, Yunze Tong, Zijing Hu, Haoyuan Qian, Fei Wu, Kun Kuang

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出DCD-PFN基础模型,通过预训练学习样本级解耦权重实现马尔可夫边界识别,并利用并行局部发现高效重构全局因果图,在零样本泛化中表现鲁棒。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20852 2026-06-23 cs.CV cs.AI 新提交 79%

Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays

将推理时控制转化为放射学视觉语言模型:针对胸部X光片肺炎分类的激活引导

Eduardo Moreno Judice de Mattos Farina, Mateus A. Esmeraldo, Felipe Akio Matsuoka, Paulo Eduardo de Aguiar Kuriki, Felipe Campos Kitamura

机构 * Universidade Federal de São Paulo (UNIFESP)(圣保罗联邦大学) Hospital Israelita Albert Einstein(以色列阿尔伯特·爱因斯坦医院) Stanford University School of Medicine(斯坦福大学医学院) DASA University of Texas Southwestern Medical Center (UTSW)(德克萨斯大学西南医学中心) Eden

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究评估对比激活添加(CAA)能否在不微调模型权重的情况下改善胸部X光片视觉语言模型(VLM)的肺炎分类性能,在三个冻结模型上测试,发现对其中一个模型有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01039 2026-06-23 cs.DC cs.LG cs.NI 79%

Joint Partitioning and Placement of Foundation Models for Real-Time Edge AI

面向实时边缘AI的大型基础模型联合划分与部署

Aladin Djuhera, Fernando Koch, Alecio Binotto

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Florida Atlantic University, USA(佛罗里达大学,美国) Carl Zeiss AG, Germany(蔡司股份公司,德国)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种动态框架,通过在运行时解决模型的空间放置和内部划分问题,以应对边缘环境中计算和网络资源的波动,提升推理效率与隐私保护。

Journal ref IEEE International Conference on Computing, Networking and Communications (ICNC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23406 2026-06-23 cs.LG cs.AI 新提交 79%

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

HyperQuant: 面向大型语言和扩散模型的率失真最优量化流水线

Yuval Domb, Hadar Sackstein, Tomer Solberg

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出HyperQuant统一后训练量化流水线,通过随机Hadamard变换、最优格量化、无损比特剥离和近熵最优Rice编码,在权重和KV缓存上实现率失真最优,优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏