arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22497 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22497 篇

2605.07726 2026-05-11 cs.DC 82%

A Scalable Recipe on SuperMUC-NG Phase 2: Efficient Large-Scale Training of Language Models

在SuperMUC-NG Phase 2上的可扩展配方:高效大规模训练语言模型

Ajay Navilarekal Rajgopal, Nikolai Solmsdorf

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文研究了在SuperMUC-NG Phase 2系统上高效训练大规模语言模型的方法,通过并行训练技术提升计算效率,实现了1750亿参数模型的高效训练。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25584 2026-05-11 cs.AI cs.CL cs.CV cs.IT cs.LG math.IT 82%

Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models

跳过层?视觉-语言模型中层跳过的理论条件

Max Hartman, Vidhata Jayaraman, Moulik Choraria, Akhil Bhimaraju, Lav R. Varshney

机构 * Department of Electrical and Computer Engineering, The University of Illinois, Champaign, IL, United States(电气与计算机工程系,伊利诺伊大学香槟分校) Department of Mathematics, The University of Illinois, Champaign, IL, United States(数学系,伊利诺伊大学香槟分校) AI Innovation Institute, Stony Brook University, Stony Brook, NY, United States(人工智能创新研究所,石溪大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出统一框架,通过可验证的冗余概念,理论分析视觉-语言模型中层跳过的条件,验证早期和晚期视觉token的冗余性,并统一现代层跳技术的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18165 2026-04-30 cs.AI cs.CL cs.LG cs.SE 82%

Saber: An Efficient Sampling with Adaptive Acceleration and Backtracking Enhanced Remasking for Diffusion Language Model

Saber: 一种高效的采样方法,具有自适应加速和回溯增强的重新遮蔽,用于扩散语言模型

Yihong Dong, Zhaoyu Ma, Xue Jiang, Zhiyuan Fan, Jiaru Qian, Yongmin Li, Jianha Xiao, Zhi Jin, Rongyu Cao, Binhua Li, Fei Huang, Yongbin Li, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Saber算法,通过动态调整每步未遮蔽令牌数量和回溯机制提升代码生成的推理速度和输出质量,实验显示在多个基准上Pass@1准确率提升1.9%,推理速度提升251.4%。

Comments Accepted to ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25080 2026-04-29 cs.DC 82%

CacheFlow: Efficient LLM Serving with 3D-Parallel KV Cache Restoration

CacheFlow: 高效的大语言模型服务中的3D并行KV缓存恢复

Sean Nian, Jiahao Fang, Qilong Feng, Zhiyu Wu, Fan Lai

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文提出CacheFlow框架,通过3D并行抽象优化KV缓存恢复,减少TTFT时间,提升大语言模型服务效率。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17280 2026-04-28 cs.DC 82%

The 1/W Law: An Analytical Study of Context-Length Routing Topology and GPU Generation Gains for LLM Inference Energy Efficiency

1/W定律:上下文长度路由拓扑和GPU生成增益对LLM推理能效的分析研究

Huamin Chen, Xunzhuo Liu, Yuhan Liu, Junchen Jiang, Bowei He, Xue Liu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文通过分析上下文窗口对GPU能效的影响,推导出1/W定律,指出通过优化路由拓扑可显著提升推理能效,且结合更高级的GPU可进一步提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22432 2026-04-27 cs.SE 82%

R2Code: A Self-Reflective LLM Framework for Requirements-to-Code Traceability

R2Code:一种用于需求到代码追溯的自反思大语言模型框架

Yifei Wang, Jacky Keung, Xiaoxue Ma, Zhenyu Mao, Kehui Chen, Yishu Li

专题命中 效率与部署 :LLM(title,abstract);prompting(abstract)

AI总结 本文提出R2Code框架,通过分解增强的双向对齐网络、自反思一致性验证模块和动态上下文适应检索机制,提升需求到代码追溯的准确性并降低推理成本。

Comments Accepted to IEEE COMPSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18909 2026-04-22 cs.AR 82%

ChipLight: Cross-Layer Optimization of Chiplet Design with Optical Interconnects for LLM Training

ChipLight:基于光学互连的芯片片级设计跨层优化用于大语言模型训练

Kangbo Bai, Zhantong Zhu, Yifan Ding, Tianyu Jia

专题命中 效率与部署 :LLM(title,abstract)

AI总结 ChipLight通过跨层多目标设计优化方法,结合芯片片和光学互连技术,提升训练集群的通信效率与性能。

Comments Accepted by DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 82%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 82%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16952 2026-04-21 cs.CV 82%

Better with Less: Tackling Heterogeneous Multi-Modal Image Joint Pretraining via Conditioned and Degraded Masked Autoencoder

更少的协同,更好的表现:通过条件和降质掩码自编码器解决异质多模态图像联合预训练

Bowen Peng, Yongxiang Liu, Jie Zhou, Xiaodong Chen, Tianpeng Liu, Xiaogang Yu, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology (NUDT)(电子科学与技术学院,国防科技大学) Beijing Institute of Remote Sensing Information(遥感信息研究所)

专题命中 效率与部署 :pretraining(title,abstract);foundation model(abstract)

AI总结 本文提出CoDe-MAE,通过Optical-anchored Knowledge Distillation和Conditioned Contrastive Learning解决高分辨率多模态联合预训练中的异质性-分辨率悖论,有效防止表示退化并在多个下游任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09176 2026-04-16 cs.HC 82%

LIVE-GS: LLM Powers Interactive VR Experience with Physics-Aware Gaussian Splatting

LIVE-GS:通过大语言模型实现交互式VR体验的物理感知高斯点云

Haotian Mao, Hangyu Zhou, Zhuoxiong Xu, Siyue Wei, Yule Quan, Yan Zhang, Zixuan Guo, Nianchen Deng, Xubo Yang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 LIVE-GS利用大语言模型快速生成动态高斯点云资产并实现实时VR交互,通过物理属性分析提升虚拟现实中的物理交互真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10772 2026-04-14 cs.CV 82%

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10674 2026-04-14 cs.LG cs.AI cs.CL 82%

Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents

Skill-SD:基于多轮LLM代理的技能条件自蒸馏

Hao Wang, Guozhi Wang, Han Xiao, Yufeng Zhou, Yue Pan, Jichao Wang, Ke Xu, Yafei Wen, Xiaohu Ruan, Xiaoxin Chen, Honggang Qi

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) vivo AI Lab(vivo AI实验室)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Skill-SD通过将代理自身轨迹转化为动态训练监督,结合重要加权反KL损失稳定训练,提升多轮LLM代理性能,实验显示优于标准RL和OPD方法。

Comments Project page: https://k1xe.github.io/skill-sd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20624 2026-04-14 cs.CL cs.AI cs.LG 82%

FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models

FS-DFM: 一种快速且准确的长文本生成方法:基于少步扩散语言模型

Amin Karimi Monsefi, Nikhil Bhendawade, Manuel Rafael Ciosici, Dominic Culver, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FS-DFM通过减少采样步骤数提升生成速度,同时保持生成质量,在语言模型基准测试中实现与传统扩散模型相当的性能,显著降低采样延迟和吞吐量。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20157 2026-04-08 cs.CV 82%

SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models

SigLino:高效多教师蒸馏用于聚类视觉基础模型

Sofian Chaybouti, Sanath Narayan, Yasser Dahou, Phúc H. Lê Khac, Ankit Singh, Ngoc Dung Huynh, Wamiq Reyaz Para, Hilde Kuehne, Hakim Hacid

机构 * Technology Innovation Institute(技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract)

AI总结 本文提出SigLino,一种高效的聚类视觉基础模型,通过同时蒸馏SigLIP2和DINOv3的知识到密集和专家混合学生中,提升了多教师蒸馏的效率与效果。

Comments 17 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05551 2026-04-08 cs.CL cs.AI cs.LG 82%

FastDiSS: Few-step Match Many-step Diffusion Language Model on Sequence-to-Sequence Generation--Full Version

FastDiSS: 少步匹配多步扩散语言模型在序列到序列生成中的应用——完整版本

Dat Nguyen-Cong, Tung Kieu, Hoang Thanh-Tung

机构 * FPT Software AI Center, FPT Corporation(FPT软件人工智能中心,FPT公司) Department of Computer Science, Aalborg University(奥尔堡大学计算机科学系) Quantum AI and Cyber Security Institute, FPT Corporation(FPT公司量子人工智能与网络安全研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FastDiSS模型,通过改进自条件机制和引入噪声感知机制,提升少步采样下的生成质量,并实现400倍更快的推理速度。

Comments camera-ready version, accepted by ACL Findings (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18599 2026-04-07 cs.CV 82%

Restore-R1: Efficient Image Restoration Agents via Reinforcement Learning with Multimodal LLM Perceptual Feedback

Restore-R1: 通过多模态大语言模型感知反馈的强化学习图像修复代理

Jianglin Lu, Yuanwei Wu, Ziyi Zhao, Hongcheng Wang, Felix Jimenez, Abrar Majeedi, Yun Fu

机构 * Amazon(亚马逊) Northeastern University(东北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出Restore-R1框架,利用强化学习和多模态大语言模型感知反馈,高效解决图像修复问题,无需标注数据即可实现高质量修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23850 2026-04-07 cs.AI cs.CL cs.LG 82%

The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models

向下钻探与伪造测试(DDFT):一种衡量语言模型认知鲁棒性的协议

Rahul Baxi

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DDFT协议,用于评估语言模型在语义压缩和对抗性伪造下的认知鲁棒性,发现鲁棒性与传统设计无关,且错误检测能力是关键瓶颈。

Comments This version strengthens the theoretical and empirical grounding of the CI metric, including explicit analysis of structural dependencies and ranking stability under ablations (e.g., excluding Turn 4). Claims regarding scale and robustness are revised to avoid overgeneralization. The evaluation protocol, jury methodology, and limitations are expanded to clarify assumptions and boundary conditions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02945 2026-04-06 cs.DC 82%

MSAO: Adaptive Modality Sparsity-Aware Offloading with Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

MSAO:基于边缘-云协作的自适应模态稀疏性感知卸载框架用于高效多模态大语言模型推理

Zheming Yang, Qi Guo, Jun Wan, Jiarui Ruan, Yunqing Hu, Chang Zhao, Xiangyang Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出MSAO框架,通过边缘-云协作和模态稀疏性分析,降低多模态大语言模型推理的延迟和资源消耗,提升吞吐量。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02702 2026-04-06 cs.SE cs.PL 82%

TypePro: Boosting LLM-Based Type Inference via Inter-Procedural Slicing

TypePro: 通过跨过程切片提升基于大语言模型的类型推断

Teyu Lin, Minghao Fan, Huaxun Huang, Zhirong Shen, Rongxin Wu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出TypePro方法,通过跨过程代码切片补充上下文信息,提升动态语言类型推断的准确性和鲁棒性,实验结果显示在ManyTypes4Py和ManyTypes4TypeScript数据集上分别达到88.9%和86.6%的Top-1精确匹配率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01147 2026-04-02 cs.SE cs.CR 82%

SERSEM: Selective Entropy-Weighted Scoring for Membership Inference in Code Language Models

SERSEM:基于代码语言模型的成员推断的选性熵加权评分

Kıvanç Kuzey Dikici, Serdar Kara, Semih Çağlar, Eray Tüzün, Sinem Sav

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 SERSEM提出一种新的白盒攻击框架,通过抑制无信息的语法模板来增强特定记忆信号,通过双信号方法提升成员推断的准确性,实验表明其在代码记忆检测中表现优于传统基线方法。

Comments Accepted to the FSE 2026 Poisoned Chalice Competition

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 82%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :language model(title,abstract);instruction tuning(abstract)

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28119 2026-03-31 cs.SE 82%

Compressing Code Context for LLM-based Issue Resolution

基于LLM的问题解决的代码上下文压缩

Haoxiang Jia, Earl T. Barr, Sergey Mechtaev

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出OCD算法和SWEzze模型,通过遗传搜索和delta调试压缩代码上下文,提升问题解决效率,实现6倍压缩率,减少51.8%-71.3%的token预算,提高5.0%-9.2%的问题解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26246 2026-03-30 cs.CL cs.AI cs.LG eess.AS 82%

Distilling Conversations: Abstract Compression of Conversational Audio Context for LLM-based ASR

对话蒸馏:用于基于LLM的ASR的对话音频上下文抽象压缩

Shashi Kumar, Esaú Villatoro-Tello, Sergio Burdisso, Kadri Hacioglu, Thibault Bañeras-Roux, Hasindri Watawana, Dairazalia Sanchez-Cortes, Srikanth Madikeri, Petr Motlicek, Andreas Stolcke

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了多模态上下文对基于LLM的ASR的提升效果及高效表示方法,提出抽象压缩技术以减少先前对话的音频负载,实验证明其在领域内和领域外数据集上均有效。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26110 2026-03-30 q-bio.QM 82%

TurboESM: Ultra-Efficient 3-Bit KV Cache Quantization for Protein Language Models with Orthogonal Rotation and QJL Correction

TurboESM: 3-bit KV缓存量化在蛋白质语言模型中的超高效实现,结合正交旋转与QJL校正

Yue Hu, Junqing Wang, Yingchao Liu

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 本文提出TurboESM,通过正交旋转和QJL校正实现蛋白质语言模型的3-bit KV缓存量化,实现7.1倍内存减少和高相似度,同时优化解码速度,但存在预填充开销。

Comments 16 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25500 2026-03-27 cs.CR cs.IR 82%

Unveiling the Resilience of LLM-Enhanced Search Engines against Black-Hat SEO Manipulation

揭示LLM增强搜索引擎对抗黑帽SEO攻击的韧性

Pei Chen, Geng Hong, Xinyi Wu, Mengying Wu, Zixuan Zhu, Mingxuan Liu, Baojun Liu, Mi Zhang, Min Yang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文首次系统研究针对LLMSEs的SEO攻击,通过构建SEO-Bench基准测试1000个真实世界黑帽SEO网站,发现LLMSEs能有效抵御99.78%的传统SEO攻击,但对LLMSEO攻击如重写查询填充和分段文本存在漏洞。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23507 2026-03-26 cs.CL cs.AI cs.LG 82%

Beyond Masks: Efficient, Flexible Diffusion Language Models via Deletion-Insertion Processes

超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型

Fangyu Ding, Ding Ding, Sijin Chen, Kaibo Wang, Peng Xu, Zijin Feng, Haoli Bai, Kai Han, Youliang Yan, Binhang Yuan, Jiacheng Sun

机构 * HKUST(香港科技大学) Huawei Foundation Model Dept(华为基础模型部门) CUHK(香港中文大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18750 2026-03-26 cs.AR 82%

HillInfer: Efficient Long-Context LLM Inference on the Edge with Hierarchical KV Eviction using SmartSSD

HillInfer: 在边缘设备上通过智能SSD实现高效长上下文LLM推理的分层KV淘汰

He Sun, Shinan Liu, Li Li, Mingjun Xiao

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出HillInfer框架,通过智能SSD实现轻量级KV淘汰,结合分层KV缓存管理与自适应预取管道,提升边缘设备长上下文LLM推理效率与I/O性能。

Comments 16 pages, 16 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20664 2026-03-24 cs.RO 82%

E-SocialNav: Efficient Socially Compliant Navigation with Language Models

E-SocialNav: 基于语言模型的高效社交合规导航

Ling Xiao, Daeun Song, Xuesu Xiao, Toshihiko Yamasaki

机构 * Hokkaido University(北海道大学) George Mason University(乔治·马歇尔大学) The University of Tokyo(东京大学)

专题命中 效率与部署 :language model(title,abstract);preference optimization(abstract)

AI总结 本文提出E-SocialNav,通过两阶段训练流程实现高效社交合规导航,验证了GPT-4o和Claude在机器人导航中的社交合规性,并在文本语义和动作准确性上优于零样本基线。

Comments Accepted by 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing, to appear. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21284 2026-03-24 cs.CV 82%

Toward Real-Time Surgical Scene Segmentation via a Spike-Driven Video Transformer with Spike-Informed Pretraining

迈向实时手术场景分割的脉冲驱动视频变换器及其基于脉冲的预训练

Shihao Zou, Jingjing Li, Wei Ji, Jincai Huang, Kai Wang, Guo Dan, Weixin Si, Yi Pan

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Alberta(阿尔伯塔大学) School of Medicine, Yale University(耶鲁大学医学院) Southern University of Science and Technology(南方科技大学) Nanfang Hospital Southern Medical University(南方医科大学南华医院) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院) Faculty of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机科学与控制工程学院)

专题命中 效率与部署 :pretraining(title,abstract);foundation model(abstract)

AI总结 本文提出SpikeSurgSeg,一种基于脉冲驱动的视频变换器,用于手术场景分割。通过引入基于MAE的脉冲感知预训练策略和多谱知识蒸馏,提升模型在数据稀缺场景下的性能,同时减少推理延迟并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏