arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2608.13076 2026-08-14 cs.AI 新提交 81%

SPADE: Speculative Decoding for Precise and Low Cost Distributed Edge Cloud Inference

SPADE:用于精确且低成本分布式边缘云推理的推测解码

Divya Jyoti Bajpai, Kishan Kumar Upadhyay, Manjesh Kumar Hanawal

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPADE是一种集成推测解码的分布式边缘云推理框架,通过边缘草稿模型与云端验证模型的协作,减少76%云端模型调用且不损失准确率,降低了LLM部署的成本与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12026 2026-08-13 cs.LG 新提交 81%

SoftWater: Class-Aware Rate Allocation for Softmax Quantization

SoftWater:面向Softmax量化的类别感知速率分配

Joao V. Cavalcanti, Ashia C. Wilson

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 针对小型LLM的Softmax层量化问题,提出类别感知速率分配方法SoftWater,在多模型上优于现有量化器,可大幅降低输出层KL散度,使输出层量化的困惑度损失可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11785 2026-08-13 cs.LG 新提交 81%

TradingMoE: Routing the Right Experts in Evolving Markets

TradingMoE:在动态市场中路由合适的专家

Chang Zhou, Xingtong Yu, Minbin Huang, Zhennan Wu, Yuan Fang, Hong Cheng, Xinming Zhang

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Tokyo(东京大学) Singapore Management University(新加坡管理大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TradingMoE是面向交易的稀疏MoE,通过Query-Key路由与稀疏专家选择更新机制优化专家选择,在股票和加密货币市场较22个基准提升累计收益超30%,且仅向前部署时优势仍存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10362 2026-08-12 cs.OS cs.AI 新提交 81%

MemSpec: Memory-Aware Runtime for Adaptive Draft Scheduling in Speculative Decoding on Edge Devices

MemSpec:边缘设备上推测解码中自适应草稿调度的内存感知运行时

Eunjeong Kim, Yeong Jun Jeon, Myeonggyun Han

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对边缘设备推测解码中内存受限导致自适应方法吞吐量提升不足的问题,提出MemSpec内存感知运行时,通过解耦草稿选择与执行等设计,使Jetson Orin Nano上的稳态生成吞吐量平均提升40.7%

Comments Published in LCTES 2026

Journal ref Proc. ACM LCTES 2026, 180-192 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10290 2026-08-12 cs.SE cs.AI cs.HC cs.PL 新提交 81%

Comprendia: AI-Augmented Code Comprehension

Comprendia:AI增强型代码理解工具

Costain Nachuma, Minhaz F. Zibran

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出一款名为Comprendia的Eclipse插件,通过集成结构依赖可视化、LLM代码解释、克隆检测及CVE风险叠加功能,为Java程序理解提供支持,在含已知克隆与漏洞的Java项目上验证了其有效性。

Comments 5 pages, 2 figures. Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09443 2026-08-11 cs.AI 新提交 81%

Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法

Zihan Wang, Anglin Liu, Rongyi Wang, Dantong Li, Yi Lu, Siqing Yuan, Hongxia Xu, Zhongtian Long, Jintai Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06153 2026-08-07 cs.SE cs.AI 新提交 81%

Learning Globally Reusable Skills for Coding Agents

为编码智能体学习全局可复用技能

Chen Yang, Jiashuo Tian, Ziqi Wang, Xinyin Liu, Meiru Ye, Junjie Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03632 2026-08-05 cs.AI 新提交 81%

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

当教师误导时:感知虚假信号的在线策略蒸馏

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03609 2026-08-05 cs.AI 新提交 81%

Formal Verification of Agentic Systems over Operational Data

基于操作数据的智能体系统的形式化验证

Alejandro J. Mercado, Alessio Lomuscio

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文针对操作数据上的智能体系统,提出形式化验证框架,定义STEADs模型,证明其FO-CTL验证问题的不可判定性,给出有限域下的充分条件,引入规范包装器并在案例工作流中验证。

Comments 21 pages, including appendix; 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01772 2026-08-04 cs.AI 新提交 81%

FRAMES: Guarded and Dual-Objective Skill Evolution for Agents in Policy-Governed Enterprise Workflows

FRAMES:面向策略管控型企业工作流中智能体的受保护双目标技能演化

Xuhui Wang, Ruoqi Shu, Chen Dan, Tianhua Xu, Mengxi Luo, Yanming Mai, Bo Wan

机构 * BMO Financial Group(加拿大蒙特利尔银行金融集团)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM智能体在受策略约束的企业工作流中改进难的问题,提出FRAMES闭环框架,可从现有资产冷启动技能并通过多机制演化,在保持可审计性的同时实现最优准确性-成本权衡,且结果可在tau-bench复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00974 2026-08-04 cs.AI 新提交 81%

Search-GRT: Guided Retrieval Training of Search Agents to Optimize for Complex Question Answering

Search-GRT:面向复杂问答任务优化的搜索智能体引导检索训练

Aounon Kumar, Sudipta Paul, Vivek Kulkarni, Vijay Srinivasan, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM搜索的奖励稀疏问题,提出GRT方法,通过真实信息限制检索过程,在多跳问答等任务上实现超40%性能提升并提高训练效率。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28848 2026-08-03 cs.DC cs.LG 新提交 81%

DeltaServe: Host-Agnostic Co-Serving of Inference and Fine-Tuning for LLMs

DeltaServe:面向大语言模型的主机无关式推理与微调协同服务

Jiaxuan Chen, Jianshu She, Ye Yuan, Rajat Ghosh, Karan Gupta, Qirong Ho, Xue Liu, Oana Balmau

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 DeltaServe是一种主机无关式LLM推理与微调协同服务设计,可利用闲置GPU算力提升LoRA微调吞吐量,已集成至vLLM等框架,在保持100%推理SLO合规的前提下,微调吞吐量较现有方案显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26339 2026-07-30 cs.LG cs.CR cs.IR 新提交 81%

RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning

RAGuard:一种针对检索增强生成系统数据中毒的分层防御框架

Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对RAG系统的语料库中毒攻击,提出分层防御框架RAGuard,含对抗微调检索器与ZKIP两层,可将攻击成功率降至0,且保持检索性能,相关资源已开源。

Comments Accepted to NeurIPS ResponsibleFM 2025, AAAI FrontierIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26076 2026-07-30 cs.IR cs.AI 新提交 81%

FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents

FinCacheServe:面向可变企业文档的高性价比RAG服务的依赖一致答案复用

Lingteng Zeng, Yifan Jin

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 FinCacheServe为可变企业文档的RAG服务设计依赖一致的答案复用机制,可跳过大量LLM调用,相比现有方法能降低能耗,提升服务成本效率。

Comments 16 pages, 11 figures, 12 tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24665 2026-07-28 cs.CV cs.GR cs.LG 新提交 81%

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

MMOE:通过高效专家设计使扩散变压器现代化

Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究AIGC基础模型中扩散变压器未平衡质量与成本问题,提出MMOE对其现代化改造,将多种专家设计应用于AIGC生成,实验表明MMOE能达更好质量成本平衡,使AIGC基础模型可循大语言模型平衡扩展路径。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24419 2026-07-28 cs.AI 新提交 81%

Failures Reveal What Metrics Miss: An Evidence-Driven Agent for Recursive Refinement of ECG Classifiers

失败揭示指标遗漏之处:用于心电图分类器递归优化的证据驱动智能体

Jinliang Deng, Yiming Niu, Yibo Pan, Zhiqi Shao, Qin Luo, Yongxin Tong

机构 * Beihang University(北京航空航天大学) Chongqing University(重庆大学) Fuwai Hospital(阜外医院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究聚焦心电图分类器优化依赖人工的问题,提出RecursiveECG框架,利用LLM基于具体失败情况和心电图证据优化分类器,经特殊转换和审查分析制定修订,在多数据集上表现出色,验证了基于证据优化过程的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22400 2026-07-27 cs.NI cs.AI 新提交 81%

A Self-Calibrating Agentic AI Framework for Autonomous Edge Resource Allocation

一种用于自主边缘资源分配的自校准智能体人工智能框架

Fin Gentzen, Marla Grunewald, Iulisloi Zacarias, Mounir Bensalem, Admela Jukan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型驱动系统运行可靠性受挑战的问题,提出自校准智能体人工智能框架,设计自校准机制,应用于边缘计算网络零知识工作负载资源分析,提高预测准确率和速度,为自主人工智能部署奠定基础,且生成基本事实速度更快。

Comments This work has been submitted to the IEEE Transactions on Network and Service Management for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21042 2026-07-24 cs.AI 新提交 81%

Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs

更快的IndexTTS-2:在GPU上加速和流式自回归零样本文本到语音合成

Muyang Du, Shuang Yu, Junjie Lai

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究旨在加速自回归文本到语音模型IndexTTS-2,利用NVIDIA TensorRT和TensorRT-LLM在GPU上实现生产部署,支持流式合成与批处理推理,实验表明在Seed-TTS基准测试中能显著加速且质量损失小,为加速类似模型提供参考。

Comments 4 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20814 2026-07-24 cs.AI 新提交 81%

Enhancing Explainable Cardiac Diagnosis with Guide-Grounded Multimodal LLMs

用指南引导的多模态语言模型增强可解释的心脏诊断

Hai-Nam Duy Vuong, Duy-Anh Bui, Trong-Nghia Nguyen, Kim-Ngan Thi Nguyen, Trang Mai Xuan, Tien-Cuong Nguyen, Van-Dem Pham, Thien Van Luong

机构 * Business AI Lab, College of Technology, National Economics University(商业人工智能实验室,技术学院,越南国家经济大学) A2I Lab, Phenikaa School of Computing, Phenikaa University(A2I实验室,费尼卡计算机学院,费尼卡大学) VNPT AI, VNPT Group(VNPT人工智能,VNPT集团) FPT University(FPT大学) Department of Pediatrics, Hospital of University Medicine and Pharmacy, Vietnam National University Hanoi(越南河内国家大学医学与药学院儿科学系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对深度学习模型在心脏诊断中可解释性有限等问题,提出指南引导的多模态框架,通过卷积神经网络、Grad-CAM及结构化解释指南生成诊断报告,实验证明该方法能提升报告质量,增强临床合理性。

Comments 12 pages, 3 figures, accepted at CITA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20477 2026-07-24 cs.AI 新提交 81%

Semi-Supervised Text-Attributed Graph Distillation

半监督文本属性图蒸馏

Yurui Lai, Samir Moustafa, Renchi Yang, Tsz Nam Chan

机构 * Hong Kong Baptist University(香港浸会大学) CeMM Research Center for Molecular Medicine of the Austrian Academy of Sciences(奥地利科学院分子医学CeMM研究中心) Universität Vienna(维也纳大学) Shenzhen University(深圳大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对文本属性图表示学习的可扩展性瓶颈等问题,提出基于Wasserstein距离的半监督框架\algo{},通过图-文本协作编码模块等方法,在基准数据集实验中实现了高效的TAG学习及性能-压缩权衡。

Comments Technical report for the paper "Semi-Supervised Text-Attributed Graph Distillation" accepted KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20450 2026-07-24 cs.CL 新提交 81%

ShriNep@EEUCA 2026: RAKSHAK - Multi-Task DeBERTa with Rationale Distillation and Jigsaw-Augmented Training for Toxic Intent Classification

ShriNep@EEUCA 2026:RAKSHAK - 用于毒性意图分类的具有原理蒸馏和拼图增强训练的多任务DeBERTa

Binayak Karki, Aryan Kafle, Pingala Ghimire

机构 * Mechi Multiple Campus(梅奇多校区) Northern Kentucky University(北肯塔基大学) Himalaya College of Engineering(喜马拉雅工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对GameTox共享任务中《坦克世界》聊天话语毒性意图分类难题,提出多任务DeBERTa - v3 - base框架RAKSHAK,结合原理蒸馏等方法,通过跨域转移和LLM生成样本增强训练数据,相比另一系统表现更优,多任务架构和跨域转移贡献显著。

Comments 8 pages, 1 figure, EEUCA, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19351 2026-07-23 cs.AI 新提交 81%

OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks

OpenEvoShield:面向开放世界多智能体系统攻击的双重非平稳持续防御

Litian Zhang, Chaozhuo Li, Yuting Zhang, Zejian Chen, Bingyu Yan, Qiwei Ye

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM-MAS中对手通过通信注入恶意指令的双重动态攻击,提出OpenEvoShield持续防御框架,含不对称速率控制器等组件,实验表明其在多基准和拓扑上优于基线,能检测多数未见攻击且误报率低。

Comments 29 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17538 2026-07-21 cs.AR cs.CL cs.DB cs.ET cs.IR 新提交 81%

D-NOVA: In-Storage Retrieval Accelerator via Dual-Bound 3D NAND-Optimized Similarity Search with Vector Adaptation

D-NOVA:通过具有向量适配的双边界3D NAND优化相似性搜索实现存储内检索加速器

Chang Eun Song, Sumukh Pinge, Tianqi Zhang, Sung Eun Kim, Tajana S. Rosing, Mingu Kang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对RAG密集向量检索性能瓶颈,提出软硬件协同设计的存储内检索加速器D-NOVA。通过深度嵌入搜索功能、采用新距离度量及引入适配器,实现高效检索,相比CPU和现有加速器有显著性能和能效提升,展现全存储向量搜索加速RAG的潜力。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026), Athens, Greece. Chang Eun Song and Sumukh Pinge are co-first authors and contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13594 2026-07-16 cs.AI 新提交 81%

SAFETY SENTRY: Context-Aware Human Intervention via EXECUTE-ASK-REFUSE Routing

安全哨兵:通过执行-询问-拒绝路由实现上下文感知的人工干预

Tianyu Chen, Chujia Hu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM智能体行动风险,将问题重构为三向路由决策,用安全哨兵实例化,其推理简化,单阈值可调整。该模型在准确率和召回率上优于多种基线,能同时控制错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13095 2026-07-16 cs.AR cs.AI 新提交 81%

Full-Pipeline Inference Optimization for MiMo-V2.5 Series: Pushing Hybrid SWA Efficiency to the Limit

MiMo-V2.5系列的全流程推理优化:将混合滑动窗口注意力效率推向极限

Xiaomi MiMo Team, Anqi Liu, Aoxin Ma, Bo Chen, Bo Yang, Chen Wang, Chen Zhang, Chengda Tang, Chengwei Wang, Chiheng Lou, Depeng Yan, Fuli Luo, Gang Wang, Hailin Zhang, Jiale Sun, Kang Zhou, Rui Huang, Shaohui Liu, Shen Huang, Shijie Cao, Shuaishuai Fan, Tianling Zhou, Xiangwei Deng, Xueyang Xie, Xuli Wang, Yingchun Lai, Yu Yang, Yuan Zhang, Zhen Tang, Zhonghua Deng, Zihan Jiang

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对MiMo-V2.5模型家族,结合Hybrid SWA、MoE和多模态编码器进行全流程推理优化。通过多种策略优化KVCache系统,构建GCache并开发路由器,还优化多模态输入,构成首个有效涵盖该复合架构的大规模LLM生产服务系统。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08180 2026-07-10 cs.CR cs.AI 新提交 81%

Out of Sight: Compression-Aware Content Protection against Agentic Crawlers

视线之外:针对智能爬虫的压缩感知内容保护

Xuefei Wang

机构 * Beihang University(北航大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究基于LLM的智能体给在线内容带来的新威胁,提出CAPE框架,通过注入不可见扰动保护文本内容,在低查询预算下有效提升信息损失,实验证明其有效性与通用性,推动智能体时代内容保护研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07847 2026-07-10 cs.LG 新提交 81%

When Does Continual Learning Require Learning

持续学习何时需要学习

Anne Harrington, Nayan Saxena, Michael Murphy, Anastasia Borovykh, Zeyu Yun, Sridhar Kamath, Ara Eindra Kyi, Trevor Darrell, Jitendra Malik, Yutong Bai

机构 * UC Berkeley(加州大学伯克利分校) Capital Fund Management(资本基金管理公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究大语言模型持续学习问题,从空间和时间轴分解变化,通过重新设置基准和引入协议评估多种方法,发现持续学习非单一能力,不同环境变化需不同更新行为,为设计更强持续学习系统提供指导。

Comments Code: https://github.com/anneharrington/studying-cl. Project page: https://anneharrington.github.io/studying-cl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24477 2026-07-10 cs.CV cs.AI cs.SD 新提交 81%

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解

Yixuan Li, Guangzhi Sun, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02416 2026-07-07 cs.CL 新提交 81%

The Future of NLP may not be at NLP Conferences: Scholarly Migration Patterns in Natural Language Processing

NLP的未来可能不在NLP会议上:自然语言处理领域的学术迁移模式

David Jurgens

机构 * School of Information, University of Michigan(信息学院,密歇根大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析2010-2026年NLP论文发表数据,发现NLP研究正从传统ACL会议向通用ML会议迁移,新作者在ML会议发表比例从5%升至21%,且ML会议带来显著引用优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01590 2026-07-07 cs.AI cs.SE 新提交 81%

Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation

Hawk:利用硬件感知知识生成高性能NPU内核

Junyi Wen, Ruiyan Zhuang, Yongjia Xu, Pengtu Li, Rui Zou, Hongyi Chen, Chingman Wan, Puxu Yang, Wuhui Chen, Yanlin Wang

机构 * Sun Yat-sen University(中山大学) Greater Bay Area National Technology Innovation Center(粤港澳大湾区国家技术创新中心) Peng Cheng Laboratory(鹏城实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Hawk框架,通过运行时知识合成、瓶颈感知检索和效果驱动蒸馏三个模块,将NPU内核生成准确率从49.4%提升至80.0%,执行速度最高提升2.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏