Restart and Adaptive Acceleration in Stochastic Gradient Methods
随机梯度方法中的重启与自适应加速
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 针对满足Kurdyka-Łojasiewicz不等式的非光滑弱凸随机优化问题,提出重启策略以利用KŁ不等式实现加速收敛,并证明其对参数误设具有鲁棒性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
随机梯度方法中的重启与自适应加速
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 针对满足Kurdyka-Łojasiewicz不等式的非光滑弱凸随机优化问题,提出重启策略以利用KŁ不等式实现加速收敛,并证明其对参数误设具有鲁棒性。
Stellar:面向自然语言查询的可扩展多模态文档检索
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出Stellar框架,通过磁盘存储令牌级文档嵌入并动态加载候选嵌入,结合词汇表示过滤和高效磁盘支持的后交互,在保持检索效果的同时将内存开销和查询延迟降低1-2个数量级。
SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。
Comments Accepted by IJCAI 2026
ViCoStream: 流式视频大模型通过阶段协调推理可运行超过100 FPS
机构 * Southeast University(东南大学) ; Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出ViCoStream框架,通过阶段协调的流水线(分块执行、CUDA流重叠、视觉令牌控制、有界视觉注意力、查询端检索)实现流式视频大模型的高吞吐低延迟推理,在单A100上达到134 FPS视频吞吐和<50 ms首令牌延迟,精度接近全历史基线。
Comments 19 pages, 7 figures, 13 tables
语言引导的视觉嵌入用于可控且可泛化的感知
机构 * Google(谷歌)
专题命中 效率与部署 :language model(abstract);foundation model(abstract)
AI总结 提出语言引导视觉嵌入(LIVE)方法,利用语言动态引导视觉编码器生成任务中心嵌入,无需任务特定重训练,减少视觉幻觉并提升泛化能力。
Journal ref Published as a conference paper at ICLR 2026
TurboServe: 高效经济地服务流式视频生成
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 针对流式视频生成的会话时长和用户需求异构性,提出TurboServe系统,通过在线调度联合优化会话放置与GPU配置,采用迁移感知放置和负载驱动自动缩放,降低延迟和成本。
基于潜在空间中MeanFlow的一步式Token到波形生成
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出MeanFlow在高度压缩潜在空间中实现一步式Token2Wav生成,解决多步流匹配解码器的速度-质量权衡,RTF提升17倍且质量损失可忽略。
Comments 5 pages, 1 figure
MLLMs 先正确后错误:追踪并纠正后层文本偏见
机构 * National University of Defense Technology(国防科技大学) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Intelligent Game and Decision Lab(智能博弈与决策实验室)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 发现多模态大语言模型在中间层形成正确视觉预测,但最终输出时被文本覆盖,通过检测预测方向变化(85%失败转向文本,89%成功转向视觉)提出无训练方法CALRD,在冲突基准上提升高达9.4%。
Comments Accepted at IJCAI 2026. 16 pages, 10 figures
ITME:基于解耦CXL混合内存的分层推理内存扩展
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 针对大语言模型推理中TB级上下文状态的内存瓶颈,提出ITME架构,利用CXL混合内存实现字节可寻址的远程内存扩展,通过确定性访问模式优化数据移动,提升吞吐量达35.7%。
CoeusBI:百度基于大语言模型的全面交互式商业智能系统 [扩展版]
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 CoeusBI提出双智能体架构与分层模式链接,通过视图生成智能体自动简化JOIN查询、分层检索处理宽模式、动态路由智能体优化多轮对话,在公共和生产数据集上显著提升查询准确率、令牌效率与用户满意度,已部署于百度平台服务数千用户。
Comments Accepted by VLDB 2026
Solyx AI Grid:跨地理分布式GPU集群的硬件遥测感知路由
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出Solyx AI Grid,一种结合GPU硬件遥测、vLLM应用指标和WAN信号的多站点推理路由控制平面,通过10信号加权压力评分器实现每请求放置决策,在实验中吞吐量提升1.56-1.75倍,能力错配泄漏降至0.43%,故障重路由p99延迟降低至1247ms。
Comments 15 pages, 9 tables
通过动作令牌干预引导自回归视觉-语言-动作策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 效率与部署 :language model(abstract);foundation model(abstract)
AI总结 提出Token Steering方法,在推理时通过干预动作令牌空间动态引导VLA模型轨迹生成,无需训练或微调,显著提升家务操作任务成功率。
Comments 9 pages, 5 figures
机器人做什么比它们长什么样更重要:任务背景塑造教育人机交互中的信任
机构 * LIRES Robotics Lab, University of Macedonia(马其顿大学LIRES机器人实验室)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 通过视频实验(N=81)发现,任务类型(教学、指导、索要个人信息)对信任有显著主效应,而机器人外观无显著影响,表明任务背景比物理外观更关键。
Comments Accepted in the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026), Kitakyushu, Fukuoka, Japan
Y-BotFrame:一种用于四足机器人助手的可扩展具身智能体框架
机构 * Xidian University(西安电子科技大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出Y-BotFrame框架,集成多模态感知与大语言模型认知核心,将自然语言指令映射为可执行任务单元,实现无遥控器的人机协作,支持模块化扩展。
GRIP:面向大型多模态模型的反馈引导提示检索
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Bonn(波恩大学) ; Microsoft(微软)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出GRIP,一种可学习的视觉检索框架,利用多模态模型反馈识别真正提升上下文学习性能的示例,在分类、描述和VQA任务上优于基于相似度的检索。
弥合法医图像检索中的模态差距
机构 * Advanced Technologies Application Center (CENATAV)(先进技术应用中心(CENATAV)) ; Centro de Sistemas Complejos, Facultad de Física, Universidad de La Habana(哈瓦那大学物理学院复杂系统中心)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出统一检索框架,利用多模态大语言模型生成文本描述并结合视觉与文本特征融合,提升纹身、人脸素描等法医任务的检索精度与鲁棒性。
Comments 23 pages, 5 figures, paper submitted to Elsevier journal
干预还是不干预:通过概率模型混合指导推理时对齐
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)
专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出BlendIn框架,通过质量感知对齐和按可靠性加权混合模型知识,解决推理时对齐中指导有效性差异大的问题,在困难模型对上实现最高50%的性能提升。
Comments Accepted by ACL 2026
基于上下文的AI代码生成器对抗攻击:漏洞分析与影响
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 研究通过2800次实验,发现上下文对抗攻击使代码生成漏洞增加10.7倍,并提出双层防御框架实现89.1%检测率。
Comments 6 pages, 8 tables
桥接语义与物理执行:面向多对机器人装配的神经符号框架
机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出一种端到端神经符号框架,通过分层生成最优子图、解耦通用性与边缘情况、协调全局序列,解决非结构化环境中多对装配的空间干扰和接触不确定性,在100个真实场景中达到97%全局可执行性,UR3机械臂部署成功率90%。
Comments Corresponding author: Aiguo Song (a.g.song@seu.edu.cn)
智能体框架的能耗与债务:一项实证研究(注册报告)
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 通过实证研究关联智能体框架中的自我承认技术债务与运行时能耗,探讨代码质量能否指导节能设计。
Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Registered Reports Track
音频-视觉交换感知令牌剪枝用于高效音频-视觉字幕生成
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出基于强化学习的AVEX-Prune方法,通过跨模态令牌交换策略选择高置信度令牌,在40%保留率下保持全令牌质量。
端到端上下文压缩的规模化
机构 * New York University(纽约大学) ; Modal Labs(Modal实验室) ; University of Maryland(马里兰大学) ; Princeton University(普林斯顿大学) ; Columbia University(哥伦比亚大学) ; Harvard University(哈佛大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; FAIR at Meta(Meta FAIR实验室)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过架构搜索和持续预训练,提出潜在上下文语言模型(LCLMs),一种端到端编码器-解码器压缩器,在通用任务性能、压缩速度和峰值内存上改进帕累托前沿,并可作为长时智能体的高效骨干。
一种用于动态网络监控与编排的低延迟语义状态估计器,基于潜在预测学习
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出潜在预测状态估计器(LPSE),通过将变基数节点遥测转换为拓扑自适应表示并与监控问题融合,实现固定成本单次推理,在Kubernetes集群上达到82.42%语义预测准确率,推理延迟降低约41倍,内存占用减少15倍。
Comments 6 pages, 2 figures, 2 tables. Submitted to IEEE GLOBECOM 2026
少看多思:面向高效多模态大语言模型的块级注意力跳过
机构 * Xiamen University(厦门大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 针对多模态大语言模型视觉注意力饱和问题,提出训练无关的Visual-Skip方法,通过选择性跳过冗余的视觉自注意力模块实现块级稀疏性,并利用轻量级校准动态选择最优稀疏路径,在保持性能的同时显著降低计算成本。
不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏
专题命中 效率与部署 :prompting(abstract);分类 cs.CL、cs.AI;LLM(comments)
AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。
Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis
A.X K2 技术报告
机构 * SK Telecom(SK电信)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI
AI总结 A.X K2 是参数量 6880 亿的 MoE 语言模型,针对智能体应用优化,采用 SGA、GN 等技术,在多基准测试中优于前身,适配成本低,支持长上下文,与开源基准竞争力相当。
Comments https://huggingface.co/skt/A.X-K2
SOMTab:用于高效表格上下文学习的集合-顺序Mamba
机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院)
专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SOMTab架构,将表格上下文学习的表示构建与查询条件检索分离,结合DCH-TailMix合成先验,在接近Transformer模型性能的同时提升了效率。
BanglaMamba:探索用于孟加拉语假新闻检测的状态空间模型
机构 * BRAC University(BRAC大学)
专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.LG
AI总结 本文提出BanglaMamba,将基于Mamba的状态空间模型用于孟加拉语假新闻检测,其性能与从头训练的CustomBERT相当,且推理效率优于BERT模型,凸显了该模型在资源受限场景的应用潜力。
Flower Hub:用于联邦学习仿真与部署的可复现基准测试平台
机构 * Flower Labs ; University of Cambridge(剑桥大学) ; University of Auckland(奥克兰大学) ; University of Melbourne(墨尔本大学) ; Vector Institute ; Fraunhofer IMS(弗劳恩霍夫应用固体物理与材料力学研究所) ; NetCompany ; Gachon University(嘉泉大学) ; Owkin ; Sony AI(索尼人工智能)
专题命中 效率与部署 :instruction tuning(abstract);分类 cs.AI、cs.LG
AI总结 Flower Hub是一款联邦学习基准测试平台,可将基准打包为可执行应用,支持跨仿真与部署运行,涵盖多领域任务,推动联邦学习基准测试向可复用方向发展。
用于神经解码的冯·诺依曼状态空间Transformer
机构 * BrainCo(脑聚科技)
专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出VN-SST模型,其前馈模块为低维指令库,在神经解码任务中样本与参数效率优于现有模型,且在语言建模任务中也展现出通用高效性。
Comments 14 pages, 5 figures, 5 tables