Reducing Technician Search Burden: A Multimodal RAG for Cessna 172 Maintenance Manual
减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成
专题命中 效率与部署 :language model(abstract)
AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成
专题命中 效率与部署 :language model(abstract)
AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。
Netflix 中通过多模态嵌入实现多媒体资产个性化
专题命中 效率与部署 :foundation model(abstract)
AI总结 Netflix 采用多模态嵌入技术,通过双塔模型结合 CLIP 嵌入、三模态基础模型 MediaFM 及离线代理任务,优化了美术图像和视频预览的个性化推荐,提升了冷启动性能与效果。
AdaSprite:大规模数据漂移下车路协同(V2I)系统的资源高效在线协同自适应
专题命中 效率与部署 :language model(abstract)
AI总结 针对V2I系统大规模数据漂移下边缘资源受限的协同自适应问题,AdaSprite通过协同弹性扩缩等技术,使弱边缘支持17个并发V2I任务,SLO达成率与吞吐量分别提升1.6倍、2.1倍。
Comments MobiSys 2026
机器人基于视觉的触觉智能:感知、学习与具身操作
机构 * Great Bay University(大湾区大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学) ; The Hong Kong Polytechnic University(香港理工大学) ; South China University of Technology(华南理工大学) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; King’s College London(伦敦国王学院)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本综述调研机器人领域基于视觉的触觉传感器(VBTSs)全流程,对其硬件分类、学习方法、仿真与数据集等展开分析,指出开放挑战,以推进接触密集型机器人任务的触觉智能。
LightLoc++:面向高效室外激光雷达定位的传感器鲁棒性表示学习
机构 * Xiamen University(厦门大学) ; University of Bristol(布里斯托大学) ; Northeastern University(东北大学)
专题命中 效率与部署 :pretraining(abstract)
AI总结 LightLoc++通过引入SULID数据集与跨传感器一致性学习预训练传感器鲁棒骨干,结合样本分类引导与冗余样本下采样,实现高效室外激光雷达定位,性能最优且新场景训练成本最低。
Comments 19 pages, 10 figures
视觉定位解码器是否需要前馈网络?基于冻结的视觉-语言特征的受控研究
专题命中 效率与部署 :language model(abstract)
AI总结 本研究通过受控实验对比不同视觉定位解码器,发现仅注意力的4块解码器(A4)性能与含FFN的4块解码器相当,8块仅注意力解码器(A8)可弥补A4的微小差距且更优,同时A4能减少参数量与延迟。
Comments 14 pages, 8 figures, 5 tables. Code and project page: https://github.com/TarunTomar122/attention-is-all-you-need-for-vlms
PACE:面向长周期具身操纵的阶段进度感知信用分配框架
专题命中 效率与部署 :post-training(abstract)
AI总结 PACE是面向长周期具身操纵的信用分配框架,通过GLC-Critic实现步骤级信用分配,结合PPD训练策略,在仿真与真实机械臂实验中较基线取得显著性能提升。
Comments 9 pages, 6 figures
面向通信高效自动驾驶的风险自适应边云视觉推理
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)
专题命中 效率与部署 :language model(abstract)
AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。
Comments 7 pages, 4 figures, 5 tables
面向6G AI-RAN的深度强化学习:一项综合调查
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。
Plasolver:用于弹塑性问题的物理信息神经算子
专题命中 效率与部署 :pretraining(abstract)
AI总结 研究针对弹塑性分析计算成本高的问题,提出Plasolver物理信息神经算子框架,结合算子学习与经典求解器优势,预训练结合热启动阶段,实现高精度与大幅加速,减少迭代次数,为弹塑性问题提供高效计算框架。
基于从头算分子动力学轨迹的材料特异性机器学习原子间势的高效构建
专题命中 效率与部署 :foundation model(abstract)
AI总结 该研究量化了将通用机器学习原子间势转换为材料特异性势所需的从头算分子动力学数据量,对比了不同框架的表现,提出了实用构建指南,还发现模型平均可提升稀缺数据下的预测性能。
面向分布值结果的生成驱动推断
专题命中 效率与部署 :foundation model(abstract)
AI总结 该研究提出生成驱动推断(GPI)框架,用于利用辅助生成模型改进分布值参数的推断,经模拟和K562细胞的Perturb-seq研究验证,其效率更高且在模型误设下表现稳健。
Comments 36 pages, 5 figures
GS²CI:基于大视觉模型先验的快照压缩成像鲁棒高斯溅射方法
机构 * Westlake University(西湖大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 该研究针对快照压缩成像的三维重建难题,提出结合三维高斯溅射与大视觉模型先验的框架,引入专属致密化策略提升稳定性,在多基准实验中实现了最优整体性能。
AmalthAI:面向文化遗产的开源计算机视觉平台
机构 * Democritus University of Thrace(德谟克利特色雷斯大学) ; Athena Research Center(雅典娜研究中心) ; National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) ; University of Warsaw(华沙大学)
专题命中 效率与部署 :language model(abstract)
AI总结 AmalthAI是面向文化遗产领域专家的开源计算机视觉平台,通过集成Kubeflow、Katib等工具,支持数据集管理、模型训练与推理,可保障敏感考古数据安全,已在黏土织物印痕数据集上验证其功能。
P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合
机构 * Northwestern Polytechnical University(西北工业大学) ; Hefei University of Technology(合肥工业大学) ; Rocket Force University of Engineering(火箭军工程大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。
Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io
Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练
机构 * The Hong Kong Polytechnic University(香港理工大学) ; ByteDance(字节跳动) ; AMD(超威半导体公司)
专题命中 效率与部署 :foundation model(abstract)
AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。
静默更新:测量并弥合部署后的披露差距
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。
Comments Accepted to AIES-26
面向DFT+U能量学的DPA-4力场的数据高效适配:以NiO为例
专题命中 效率与部署 :pretraining(abstract)
AI总结 本研究以NiO为案例,通过微调预训练的DPA-4力场,高效修正了源层面的错误相能量学,提出了一种预训练与目标微调结合的多保真度策略。
当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任
专题命中 效率与部署 :LLM(abstract)
AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。
Comments Accepted to ACM HCOMP 2026
SLIM-0.5B:学习机器人操作的动作基础预测隐变量
机构 * Fudan University(复旦大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; Renmin University of China(中国人民大学)
专题命中 效率与部署 :pretraining(abstract)
AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。
Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/
GeoRoute:面向交通未来帧预测的几何感知混合推理方法
机构 * Vietnamese-German University(越南-德国大学) ; University of Science, Ho Chi Minh City(胡志明市科学大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)
专题命中 效率与部署 :language model(abstract)
AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Carnegie Mellon University(卡内基梅隆大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。
视觉令牌编解码器:为ViT特征编码释放空间冗余
机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Pengcheng Laboratory(鹏城实验室) ; Ant Group(蚂蚁集团)
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对ViT特征编码忽略二维补丁网格结构的问题,提出双路径视觉令牌编解码器VTC,在DINOv2、SAM3的分类等任务上,码率降低15.7-37.4倍且性能达未压缩的90%,表现优于基线。
Comments 13 pages, 9 figures
SRE-FER:用于缓解细粒度面部表情识别中局部证据稀释的区域残差证据学习
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对细粒度FER中局部证据稀释问题,提出SRE-FER框架,通过RERA模块和AU指导优化,在三个基准测试中取得具竞争力的FER性能。
Comments 10 pages, 5 figures.Accepted at the 9th International Conference on Artificial Intelligence and Pattern Recognition (AIPR 2026)
VLZip:用于交错长上下文建模的统一视觉与文本压缩方法
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团)
专题命中 效率与部署 :language model(abstract)
AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 效率与部署 :foundation model(abstract)
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
开放词汇语义分割的测试时原型适配
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; South China Normal University(华南师范大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出测试时原型适配(TPA),一种无训练即插即用模块,可与多种开放词汇语义分割宿主结合,仅用少量未标注图像构建原型库,无需调优或更新参数即可提升分割准确率。
Comments 17 pages, 12 figures, preprint
AdaDINO:用于高效遥感变化检测的冻结DINO的成对感知骨干内适配
专题命中 效率与部署 :foundation model(abstract)
AI总结 AdaDINO是一种成对感知的骨干内适配框架,通过CGLA、BSCS和CPGR模块优化冻结DINO,在4个遥感变化检测基准上实现了高效且性能更优的变化检测,在SYSU-CD上F1达85.29%且吞吐量提升1.41倍。
回答我的问题需要多少成本?基于云VLM的VQA系统基准测试
专题命中 效率与部署 :language model(abstract)
AI总结 本研究推出首个将客户端输入预处理作为受控变量的VQABench基准,评估12种预处理技术在3个VQA数据集、4个商业VLMs上的95168次API调用,明确预处理对云VLM-based VQA的成本-质量影响,为VQA系统部署提供指导。
SemBridge:用于连续隐变量自回归语音生成的语义令牌锚定
专题命中 效率与部署 :language model(abstract)
AI总结 该研究提出SemBridge框架,通过离散语义令牌监督自回归LM状态,在零样本TTS和SVS任务中提升内容准确性,同时保持说话人相似度与感知质量,为连续语音生成提供有效方向。