arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Qualcomm(高通)

共收录 169
2510.04927 2026-08-18 cs.LG cs.AI eess.SP 版本更新

Federated Self-Supervised Modulation Classification under Non-IID and Imbalanced Data

非独立同分布与不平衡数据下的联邦自监督调制分类

Usman Akram, Yiyue Chen, Haris Vikalo

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Texas at Austin(德克萨斯大学奥斯汀分校) Qualcomm Technologies Inc.(高通技术公司)

AI总结 该研究针对非独立同分布与不平衡数据场景,提出FedSSL-AMC联邦自监督框架,结合因果时间膨胀CNN编码器与轻量级本地SVM,在调制分类任务上取得优于监督联邦学习基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14543 2026-08-17 cs.CV 新提交

MagnifiQ: Patch-aware Text Guided Progressive Upscaling for High-Resolution Image Restoration

MagnifiQ:面向高分辨率图像修复的感知补丁文本引导渐进式上采样方法

Mahesh Reddy, Yashesh Savani, Antoine Mercier, Hong Cai, Fatih Porikli, Guillaume Berger

机构 * Qualcomm AI Research(高通人工智能研究中心)

AI总结 MagnifiQ是一种跨分辨率渐进式上采样的图像修复框架,替换扩散模型自注意力层为线性计算卷积,采用补丁文本提示,在4K图像修复中性能优于现有方法,实现速度与质量的实用权衡。

Comments Camera-ready version (ECCV workshop - LoViF'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13460 2026-08-14 cs.CV 新提交

SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation

SNM-VFI:对称非线性运动引导的生成式视频帧插值

Jisoo Jeong, Hong Cai, Jamie Menjay Lin, Hanno Ackermann, Hyeonjun Sim, Yinhao Zhu, Yunxiao Shi, Fatih Porikli

机构 * Qualcomm(高通公司)

AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。

Comments ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03079 2026-08-06 cs.CL 版本更新

Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment

学习诊断和纠正错误:大型语言模型中的道德敏感性获取

Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu

机构 * University of Mississippi(密西根州立大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) AWS AI Labs(AWS AI实验室) Johns Hopkins University(约翰霍普金斯大学) Qualcomm(高通) Michigan State University(密西根州立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07475 2026-08-04 cs.CL cs.LG 版本更新

A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs

对AR和扩散LLM中逐层表示能力的比较分析

Raghavv Goel, Risheek Garrepalli, Sudhanshu Agrawal, Chris Lott, Mingu Lee, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 本文比较了AR和扩散LLM的表示能力,发现扩散模型产生更全局的表示,而AR模型产生紧密耦合的局部表示,扩散训练引入深度冗余以实现原理性压缩。

Comments v4: improving writing and adding Qwen2.5-Instruct results with all v3 changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19054 2026-07-28 cs.CV 版本更新

Evaluation of Winning Solutions of 2025 Low Power Computer Vision Challenge

2025低功耗计算机视觉挑战赛获胜方案评估

Zihao Ye, Yung-Hsiang Lu, Xiao Hu, Shuai Zhang, Taotao Jing, Xin Li, Zhen Yao, Bo Lang, Zhihao Zheng, Seungmin Oh, Hankyul Kang, Seunghun Kang, Jongbin Ryu, Kexin Chen, Yuan Qi, George K Thiruvathukal, Mooi Choo Chuah

机构 * Purdue University(普渡大学) Qualcomm(高通) Lehigh University(莱维顿大学) Ajou University(庆尚大学) University of Minnesota(明尼苏达大学) Loyola University Chicago(芝加哥洛约拉大学)

AI总结 本文评估了2025低功耗计算机视觉挑战赛的获胜方案,涵盖图像分类、开放词汇分割和单目深度估计三个赛道,分析了高效模型在边缘设备上的性能与约束平衡。

Comments 11 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14711 2026-07-21 cs.CV cs.AI 版本更新

VideoSEMA: a scalable and efficient Mamba-like attention for video understanding

VideoSEMA:用于视频理解的一种可扩展且高效的类曼巴注意力机制

Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

机构 * University of California, Irvine(加利福尼亚大学欧文分校) Qualcomm AI Research(高通人工智能研究中心) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 研究针对视频理解提出VideoSEMA模型,核心方法是采用时空注意力分割,包含空间类曼巴注意力模块和时间注意力。主要贡献是在多数据集上表现优异,参数规模相当时准确率领先,分辨率提升时退化更平缓,扩展到长视频也有前景。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08297 2026-07-17 cs.CV cs.AI 版本更新

SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging

SEMA:通过令牌定位和平均实现的类似Mamba的可扩展高效注意力机制

Nhat Thanh Tran, Fanghui Xue, Shuai Zhang, Jiancheng Lyu, Yunling Zheng, Yingyong Qi, Jack Xin

机构 * Qualcomm AI Research(Qualcomm AI研究)

AI总结 针对Transformer注意力机制在计算机视觉任务中的问题,提出广义注意力定义并设计SEMA,利用令牌定位避免分散、算术平均捕捉全局,在Imagenet-1k上验证其可扩展性和有效性,优于线性注意力及其他Mamba模型。

Comments 16 pages, figures 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12789 2026-07-15 cs.LG cs.CV 新提交

AVQ-Attention: Adaptive Vector-Quantized Attention

AVQ注意力:自适应向量量化注意力

Winfried van den dool, Patrick Forré, Amir Habibian, Yuki M. Asano, Max Welling

机构 * QUVA Lab, University of Amsterdam(QUVA实验室,阿姆斯特丹大学) AMLab, Informatics Institute, University of Amsterdam(AMLab,阿姆斯特丹大学信息学院) AI4Science Lab, University of Amsterdam(AI4Science实验室,阿姆斯特丹大学) Korteweg-de Vries Institute for Mathematics, University of Amsterdam(科特韦格 - 德弗里斯数学研究所,阿姆斯特丹大学) Qualcomm AI Research(高通人工智能研究公司) FunAI Lab, University of Technology Nuremberg(FunAI实验室,纽伦堡工业大学)

AI总结 研究针对Transformer模型注意力机制计算瓶颈,提出自适应向量量化(AVQ)注意力,基于注意力重要性分配码本容量,前向传播识别重要代码并用子码字细化,开发相关实现,保持\(\mathcal{O}(MN)\)复杂度,提升精度-效率权衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09138 2026-07-13 cs.RO 新提交

BeyondSight: Object Permanence for End-to-End Autonomous Driving

超越视野:端到端自动驾驶中的物体持久性

Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

机构 * University of Toronto(多伦多大学) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 研究针对自动驾驶中物体易被遮挡问题,提出超越视野框架,通过维持持久物体假设解耦物体存在与可观测性,引入nuScenes - Permanence用于训练评估,实验证明该框架显著提升遮挡推理能力,凸显物体持久性对自动驾驶的重要性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09061 2026-07-13 cs.CV cs.AI cs.LG 新提交

On Locality and Length Generalization in Visual Reasoning

关于视觉推理中的局部性和长度泛化

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究中心)

AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07706 2026-07-09 cs.LG 新提交

The Key to Going Linear: Analysis-Driven Transformer Linearization

走向线性的关键:分析驱动的Transformer线性化

Anna Kuzina, Paul N. Whatmough, Babak Ehteshami Bejnordi

机构 * Qualcomm AI Research(高通人工智能研究中心)

AI总结 研究针对因果自注意力二次成本限制长上下文Transformer推理的问题,通过分析状态更新设计,发现softmax原理及近似误差源,引入结构干预,在多模型上扩展线性化方法,提升性能并匹配复杂缓存框架的长上下文检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04985 2026-07-09 cs.LG 版本更新

FPTQuant: Function-Preserving Transforms for LLM Quantization

FPTQuant:用于大语言模型量化的函数保持变换

Boris van Breugel, Yelysei Bondarenko, Paul Whatmough, Markus Nagel

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 研究针对大语言模型推理能耗高问题,提出FPTQuant方法,通过引入三种函数保持变换促进Transformer量化,经训练使模型在量化时保持功能,实现静态INT4量化,有最小开销且速度大幅提升,在精度-速度权衡上表现优异。

Comments Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02841 2026-07-07 cs.RO cs.CV 新提交

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR:用于端到端自动驾驶的大规模闭环强化学习

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究中心)

AI总结 研究端到端自动驾驶,针对现有基于视觉语言动作模型的策略多采用模仿学习致闭环规划性能欠佳的问题,提出CLEAR系统,用强化学习进行闭环训练,设计异构管道增加并行模拟环境数量,性能优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02798 2026-07-07 cs.CV cs.GR 新提交

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究中心) Trinity College Dublin(都柏林三一学院)

AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。

Comments Project Page: https://phongnhhn.info/Unicamo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01803 2026-07-07 cs.CV cs.GR cs.RO 新提交

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS: 像素空间扩散用于直接三维高斯泼溅生成

Cao Duy, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究院)

AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02259 2026-07-03 cs.CL 新提交

BamiBERT: A New BERT-based Language Model for Vietnamese

BamiBERT: 一种新的基于BERT的越南语语言模型

Dat Quoc Nguyen, Thinh Pham, Chi Tran, Linh The Nguyen

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 提出BamiBERT,一种从头训练的越南语BERT模型,支持2048 token上下文长度且无需分词,在15项指标中11项最优,刷新越南语编码器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22872 2026-07-03 cs.CV 版本更新

ForeSea: AI Forensic Search with Multi-modal Queries for Video Surveillance

ForeSea:面向视频监控的多模态查询AI取证搜索

Hyojin Park, Yi Li, Janghoon Cho, Sungha Choi, Jungsoo Lee, Taotao Jing, Shuai Zhang, Munawar Hayat, Dashan Gao, Ning Bi, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 针对监控视频中多模态查询与时间定位难题,提出ForeSea系统,采用三阶段即插即用流程,结合跟踪、多模态嵌入和视频LLM,在ForeSeaQA基准上准确率提升3.1%,时间IoU提升10.1%。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32020 2026-07-01 cs.CV 新提交

Cross-Space Distillation: Teaching One-Step Students with Modern Diffusion Teachers

跨空间蒸馏:用现代扩散教师训练一步学生模型

Anh Nguyen, Ngan Nguyen, Duc Vu, Trung Dao, Viet Nguyen, Quan Dao, Kien Nguyen, Chi Tran, Phong Nguyen, Khoi Nguyen, Cuong Pham, Dimitris Metaxas, Vishal M. Patel, Anh Tran

机构 * Qualcomm AI Research(高通AI研究院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Rutgers University(罗格斯大学)

AI总结 提出跨空间蒸馏框架,通过轻量级潜在接口Bridge解决教师与学生模型潜在空间不匹配问题,实现异构教师蒸馏到紧凑学生模型,显著提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31397 2026-07-01 cs.LG cs.AI 新提交

Mixture-of-Control: State-Aware Fine-Tuning for Transformer-based Models

控制混合:基于Transformer模型的状态感知微调

Duc Anh Nguyen, Tien Ngoc Luu, Tung Pham, Toan Tran

机构 * Qualcomm AI Research(高通人工智能研究院)

AI总结 提出Mixture-of-Control(MoC)框架,通过稀疏混合专家机制自适应融合局部和全局控制信号,增强Transformer块间信息交换,实现高效微调。

Comments ICML 2026 Workshop on Connecting Low-rank Representations in AI, CoLoRAI, 26 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29004 2026-06-30 cs.CV

SciFlow: Semantic Cross Interference for Self-Supervised Optical Flow Domain Generalization

SciFlow: 用于自监督光流域泛化的语义交叉干扰

Jamie Menjay Lin, Jisoo Jeong, Hong Cai, Kai Wang, Fatih Porikli

机构 * Qualcomm Technologies, Inc.(高通技术公司) Qualcomm AI Research(高通人工智能研究)

AI总结 提出SciFlow方法,通过自监督学习在训练时对合成图像施加来自开放世界图像的语义干扰,结合几何一致性,实现合成到真实域的泛化,无需真实标注。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27797 2026-06-29 cs.DC cs.AI cs.LG 新提交

Optimizing Teacher-Student Partitioning for Scalable Knowledge Distillation on HPC Systems

优化师生划分以实现 HPC 系统上的可扩展知识蒸馏

Adrian P. Dieguez, Victor Conchello Vendrell, Alex Batlle, Vinnam Kim, Jordi Ros-Giralt, Harris Teague

机构 * Qualcomm AI Research(高通AI研究)

AI总结 针对知识蒸馏中师生模型不对称性,提出 HPC 感知方法,通过解耦师生划分、避免冗余数据结构并选择最优拆分策略,在 HPC 集群上实现高达 67% 的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22709 2026-06-29 cs.CV cs.AI 版本更新

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

基于置信度蒸馏的门控关系对齐用于高效视觉语言模型

Yanlong Chen, Amirhossein Habibian, Luca Benini, Yawei Li

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) School of Electrical and Electronic Engineering(电气与电子工程学院)

AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。

Comments Accepted to the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14612 2026-06-29 eess.AS cs.AI cs.LG 版本更新

Event-Grounded Question Answering over Long Audio via Structured Retrieval

基于结构化检索的长音频事件问答

Kartik Hegde, Arvind Krishna Sridhar, Naveen Vakada, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc., India(印度高通技术公司) Qualcomm Technologies, Inc., USA(美国高通技术公司) University of Turku, Finland(芬兰图尔库大学)

AI总结 提出LA-RAG框架,通过音频基础模型将长音频转为带时间戳的事件记录并存入SQL数据库,结合意图感知检索和LLM生成,实现低延迟高精度的长音频问答,在多个基准上提升时间定位F1达11-17%。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20189 2026-06-24 cs.CV cs.AI cs.RO 新提交

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training

HilDA:利用扩散的分层蒸馏推进自监督LiDAR预训练

Maciej Wozniak, Jesper Ericsson, Hariprasath Govindarajan, Truls Nyberg, Thomas Gustafsson, Patric Jensfelt, Olov Andersson

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Linköping University(林雪平大学) TRATON AB(TRATON公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司)

AI总结 提出HilDA框架,通过分层蒸馏(多层蒸馏和全局上下文蒸馏)结合时间占用扩散目标,自监督预训练LiDAR骨干网络,在3D检测、场景流和语义占用预测任务上达到最先进水平。

Comments Accepted to ECCV 2026. Maciej and Jesper contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14659 2026-06-24 eess.AS cs.LG cs.SD 版本更新

Aligning Audio Captions with Human Preferences

对齐音频字幕与人类偏好

Kartik Hegde, Rehana Mahfuz, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies, Inc.(高通技术公司)

AI总结 提出基于人类反馈强化学习的音频字幕生成框架,通过CLAP奖励模型微调基线系统,无需真实标注即可生成更符合人类偏好的字幕。

Comments This paper has been accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24075 2026-06-23 cs.LG

Evolutionary Physics-Informed Temporal Fusion for Lane-Change Intention Prediction

进化物理信息时间融合用于换道意图预测

Jiazhao Shi, Qiyang Xie, Ziyu Wang, Yichen Lin, Di Zhu, Chen Xie, Ziwei Wang, Haoyun Zhang, Enliang Li, Zetong Guan

机构 * Tandon School of Engineering(工程学院) New York University(纽约大学) Khoury College of Computer Science(计算机科学学院) Northeastern University(东北大学) School of Business(商学院) Wake Forest University(威克森林大学) Independent Researcher(独立研究者) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Qualcomm CDMA Technologies(高通CDMA技术) University of Michigan(密歇根大学)

AI总结 提出一种进化物理信息时间融合框架,通过融合从传统交通信号导出的时间描述符和从原始轨迹序列学习的时间嵌入,实现三分类换道意图预测,在highD和exiD数据集上取得高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09547 2026-06-19 cs.CV cs.LG 新提交

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

流式干预:视频大语言模型能否在错误发生时即时纠正?

Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh, Rajeev Yasarla, Reza Pourreza, Litian Liu, Risheek Garrepalli, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) York University(约克大学) Vector Institute for AI(向量人工智能研究所)

AI总结 提出Ego-MC-Bench基准评估视频LLM在烹饪场景中的实时干预能力,并构建Ego-CoMist反事实合成数据集提升小模型性能。

Comments The project page is available at https://apratimbh.github.io/livecookv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09420 2026-06-19 cs.CV cs.AI cs.RO 版本更新

Class-Incremental Motion Forecasting

类别增量运动预测

Nicolas Schischka, Nikhil Gosala, B Ravi Kiran, Senthil Yogamani, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系) Qualcomm SARL France(法国.qualcomm SARL) Automated Driving, Qualcomm Technologies, Inc.(qualcomm Technologies, Inc. 自动驾驶部门)

AI总结 提出类别增量运动预测新任务,通过端到端框架结合伪标签与开放词汇分割,利用3D-2D投票机制和查询特征方差重放策略,缓解灾难性遗忘并适应新类别。

Comments V3: Change title. Add further experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15707 2026-06-19 cs.MM cs.CL cs.LG 版本更新

Proactive Conversational Assistant for a Procedural Manual Task based on Audio and IMU

基于音频和IMU的主动式程序性任务对话助手

Rehana Mahfuz, Yinyi Guo, Erik Visser, Phanidhar Chinchili

机构 * Qualcomm Technologies, Inc.(高通技术公司)

AI总结 提出首个仅使用音频和IMU模态的实时对话助手,通过微调语言模型减少不必要对话并提升问答准确性,在边缘设备上实现无云依赖。

Comments 5 figures. 5 more in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏