arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2049 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2049 篇

2608.18465 2026-08-20 cs.HC cs.ET cs.IR 新提交 50%

Reducing Technician Search Burden: A Multimodal RAG for Cessna 172 Maintenance Manual

减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成

Seongjun Ha, Md Rashedul Islam, Gaurav Nanda, Damon Lercel

专题命中 效率与部署 :language model(abstract)

AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18322 2026-08-20 cs.IR 新提交 50%

Multimedia Asset Personalization via Multimodal Embeddings at Netflix

Netflix 中通过多模态嵌入实现多媒体资产个性化

Emma Yanyang Kong, Aditya Deshpande, Bowei Yan, Asad Abbasi, Santiago Castro, Avneesh Saluja, David Fagnan, Ashish Rastogi

专题命中 效率与部署 :foundation model(abstract)

AI总结 Netflix 采用多模态嵌入技术,通过双塔模型结合 CLIP 嵌入、三模态基础模型 MediaFM 及离线代理任务,优化了美术图像和视频预览的个性化推荐,提升了冷启动性能与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16188 2026-08-18 cs.OS 新提交 50%

AdaSprite: Resource-efficient Online Co-Adaptation for V2I Systems Under Large-scale Data Drifts

AdaSprite:大规模数据漂移下车路协同(V2I)系统的资源高效在线协同自适应

Lehao Wang, Zhiwen Yu, Sicong Liu, Kefan Chen, Fengmin Wu, Bin Guo

专题命中 效率与部署 :language model(abstract)

AI总结 针对V2I系统大规模数据漂移下边缘资源受限的协同自适应问题,AdaSprite通过协同弹性扩缩等技术,使弱边缘支持17个并发V2I任务,SLO达成率与吞吐量分别提升1.6倍、2.1倍。

Comments MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15490 2026-08-18 cs.RO 新提交 50%

Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation

机器人基于视觉的触觉智能:感知、学习与具身操作

Peng Zhou, Jun Hu, Sihan Chen, Zeqing Zhang, Haofei Ma, Zhenyu Lu, Sichao Liu, Xueqian Wang, Pai Zheng, Xiang Li, Shan Luo, Jia Pan, David Navarro-Alarcon, Chenguang Yang, Michael Yu Wang

机构 * Great Bay University(大湾区大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学) KTH Royal Institute of Technology(瑞典皇家理工学院) King’s College London(伦敦国王学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本综述调研机器人领域基于视觉的触觉传感器(VBTSs)全流程,对其硬件分类、学习方法、仿真与数据集等展开分析,指出开放挑战,以推进接触密集型机器人任务的触觉智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15317 2026-08-18 cs.CV 新提交 50%

LightLoc++: Sensor-Robust Representation Learning for Efficient Outdoor LiDAR Localization

LightLoc++:面向高效室外激光雷达定位的传感器鲁棒性表示学习

Wen Li, Shangshu Yu, Dunqiang Liu, Qiming Xia, Sheng Ao, Siqi Shen, Chenglu Wen, Cheng Wang

机构 * Xiamen University(厦门大学) University of Bristol(布里斯托大学) Northeastern University(东北大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 LightLoc++通过引入SULID数据集与跨传感器一致性学习预训练传感器鲁棒骨干,结合样本分类引导与冗余样本下采样,实现高效室外激光雷达定位,性能最优且新场景训练成本最低。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15061 2026-08-18 cs.CV 新提交 50%

Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features

视觉定位解码器是否需要前馈网络?基于冻结的视觉-语言特征的受控研究

Tarun Tomar

专题命中 效率与部署 :language model(abstract)

AI总结 本研究通过受控实验对比不同视觉定位解码器,发现仅注意力的4块解码器(A4)性能与含FFN的4块解码器相当,8块仅注意力解码器(A8)可弥补A4的微小差距且更优,同时A4能减少参数量与延迟。

Comments 14 pages, 8 figures, 5 tables. Code and project page: https://github.com/TarunTomar122/attention-is-all-you-need-for-vlms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15026 2026-08-18 cs.RO 新提交 50%

PACE: Phase-Progress-Aware Credit for Long-Horizon Embodied Manipulation

PACE:面向长周期具身操纵的阶段进度感知信用分配框架

Chengye Song, Jiawei Zhang, Rui Song, Shengqi Wang, Xiangrong Zhang, Ziyi Wang, Huanbin Zhou, Hongzhou Wang

专题命中 效率与部署 :post-training(abstract)

AI总结 PACE是面向长周期具身操纵的信用分配框架,通过GLC-Critic实现步骤级信用分配,结合PPD训练策略,在仿真与真实机械臂实验中较基线取得显著性能提升。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14991 2026-08-18 cs.CV 新提交 50%

Risk-Adaptive Edge--Cloud Visual Reasoning for Communication-Efficient Autonomous Driving

面向通信高效自动驾驶的风险自适应边云视觉推理

Meng Ma, Shuyang Li, Naigang Wang, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM T. J. Watson Research Center(IBM T. J. 沃森研究中心)

专题命中 效率与部署 :language model(abstract)

AI总结 本研究提出风险自适应边云视觉推理架构,通过车载交通评估触发云端VLM推理,在自动驾驶中减少54.1%云端请求量,同时保持任务成功率并降低AEB触发次数,实现通信效率与性能的平衡。

Comments 7 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14877 2026-08-18 cs.NI eess.SP 新提交 50%

Deep Reinforcement Learning for 6G AI-RAN: A Comprehensive Survey

面向6G AI-RAN的深度强化学习:一项综合调查

Jie Lu, Peihao Yan, Qijun Wang, Ruxin Lin, Huacheng Zeng

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15157 2026-08-18 physics.comp-ph 新提交 50%

Plasolver: Physics-Informed Neural Operators for Elastoplasticity

Plasolver:用于弹塑性问题的物理信息神经算子

Yizheng Wang, Mohammad Sadegh Eshaghi, Huadong Zhang, Xiaoying Zhuang, Timon Rabczuk, Yinghua Liu

专题命中 效率与部署 :pretraining(abstract)

AI总结 研究针对弹塑性分析计算成本高的问题,提出Plasolver物理信息神经算子框架,结合算子学习与经典求解器优势,预训练结合热启动阶段,实现高精度与大幅加速,减少迭代次数,为弹塑性问题提供高效计算框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14899 2026-08-18 cond-mat.mtrl-sci physics.chem-ph 新提交 50%

Data-Efficient Construction of Material-Specific Machine-Learning Interatomic Potentials from Ab Initio Molecular Dynamics Trajectories

基于从头算分子动力学轨迹的材料特异性机器学习原子间势的高效构建

Jonas Hänseroth, Christian Dreßler

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究量化了将通用机器学习原子间势转换为材料特异性势所需的从头算分子动力学数据量,对比了不同框架的表现,提出了实用构建指南,还发现模型平均可提升稀缺数据下的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14542 2026-08-17 stat.ME stat.ML 新提交 50%

Generation-Powered Inference for Distribution-Valued Outcomes

面向分布值结果的生成驱动推断

Yijiao Zhang, Hongzhe Li

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究提出生成驱动推断(GPI)框架,用于利用辅助生成模型改进分布值参数的推断,经模拟和K562细胞的Perturb-seq研究验证,其效率更高且在模型误设下表现稳健。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13502 2026-08-14 cs.CV 新提交 50%

GS$^{2}$CI: Robust Gaussian Splatting For Snapshot Compressive Imaging via Large Vision Model Priors

GS²CI:基于大视觉模型先验的快照压缩成像鲁棒高斯溅射方法

Yanming Yang, Chenxi Song, Ping Wang, Xin Yuan, Chi Zhang

机构 * Westlake University(西湖大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究针对快照压缩成像的三维重建难题,提出结合三维高斯溅射与大视觉模型先验的框架,引入专属致密化策略提升稳定性,在多基准实验中实现了最优整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13343 2026-08-14 cs.CV 新提交 50%

AmalthAI: An Open-Source Computer Vision Platform for Cultural Heritage

AmalthAI:面向文化遗产的开源计算机视觉平台

Christos Chatzisavvas, Stelios Alvanos, Efstratios Politis, Panagiotis Rigas, Thomas Pappas, Ioannis Giannoukos, Nikolaos Mitianoudis, Agata Ulanowska, Katarzyna Żebrowska, Nazarij Buławka, Christina Margariti, George Pavlidis, Chairi Kiourt, Anestis Koutsoudis, Vassilis Katsouros, George Ioannakis

机构 * Democritus University of Thrace(德谟克利特色雷斯大学) Athena Research Center(雅典娜研究中心) National and Kapodistrian University of Athens(雅典国立卡波迪斯特里亚大学) University of Warsaw(华沙大学)

专题命中 效率与部署 :language model(abstract)

AI总结 AmalthAI是面向文化遗产领域专家的开源计算机视觉平台,通过集成Kubeflow、Katib等工具,支持数据集管理、模型训练与推理,可保障敏感考古数据安全,已在黏土织物印痕数据集上验证其功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13045 2026-08-14 cs.CV 新提交 50%

P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation

P2Fusion:基于提示的双先验蒸馏红外-可见光图像渐进融合

Yi Shi, Huichao Xie, Yuqing Wang, Mingyu Wang, Kaihui Yang, Yu Liu, Ruitao Lu, Lizhe Li, Junwei Han, Dingwen Zhang

机构 * Northwestern Polytechnical University(西北工业大学) Hefei University of Technology(合肥工业大学) Rocket Force University of Engineering(火箭军工程大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对红外-可见光图像融合的信息差异挑战,提出基于双固有提示的P2Fusion框架,结合Teach-to-Fuse机制与GDER模块,在多数据集上实现SOTA性能并提升下游感知鲁棒性。

Comments Accepted by ECCV 2026. Website: https://p2fusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12107 2026-08-13 cs.CV 新提交 50%

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练

Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) AMD(超威半导体公司)

专题命中 效率与部署 :foundation model(abstract)

AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 50%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11812 2026-08-13 cond-mat.mtrl-sci physics.comp-ph 新提交 50%

Data-Efficient Adaptation of DPA-4 Force Fields to DFT+U Energetics: A Case Study in NiO

面向DFT+U能量学的DPA-4力场的数据高效适配:以NiO为例

Fengyu Xie, Peiheng Jiang, Zhicheng Zhong

专题命中 效率与部署 :pretraining(abstract)

AI总结 本研究以NiO为案例,通过微调预训练的DPA-4力场,高效修正了源层面的错误相能量学,提出了一种预训练与目标微调结合的多保真度策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10412 2026-08-12 cs.HC cs.CY 新提交 50%

When the Interviewer Is a Bot: Behavior, Breakdowns, and Trust in MLLM-Led Interviews

当面试官是机器人时:多模态大语言模型(MLLM)主导的面试中的行为、故障与信任

He Zhang, Kambinachi Chukwuma, ChanMin Kim, John M. Carroll

专题命中 效率与部署 :LLM(abstract)

AI总结 该研究通过构建InterviewBot系统开展实证研究,分析了MLLM主导面试的行为、故障与社会动态,为以人为中心的面试自动化提供设计启示。

Comments Accepted to ACM HCOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 50%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交 50%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 效率与部署 :language model(abstract)

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09146 2026-08-11 cs.CV 新提交 50%

Multi-Submap Implicit Neural SLAM with Local-to-Global Loop Closure for Large-Scale Scene Reconstruction

面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM

Tianchen Deng, Chongdi Wang, Nailin Wang, Lei Zhao, Ziqi Ma, Tianjun Zhang, Zhe Liu, Danwei Wang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Carnegie Mellon University(卡内基梅隆大学) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08832 2026-08-11 cs.CV 新提交 50%

Visual Token Codec: Unleashing Spatial Redundancy for ViT Feature Coding

视觉令牌编解码器:为ViT特征编码释放空间冗余

Donghui Feng, Fengxi Zhang, Changsheng Gao, Wenhan Yang, Qi Wang, Qunshan Gu, Hongwei Hu, Zhengxue Cheng, Li Song

机构 * School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Pengcheng Laboratory(鹏城实验室) Ant Group(蚂蚁集团)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对ViT特征编码忽略二维补丁网格结构的问题,提出双路径视觉令牌编解码器VTC,在DINOv2、SAM3的分类等任务上,码率降低15.7-37.4倍且性能达未压缩的90%,表现优于基线。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08702 2026-08-11 cs.CV 新提交 50%

SRE-FER: Regional residual evidence learning for mitigating local evidence dilution in fine-grained facial expression recognition

SRE-FER:用于缓解细粒度面部表情识别中局部证据稀释的区域残差证据学习

Jiaye Song, Ruochen Zhang, Yuliang Wang, Jiaqi Wu

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对细粒度FER中局部证据稀释问题,提出SRE-FER框架,通过RERA模块和AU指导优化,在三个基准测试中取得具竞争力的FER性能。

Comments 10 pages, 5 figures.Accepted at the 9th International Conference on Artificial Intelligence and Pattern Recognition (AIPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08630 2026-08-11 cs.CV 新提交 50%

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip:用于交错长上下文建模的统一视觉与文本压缩方法

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 效率与部署 :language model(abstract)

AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 50%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 效率与部署 :foundation model(abstract)

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08290 2026-08-11 cs.CV 新提交 50%

Test-Time Prototype Adaptation for Open-Vocabulary Semantic Segmentation

开放词汇语义分割的测试时原型适配

Haozhe Wang, Jintao Cheng, Weibin Li, Xiaoyu Tang

机构 * The Hong Kong University of Science and Technology(香港科技大学) South China Normal University(华南师范大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出测试时原型适配(TPA),一种无训练即插即用模块,可与多种开放词汇语义分割宿主结合,仅用少量未标注图像构建原型库,无需调优或更新参数即可提升分割准确率。

Comments 17 pages, 12 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07982 2026-08-11 cs.CV 新提交 50%

AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection

AdaDINO:用于高效遥感变化检测的冻结DINO的成对感知骨干内适配

Xu Zhang, Xinqing Li, Jianpeng Xie, Zeshuai Zhu, Xin He, Yun Liu

专题命中 效率与部署 :foundation model(abstract)

AI总结 AdaDINO是一种成对感知的骨干内适配框架,通过CGLA、BSCS和CPGR模块优化冻结DINO,在4个遥感变化检测基准上实现了高效且性能更优的变化检测,在SYSU-CD上F1达85.29%且吞吐量提升1.41倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07861 2026-08-11 cs.CV cs.HC cs.IR cs.MM 新提交 50%

How Much Does It Cost to Answer My Question? Benchmarking Cloud VLM-based VQA Systems

回答我的问题需要多少成本?基于云VLM的VQA系统基准测试

Henri Vanhuynegem, Weitao Xu, Yiran Shen, Guohao Lan

专题命中 效率与部署 :language model(abstract)

AI总结 本研究推出首个将客户端输入预处理作为受控变量的VQABench基准,评估12种预处理技术在3个VQA数据集、4个商业VLMs上的95168次API调用,明确预处理对云VLM-based VQA的成本-质量影响,为VQA系统部署提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07462 2026-08-10 eess.AS cs.SD 新提交 50%

SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation

SemBridge:用于连续隐变量自回归语音生成的语义令牌锚定

Hanke Xie, Haopeng Lin, Jiale Qian, Dake Guo, Yuepeng Jiang, Zhichao Wang, Wenxiao Cao, Jingbin Hu, Guobin Ma, Wenhao Li, Huakang Chen, Chengyou Wang, Ming Tao, Zhonghua Fu, Lei Xie, Xinsheng Wang

专题命中 效率与部署 :language model(abstract)

AI总结 该研究提出SemBridge框架,通过离散语义令牌监督自回归LM状态,在零样本TTS和SVS任务中提升内容准确性,同时保持说话人相似度与感知质量,为连续语音生成提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏