arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 61 篇

2601.04131 2026-01-13 cs.CL cs.AI cs.LG 91%

ContextFocus: Activation Steering for Contextual Faithfulness in Large Language Models

ContextFocus:用于大语言模型中上下文忠实性的激活引导

Nikhil Anand, Shwetha Somasundaram, Anirudh Phukan, Apoorv Saxena, Koyel Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 ContextFocus通过轻量级激活引导方法提升大语言模型在知识冲突场景下的上下文忠实性,无需微调且高效,实验表明其在ConFiQA基准上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07580 2026-01-13 physics.ins-det cs.AI cs.LG hep-ex 90%

Large Language Models for Physics Instrument Design

大型语言模型在物理仪器设计中的应用

Sara Zoccheddu, Shah Rukh Qasim, Patrick Owen, Nicola Serra

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了大型语言模型在物理仪器设计中的应用,发现其能生成有效且物理合理的配置,尽管未进行特定任务训练,并提出将LLMs与强化学习结合以优化设计工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05096 2026-01-13 cs.CL 89%

AdaSpec: Adaptive Speculative Decoding for Fast, SLO-Aware Large Language Model Serving

AdaSpec: 一种适应性推测解码用于快速、面向SLO的大型语言模型服务

Kaiyu Huang, Hao Wu, Zhubo Shi, Han Zou, Minchen Yu, Qingjiang Shi

机构 * Tongji University(同济大学) Shenzhen Research Institute of Big Data, The Chinese University of Hong Kong, Shenzhen(深圳大数据研究院,香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 AdaSpec通过动态调整推测策略,提高大型语言模型服务的响应速度和SLO满足度,实验显示性能提升达66%。

Comments This paper is accepted by ACM SoCC 2025

Journal ref In ACM Symposium on Cloud Computing (SoCC '25), November 19-21, 2025, Online, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07212 2026-01-13 cs.CL 88%

MI-PRUN: Optimize Large Language Model Pruning via Mutual Information

MI-PRUN:通过互信息优化大语言模型剪枝

Hao Zhang, Zhibin Zhang, Guangxin Wu, He Chen, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MI-PRUN通过互信息方法优化大语言模型剪枝,利用隐藏状态转换识别冗余块,并结合数据处理不等式提升剪枝效率和稳定性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05191 2026-01-13 cs.CV cs.LG 88%

AgentCompress: Task-Aware Compression for Affordable Large Language Model Agents

AgentCompress: 任务感知压缩以实现经济高效的大型语言模型代理

Zuhair Ahmed Khan Taha, Mohammed Mudassir Uddin, Shahnawaz Alam

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 AgentCompress通过任务感知动态压缩技术,显著降低大型语言模型的计算成本,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06843 2026-01-13 cs.CV cs.CL 88%

Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models

边看边说:解锁多模态大语言模型的实时视频理解能力

Junyan Lin, Junlong Tong, Hao Wu, Jialiang Zhang, Jinming Liu, Xin Jin, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shanghai Jiao Tong University(上海交通大学) Ocean University of China(中国海洋大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06787 2026-01-13 cs.CL 88%

Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning

大语言模型中的垃圾注意力:BOS下沉头和下沉感知剪枝

Jaewon Sok, Jewon Yeom, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出通过BOS下沉分数识别并剪枝大语言模型中冗余的注意力头,以提升模型压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06612 2026-01-13 cs.CR cs.LG 88%

Cross-Border Data Security and Privacy Risks in Large Language Models and IoT Systems

跨境数据安全与隐私风险在大语言模型和物联网系统中

Chalitha Handapangoda

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NYU Tandon School of Engineering(纽约大学坦顿工程学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种主权意识的隐私由设计架构,通过动态整合本地加密、自适应差分隐私和实时合规性证明,有效降低跨境数据暴露风险并确保合规性。

Comments Final project for CS-GY 6813 at NYU Tandon School of Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07190 2026-01-13 cs.AI 87%

Active Context Compression: Autonomous Memory Management in LLM Agents

主动上下文压缩:LLM代理中的自主内存管理

Nikhil Verma

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Focus代理,通过自主压缩上下文提升LLM在长周期任务中的效率与准确性。

Comments 8 pages, 2 figures, 2 tables. IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00605 2026-01-13 eess.SP 87%

Quantize-Sample-and-Verify: LLM Acceleration via Adaptive Edge-Cloud Speculative Decoding

量化-采样-验证:通过自适应边缘-云推测解码加速大语言模型

Guangyi Zhang, Yunlong Cai, Guanding Yu, Petar Popovski, Osvaldo Simeone

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出了一种自适应边缘-云推测解码方法,通过动态调整草稿长度和量化精度,提高大语言模型的解码效率。

Comments Submit for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07197 2026-01-13 cs.LG cs.AI 86%

Beyond Variance: Knowledge-Aware LLM Compression via Fisher-Aligned Subspace Diagnostics

超越方差:通过Fisher对齐子空间诊断的知识感知LLM压缩

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 FASC通过Fisher对齐子空间诊断方法,在压缩LLM时提升知识保留能力,实验显示其在知识密集型基准测试中表现优于传统方差方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06586 2026-01-13 cs.CL cs.LG stat.AP stat.ML 86%

Detecting LLM-Generated Text with Performance Guarantees

具有性能保证的LLM生成文本检测

Hongyi Zhou, Jin Zhu, Ying Yang, Chengchun Shi

机构 * Tsinghua University(清华大学) University of Birmingham(伯明翰大学) London School of Economics and Political Science(伦敦政治经济学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需辅助信息的LLM生成文本检测方法,通过统计推断实现高准确率和低错误率的文本分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06288 2026-01-13 cs.LG cs.AI cs.DC 86%

AIConfigurator: Lightning-Fast Configuration Optimization for Multi-Framework LLM Serving

AIConfigurator: 多框架LLM服务的闪电式配置优化

Tianhao Xu, Yiming Liu, Xianglong Lu, Yijia Zhao, Xuting Zhou, Aichen Feng, Yiyi Chen, Yi Shen, Qin Zhou, Xumeng Chen, Ilya Sherstyuk, Haorui Li, Rishi Thakkar, Ben Hamm, Yuanzhe Li, Xue Huang, Wenpeng Wu, Anish Shanbhag, Harry Kim, Chuan Chen, Junjie Lai

机构 * NVIDIA

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AIConfigurator通过统一性能建模系统实现多框架LLM服务的快速配置优化,提升性能40%-50%并缩短搜索时间至30秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06220 2026-01-13 cs.LG cs.AI 86%

Breaking Model Lock-in: Cost-Efficient Zero-Shot LLM Routing via a Universal Latent Space

打破模型锁定:通过通用潜在空间实现成本效益的零样本LLM路由

Cheng Yan, Wuyang Zhang, Zhiyuan Ning, Fan Xu, Ziyang Tao, Lu Zhang, Bing Yin, Yanyong Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过通用潜在空间实现LLM零样本路由,提升模型集成的效率与成本效益

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07469 2026-01-13 cs.AI 85%

Knowledge Distillation for LLM-Based Human Activity Recognition in Homes

用于家庭中基于大语言模型的人活动识别的知识蒸馏

Julien Cumin, Oussama Er-Rahmany, Xi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了利用大语言模型进行家庭中的人活动识别,并通过知识蒸馏技术提升小型模型性能,实现参数减少50倍的同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06959 2026-01-13 cs.LG 85%

HAS-VQ: Hessian-Adaptive Sparse Vector Quantization for High-Fidelity LLM Compression

HAS-VQ:Hessian自适应稀疏向量量化用于高保真大语言模型压缩

Vladimer Khasia

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 HAS-VQ通过Hessian自适应稀疏向量量化实现大语言模型的高保真压缩,优于整数基线并实现无损压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11343 2026-01-13 cs.CL 85%

SpecDetect: Simple, Fast, and Training-Free Detection of LLM-Generated Text via Spectral Analysis

SpecDetect: 一种简单、快速且无需训练的LLM生成文本检测方法通过频谱分析

Haitong Luo, Weiyao Zhang, Suhang Wang, Wenji Zou, Chungang Lin, Xuying Meng, Yujun Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SpecDetect通过频谱分析技术,利用DFT总能量检测LLM生成文本,具有高效、快速且无需训练的特点。

Comments AAAI'26 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02620 2026-01-13 cs.DC cs.AI 85%

FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference

FlowSpec: 基于流水线的连续推测解码用于高效分布式大语言模型推理

Xing Liu, Lizhuo Luo, Ming Tang, Chao Huang, Xu Chen

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Computing, Montclair State University(蒙特克莱尔州立大学计算机学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FlowSpec提出了一种基于流水线的树状推测解码框架,通过三个关键技术提升分布式大语言模型推理效率。

Comments 11 pages, and the last one is the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24124 2026-01-13 cs.LG cs.AI cs.CL 85%

OptRot: Mitigating Weight Outliers via Data-Free Rotations for Post-Training Quantization

OptRot: 通过数据无关旋转缓解权重异常以实现训练后量化

Advait Gadhikar, Riccardo Grazzi, James Hensman

机构 * CISPA Helmholtz Center for Information Security, Germany(CISPA信息安全研究中心) Microsoft Research, Cambridge, UK(微软研究院)

专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OptRot通过数据无关旋转技术提升训练后量化效果,优于现有方法并改进激活量化性能。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21199 2026-01-13 cs.CV eess.SP 85%

MedPrompt: LLM-CNN Fusion with Weight Routing for Medical Image Segmentation and Classification

MedPrompt: 基于权重路由的LLM-CNN融合用于医学图像分割与分类

Shadman Sobhan, Kazi Abrar Mahmud, Abduz Zami

机构 * 1 ,2 Department of Electrical Electronic Engineering,\ University of Engineering 3Department of Computer Science \& Engineering,\ University of Engineering \& Technology, Rajshahi-6204, Bangladesh

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MedPrompt结合LLM和CNN实现医学图像分割与分类,通过权重路由提高可扩展性,实现高准确率和低延迟的实时应用。

Comments 40 pages, 8 Tables, 9 Figures

Journal ref Published at Biomedical Signal Processing and Control Volume 113, Part D, March 2026, 109251

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06226 2026-01-13 cs.LG cs.AI 84%

Projecting Out the Malice: A Global Subspace Approach to LLM Detoxification

剔除恶意:一种全局子空间方法用于LLM去毒化

Zenghao Duan, Zhiyi Yin, Zhichao Shi, Liang Pang, Shaoling Jing, Zihe Huang, Jiayi Wu, Yu Yan, Jingcheng Deng, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GLOSS方法,通过识别并消除LLM参数中的全局子空间来实现去毒化,有效提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04346 2026-01-13 cs.CL 84%

Adding Alignment Control to Language Models

向语言模型添加对齐控制

Wenhong Zhu, Weinan Zhang, Rui Wang

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出CLM模型,通过添加身份层实现语言模型的对齐控制,通过插值系数实现对齐的插值和外推,提升模型的可用性。

Comments I have changed the title of the paper and resubmitted a new one on arXiv titled "Flexible realignment of language models" (arXiv:2506.12704)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07072 2026-01-13 cs.CR cs.AI 83%

Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems

突破检索障碍:为LLM系统设计的野外间接提示注入

Hongyan Chang, Ergute Bao, Xinjian Luo, Ting Yu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出了一种高效且低成本的黑盒攻击算法,通过分解恶意内容为触发片段和攻击片段,实现了对LLM系统的间接提示注入攻击,揭示了检索过程中存在的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06588 2026-01-13 cs.IT math.IT physics.comp-ph 82%

TCLNet: A Hybrid Transformer-CNN Framework Leveraging Language Models as Lossless Compressors for CSI Feedback

TCLNet:一种结合语言模型的Transformer-CNN混合框架,用于利用语言模型作为无损压缩器进行CSI反馈

Zijiu Yang, Qianqian Yang, Shunpu Tang, Tingting Yang, Zhiguo Shi

专题命中 效率与部署 :language model(title,abstract);large language model(abstract)

AI总结 TCLNet通过结合Transformer-CNN架构和语言模型,实现CSI的高效无损压缩,提升压缩效率和传输性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08211 2026-01-13 cs.CL cs.AI cs.LG 82%

SAEMark: Steering Personalized Multilingual LLM Watermarks with Sparse Autoencoders

SAEMark: 通过稀疏自编码器引导个性化多语言大语言模型水印

Zhuohao Yu, Xingru Jiang, Weizheng Gu, Yidong Wang, Qingsong Wen, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAEMark通过稀疏自编码器实现多语言大语言模型的高效水印标记,无需修改模型参数,保持文本质量,适用于多种语言和领域。

Comments 24 pages, 12 figures, NeurIPS 2025, code available: https://zhuohaoyu.github.io/SAEMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07291 2026-01-13 cs.CV cs.AI 79%

A Visual Semantic Adaptive Watermark grounded by Prefix-Tuning for Large Vision-Language Model

基于前缀微调的视觉语义自适应水印

Qi Zheng, Shuliang Liu, Yu Huang, Sihang Jia, Jungang Li, Lyuhao Chen, Junhao Chen, Hanqian Li, Aiwei Liu, Yibo Yan, Xuming Hu

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VISA-Mark,一种基于前缀微调的视觉语义自适应水印方法,通过动态视觉证据权重提升视觉与语义保真度,实现高效且可靠的多模态水印技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07558 2026-01-13 cs.RO 78%

FlyCo: Foundation Model-Empowered Drones for Autonomous 3D Structure Scanning in Open-World Environments

FlyCo:基于基础模型的无人机自主3D结构扫描系统

Chen Feng, Guiyong Zheng, Tengkai Zhuang, Yongqian Wu, Fangzhan He, Haojia Li, Juepeng Zheng, Shaojie Shen, Boyu Zhou

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Differential Robotics, Hangzhou, China(杭州差分机器人)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 FlyCo通过整合基础模型实现无人机自主3D扫描,提升开放世界环境下的目标定位与预测效率。

Comments 34 pages, 24 figures, 9 tables. Video: https://www.youtube.com/playlist?list=PLqjZjnqsCyl40rw3y15Yzc7Mdo-z1y2j8

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08706 2026-01-13 cs.CV 78%

HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models

HiRes-LLaVA: 高分辨率大视觉-语言模型中碎片化输入的恢复

Runhui Huang, Xinpeng Ding, Chunwei Wang, Jianhua Han, Yulong Liu, Hengshuang Zhao, Hang Xu, Lu Hou, Wei Zhang, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei(华为) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 HiRes-LLaVA通过引入SliceRestore适配器和Self-Mining Sampler,有效恢复高分辨率输入的碎片化问题,提升模型在文档相关任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07239 2026-01-13 cs.AI 77%

Stochastic CHAOS: Why Deterministic Inference Kills, and Distributional Variability Is the Heartbeat of Artifical Cognition

随机CHAOS:为何确定性推断会杀死,而分布性变化是人工认知的心跳

Tanmay Joshi, Shourya Aggarwal, Anusa Saha, Aadi Pandey, Shreyash Dhoot, Vighnesh Rai, Raxit Goswami, Aman Chadha, Vinija Jain, Amitava Das

机构 * Raapid Lab, USA(美国Raapid实验室) Apple, USA(美国苹果公司) Google, USA(美国谷歌公司) Pragya Lab, BITS Pilani Goa, India(印度BITS Pilani Goa大学Pragya实验室)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文主张随机CHAOS,认为确定性推断会压制LLM的不确定性建模和安全对齐,强调分布性变化对人工认知的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06566 2026-01-13 cs.CV cs.AI 77%

QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models

QCaption: 通过融合大多模态模型实现视频描述与问答

Jiale Wang, Gee Wah Ng, Lee Onn Mak, Randall Cher, Ng Ding Hei Ryan, Davis Wang

机构 * Department of Computer Science and Engineering, Nanyang Technological University, Singapore(南洋理工大学计算机科学与工程系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 QCaption通过融合关键帧提取、多模态模型和语言模型,提升视频描述和问答任务的性能,实现44.2%和48.9%的改进。

Journal ref Proceedings of the 27th International Conference on Information Fusion (FUSION), 2024, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏