arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-23 至 2025-12-23 共收录 280 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2502.04226 2025-12-23 cs.CV cs.LG cs.NE stat.CO stat.ML 70%

Keep It Light! Simplifying Image Clustering Via Text-Free Adapters

保持简洁!通过无文本适配器简化图像聚类

Yicen Li, Haitz Sáez de Ocáriz Borde, Anastasis Kratsios, Paul D. McNicholas

机构 * Department of Mathematics and Statistics, McMaster University(数学与统计学系,麦斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种无需文本信息的图像聚类方法SCP,通过简化训练流程在多个数据集上实现了与复杂方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19159 2025-12-23 cs.CV 67%

OmniMoGen: Unifying Human Motion Generation via Learning from Interleaved Text-Motion Instructions

OmniMoGen:通过学习交错的文本-运动指令统一人类运动生成

Wendong Bu, Kaihang Pan, Yuze Lin, Jiacheng Li, Kai Shen, Wenqiao Zhang, Juncheng Li, Jun Xiao, Siliang Tang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 OmniMoGen通过学习交错的文本-运动指令,实现了人类运动生成的统一框架,展示了在文本到运动、运动编辑和AnyContext任务上的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19021 2025-12-23 cs.CV cs.RO 67%

VLNVerse: A Benchmark for Vision-Language Navigation with Versatile, Embodied, Realistic Simulation and Evaluation

VLNVerse: 一个用于视觉语言导航的基准,具备多用途、具身体验、逼真模拟和评估

Sihao Lin, Zerui Li, Xunyi Zhao, Gengze Zhou, Liuyi Wang, Rong Wei, Rui Tang, Juncheng Li, Hanqing Wang, Jiangmiao Pang, Anton van den Hengel, Jiajun Liu, Qi Wu

机构 * Adelaide University(阿德莱德大学) Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心、澳大利亚机器学习研究所) Tongji University(同济大学) ManyCore Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) CSIRO Data61

专题命中 评测与基准 :LLM(abstract);pretraining(abstract)

AI总结 VLNVerse是一个大规模、可扩展的视觉语言导航基准,通过多用途、具身体验和逼真模拟提升导航任务的泛化能力与研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19018 2025-12-23 cs.SE 67%

PEAK: A Performance Engineering AI-Assistant for GPU Kernels Powered by Natural Language Transformations

PEAK:一种基于自然语言转换的GPU内核性能工程AI助手

Muhammad Usman Tariq, Abhinav Jangda, Angelica Moreira, Madan Musuvathi, Tyler Sorensen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 PEAK是一种基于自然语言转换的GPU内核性能工程AI助手,通过自然语言编写代码优化并验证性能,适用于CUDA、HIP和HLSL等后端,实现与供应商库相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18684 2025-12-23 cs.CV 67%

A Study of Finetuning Video Transformers for Multi-view Geometry Tasks

对多视角几何任务进行视频变换器微调的研究

Huimin Wu, Kwang-Ting Cheng, Stephen Lin, Zhirong Wu

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 本文通过微调视频基础模型,提出了一种简单有效的方法,实现了多视角几何任务如光流估计的高性能表现。

Comments AAAI 20206, Project website: geovit-aaai26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18563 2025-12-23 cs.CV 67%

OpenView: Empowering MLLMs with Out-of-view VQA

OpenView: 通过视图外视觉问答增强大规模语言模型

Qixiang Chen, Cheng Zhang, Chi-Wing Fu, Jingwen Ye, Jianfei Cai

机构 * Monash University(墨尔本大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 OpenView通过全景图像生成多选VQA,提升大规模语言模型在视图外视觉问答任务中的性能。

Comments Code: https://github.com/q1xiangchen/OpenView

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 67%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 评测与基准 :language model(abstract);instruction tuning(abstract)

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18031 2025-12-23 cs.LG cs.AI 62%

A Dataset and Benchmarks for Atrial Fibrillation Detection from Electrocardiograms of Intensive Care Unit Patients

用于重症监护病房患者心电图的房颤检测数据集和基准测试

Sarah Nassar, Nooshin Maghsoodi, Sophia Mannina, Shamel Addas, Stephanie Sibley, Gabor Fichtinger, David Pichora, David Maslove, Purang Abolmaesumi, Parvin Mousavi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Queen’s University(女王大学) School of Computing(计算机学院) Smith School of Business(商学院) Departments of Emergency Medicine and Critical Care Medicine(急诊医学与重症医学系) School of Computing and the Department of Electrical and Computer Engineering(计算机学院和电气与计算机工程系) Department of Surgery(外科系) Departments of Medicine and Critical Care Medicine(医学与重症医学系) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究发布了一个用于重症监护病房患者心电图房颤检测的数据集和基准测试,通过比较三种AI方法发现ECG基础模型在迁移学习策略下表现最佳。

Comments 10 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17915 2025-12-23 cs.CL cs.LG 62%

Supplementary Resources and Analysis for Automatic Speech Recognition Systems Trained on the Loquacious Dataset

Loquacious数据集训练的自动语音识别系统补充资源与分析

Nick Rossenbach, Robin Schmitt, Tina Raissi, Simon Berger, Larissa Kleppel, Ralf Schlüter

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 Loquacious数据集通过提供额外资源和实验结果,展示了其在自动语音识别中的应用价值和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01912 2025-12-23 cs.LG cond-mat.mtrl-sci cs.AI 62%

BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models

BOOM:机器学习模型对外部分布分子属性预测的基准测试

Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Essen

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Binghamton University(宾夕法尼亚州立大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 BOOM提出了一种用于评估机器学习模型在外部分布分子属性预测性能的化学信息指导基准,揭示了不同因素对OOD性能的影响,并指出了化学机器学习中的新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02341 2025-12-23 cs.CV cs.AI cs.LG 62%

GRADEO: Towards Human-Like Evaluation for Text-to-Video Generation via Multi-Step Reasoning

GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估

Zhun Mou, Bin Xia, Zhengchao Huang, Wenming Yang, Jiaya Jia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) Department of Computer Science(计算机科学系) Engineering, The Hong Kong University of Science(工程,香港科学大学)

专题命中 评测与基准 :instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19663 2025-12-23 cs.CV cs.AI 57%

Beyond CLIP: Knowledge-Enhanced Multimodal Transformers for Cross-Modal Alignment in Diabetic Retinopathy Diagnosis

超越CLIP:基于知识的多模态Transformer用于糖尿病视网膜病变诊断中的跨模态对齐

Argha Kamal Samanta, Harshika Goyal, Vasudha Joshi, Tushar Mungle, Pabitra Mitra

机构 * Department of Medicine Stanford University Stanford, USA(医学系 斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出一种基于知识的多模态Transformer框架,通过整合视网膜图像、临床文本和结构化数据,提升糖尿病视网膜病变诊断中的跨模态对齐与检索性能。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18679 2025-12-23 cs.CV cs.CL 57%

brat: Aligned Multi-View Embeddings for Brain MRI Analysis

brat: 用于脑部MRI分析的对齐多视图嵌入

Maxime Kayser, Maksim Gridnev, Wanting Wang, Max Bain, Aneesh Rangnekar, Avijit Chatterjee, Aleksandr Petrov, Harini Veeraraghavan, Nathaniel C. Swinburne

机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心) University of Oxford(牛津大学) London School of Economics(伦敦经济学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 brat通过多视图嵌入方法提升脑MRI与临床报告的对齐能力,公开发布基础模型以改进医学影像分析性能。

Comments First round accept at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14806 2025-12-23 cs.SE cs.AI 57%

Let the Barbarians In: How AI Can Accelerate Systems Performance Research

让野蛮人进来:AI如何加速系统性能研究

Audrey Cheng, Shu Liu, Melissa Pan, Zhifei Li, Shubham Agarwal, Mert Cemri, Bowen Wang, Alexander Krentsel, Tian Xia, Jongseok Park, Shuo Yang, Jeff Chen, Lakshya Agrawal, Ashwin Naren, Shulu Li, Ruiying Ma, Aditya Desai, Jiarong Xing, Koushik Sen, Matei Zaharia, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出AI驱动的系统研究(ADRS)方法,通过自动化生成和评估解决方案,提升系统性能研究效率,展示其在多个案例中的有效性。

Comments arXiv admin note: substantial text overlap with arXiv:2510.06189

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07935 2025-12-23 cs.AI cs.CY econ.GN q-fin.EC 57%

Working with AI: Measuring the Applicability of Generative AI to Occupations

与AI合作:衡量生成式AI对职业的适用性

Kiran Tomlinson, Sonia Jaffe, Will Wang, Scott Counts, Siddharth Suri

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过分析微软Bing Copilot的对话数据,研究生成式AI对职业适用性的影响,发现信息工作是最常见的AI应用领域,并预测哪些职业更可能使用AI辅助工作。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18406 2025-12-23 cs.CV cs.LG 57%

Automated Mosaic Tesserae Segmentation via Deep Learning Techniques

通过深度学习技术实现自动马赛克拼图块分割

Charilaos Kapelonis, Marios Antonakakis, Konstantinos Politof, Aristomenis Antoniadis, Michalis Zervakis

机构 * School of Electrical and Computer Engineering, Technical University of Crete, Chania, Crete, Greece(电气与计算机工程学院,希腊克里特技术大学,克里特,希腊) School of Production Engineering and Management, Technical University of Crete, Chania, Crete, Greece(生产工程与管理学院,希腊克里特技术大学,克里特,希腊)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出利用SAM 2模型实现马赛克拼图块的自动分割,通过创建标注数据集提升分割精度,实验结果显示交并比和召回率显著提高,且在基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18301 2025-12-23 cs.CL 57%

InstructNet: A Novel Approach for Multi-Label Instruction Classification through Advanced Deep Learning

InstructNet:一种通过先进深度学习进行多标签指令分类的新方法

Tanjim Taharat Aurpa, Md Shoaib Ahmed, Md Mahbubur Rahman, Md. Golam Moazzam

机构 * Department of Computer Science and Engineering, Jahangirnagar University(贾汗吉尔纳加尔大学计算机科学与工程系) Department of Data Science and Engineering, Bangabandhu Sheikh Mujibur Rahman Digital University(巴纳加尔·谢赫·穆吉布·拉赫曼数字大学数据科学与工程系) Department of Computer Science, Boise State University(博伊州立大学计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 InstructNet通过先进深度学习方法实现多标签指令分类,利用XLNet架构达到97.30%的准确率,展示了其在多标签分类中的有效性。

Journal ref PLoS ONE 19(10): e0311161 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18292 2025-12-23 cs.CY cs.CL 57%

Measuring Fine-Grained Negotiation Tactics of Humans and LLMs in Diplomacy

测量人类与LLM在外交中的细粒度谈判策略

Wenkai Li, Lynnette Hui Xian Ng, Andy Liu, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本研究通过分析Diplomacy游戏中的谈判策略,探讨人类与LLM在谈判风格上的差异,并展示通过微调使LLM更接近人类谈判行为的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14972 2025-12-23 cs.CL 57%

Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies

多模态文化安全:评估框架与对齐策略

Haoyi Qiu, Kung-Hsiang Huang, Ruichen Zheng, Jiao Sun, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19684 2025-12-23 cs.CV cs.RO 50%

Zero-shot Reconstruction of In-Scene Object Manipulation from Video

从视频中进行零样本场景物体操作重建

Dixuan Lin, Tianyou Wang, Zhuoyang Pan, Yufu Wang, Lingjie Liu, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Oxford(牛津大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出了一种基于数据驱动模型的零样本方法,用于从视频中重建场景中的物体操作,通过两阶段优化实现手-物体运动的准确重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00767 2025-12-23 cs.CV 50%

InterPose: Learning to Generate Human-Object Interactions from Large-Scale Web Videos

InterPose:从大规模网络视频中学习生成人-物体交互

Yangsong Zhang, Abdul Ahad Butt, Gül Varol, Ivan Laptev

专题命中 评测与基准 :LLM(abstract)

AI总结 InterPose通过大规模网络视频自动提取人-物体交互动作数据,提升人类动作生成的精度和多样性,同时开发LLM代理实现零样本动画生成。

Comments Accepted to 3DV 2026. Project page: https://mael-zys.github.io/InterPose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19168 2025-12-23 physics.optics cs.SY eess.SY 50%

Optical design and characterization of a multi-depth vision simulator

多深度视觉模拟器的光学设计与表征

Parviz Zolfaghari, Ehsan Varasteh, Koray Kavakli, Arda Gulersoy, Afsun Sahin, Hakan Urey

专题命中 评测与基准 :SLM(abstract)

AI总结 多深度视觉模拟器通过模块化设计实现多深度渲染与IOL表征,支持术前规划和术后视力模拟。

Comments 16 pages, 8 figures. Preprint submitted to Biomedical Optics Express journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 47 篇

2504.17685 2025-12-23 cs.CL cs.AI 93%

Ensemble Bayesian Inference: Leveraging Small Language Models to Achieve LLM-level Accuracy in Profile Matching Tasks

集成贝叶斯推断:利用小语言模型在资料匹配任务中实现LLM级别的准确性

Haru-Tada Sato, Fuka Matsuzaki, Jun-ichiro Takahashi

专题命中 效率与部署 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);large language model(abstract)

AI总结 本文提出集成贝叶斯推断方法,通过结合多个小型语言模型的判断,实现与大语言模型相当的资料匹配任务准确性。

Comments 13 pages, 2 figures

Journal ref Adv. Artif. Intell. Mach. Learn., 2025, 5 (3 ):4154-4173

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19069 2025-12-23 cs.AI 89%

Can abstract concepts from LLM improve SLM performance?

能否从LLM中提取的抽象概念提升SLM性能?

Siddharth Tandon

机构 * Google AI, Global Services Delivery(谷歌人工智能,全球服务交付)

专题命中 效率与部署 :SLM(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出通过从大型语言模型中提取抽象概念来提升小型语言模型的性能,通过实验验证了概念的可转移性,并引入了动态调整引导强度的推理时缩放技术,提升了多个任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18371 2025-12-23 eess.AS cs.SD 89%

Phoneme-based speech recognition driven by large language models and sampling marginalization

基于大语言模型和采样边际化的音素语音识别

Te Ma, Nanjie Li, Hao Huang, Zhijian Ou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出SKM策略,通过随机采样替代束搜索,提升语音识别模型的训练效率和识别性能。

Comments Published at NCMMSC 2025, in Chinese language

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11496 2025-12-23 cs.CV cs.AI 86%

AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model

AndesVL 技术报告:一种高效的移动端多模态大语言模型

Zhiwei Jin, Xiaohui Song, Nan Wang, Yafei Liu, Chao Li, Xin Li, Ruichen Wang, Zhihao Li, Qi Qi, Long Cheng, Dongze Hao, Quanlong Zheng, Yanhao Zhang, Haobo Ji, Jian Ma, Zhitong Zheng, Zhenyi Lin, Haolin Deng, Xin Zou, Xiaojie Yin, Ruilin Wang, Liankai Cai, Haijing Liu, Yuqing Qiu, Ke Chen, Zixian Li, Chi Xie, Huafei Li, Chenxing Li, Chuangchuang Wang, Kai Tang, Zhiguang Zhu, Kai Tang, Wenmei Gao, Rui Wang, Jun Wu, Chao Liu, Qin Xie, Chen Chen, Haonan Lu

机构 * AndesVL Team(AndesVL团队) OPPO AI Center(OPPO人工智能中心)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。

Comments Tech report of OPPO AndesVL Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17910 2025-12-23 cs.DC cs.AI cs.LG 86%

Efficient Multi-Adapter LLM Serving via Cross-Model KV-Cache Reuse with Activated LoRA

高效多适配器LLM服务通过跨模型KV缓存重用与激活LoRA

Allison Li, Kristjan Greenewald, Thomas Parnell, Navid Azizan

机构 * mit(麻省理工学院) ibm(国际商业机器公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效LLM服务引擎,通过激活LoRA实现跨模型KV缓存重用,显著降低推理延迟和时间到第一个token,提升多适配器任务的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 85%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19004 2025-12-23 cs.CL cs.AI cs.LG 85%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18910 2025-12-23 cs.CV 85%

Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models

Delta-LLaVA: 基于令牌效率的视觉-语言模型对齐方法

Mohamad Zamini, Diksha Shukla

机构 * University of Wyoming(怀俄明大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract)

AI总结 Delta-LLaVA通过低秩Delta投影和轻量级Transformer块实现视觉-语言模型的高效对齐,提升推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏