arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 13234 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2232 篇

2608.26694 2026-08-28 cs.AI 新提交 57%

Relational Over-Regularization: Graph-Based AI-Generated Text Detection via Sentence Transition Deviation

关系过正则化:基于句子转移偏差的AI生成文本检测

Hyeonchu Park, Bugeun Kim

机构 * Chung-Ang University(中央大学)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 该研究提出关系过正则化(ROR),构建基于图的CSFG框架检测AI生成文本,在四个基准上验证,准确率达97.14%,泛化性能优异。

Comments Presented in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26496 2026-08-28 cs.RO cs.AI cs.CV 新提交 57%

RTNav: Towards Real-Time Zero-Shot Object Navigation

RTNav:迈向实时零样本目标导航

Easop Lee, Lingyu Zhang, Boyuan Chen

机构 * Duke University(杜克大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 针对零样本目标导航方法在现实实时场景下的性能下降问题,提出RTNav架构,在HM3D系列数据集的实时变体上实现了成功率与完成时间加权成功率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26324 2026-08-28 cs.LG 新提交 57%

Privacy Without Regret: Differentially Private Inference-Time Alignment

无遗憾的隐私:差分隐私推理时对齐

Ishi Jain, Nandini Bhattad, Sayak Ray Chowdhury

机构 * Indian Institute of Technology Kanpur(坎普尔印度理工学院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对最佳N采样的奖励黑客攻击与偏好数据隐私问题,提出PrivBoN和PrivITP方法,实现差分隐私推理时对齐,经实验验证其性能优于原有策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25774 2026-08-27 cs.LG 新提交 57%

EXAONE Tabular 1.0 : Technical Report

EXAONE Tabular 1.0:技术报告

Moonjung Eo, Min-Kook Suh, Hye-Seung Cho, Jiwon Kim, Seoyoon Kim, Sangjun Nam, Soonyoung Lee

机构 * LG AI Research(LG AI研究院)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 EXAONE Tabular 1.0 是一款紧凑表格基础模型系列,通过重新设计架构实现高效表格上下文学习,在多个公开基准测试中展现出优于同类模型的预测性能与推理效率。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25572 2026-08-27 cs.RO cs.AI 新提交 57%

ConfAL-WM: Confidence-Guided Active Learning for Action-Conditioned World Models

ConfAL-WM:用于动作条件世界模型的置信度引导主动学习

Xiang Liu, Sen Cui, Changshui Zhang

机构 * Tsinghua University(清华大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 针对动作条件世界模型在新场景下的局部错误问题,提出ConfAL-WM框架,基于EVAC和UNet实现置信度引导的高效数据选择与局部训练增强,在RoboTwin2.0上验证了其提升训练效率与预测质量的效果。

Comments Project page: https://ConfAL-WM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 57%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25019 2026-08-27 astro-ph.SR astro-ph.GA astro-ph.IM cs.LG 新提交 57%

EncoTESS: Age-Sensitive Encodings from Raw TESS Light Curves

EncoTESS:基于原始TESS光变曲线的年龄敏感编码

Phil R. Van-Lane, Joshua S. Speagle, Ryan Cloutier, Christopher A. Theissen, Gwendolyn M. Eadie, Ilay Kamai

机构 * University of Toronto(多伦多大学) Dunlap Institute for Astronomy & Astrophysics, University of Toronto(多伦多大学邓拉普天文与天体物理研究所) University of California San Diego(加利福尼亚大学圣迭戈分校) McMaster University(麦克马斯特大学) Data Sciences Institute, University of Toronto(多伦多大学数据科学研究所)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 EncoTESS是针对TESS数据特性开发的小型时间序列基础模型,可将光变曲线编码为潜在参数空间,用于恒星年龄推断等任务,性能优于传统年龄指标,框架与编码库公开可用。

Comments 36 pages, 23 figures (including appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24214 2026-08-26 cs.AI 新提交 57%

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。

Comments EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23794 2026-08-26 cs.LG cs.CV 新提交 57%

Mixture of Channel Experts: Static Sparse Supports with Input-Adaptive Mixing for Pointwise Projections

通道专家混合:用于逐点投影的具有输入自适应混合的静态稀疏支持

Elian Iluk, Gil Ben-Artzi

机构 * School of Computer Science, Ariel University(阿里尔大学计算机科学学院)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对MoE应用于卷积网络的结构缺陷,提出MoCE层替代逐点投影,在减少16.7% MAC和延迟的同时,性能匹配或优于基线与现有通道选择方法。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23538 2026-08-25 stat.ME cs.LG stat.ML 新提交 57%

Interpretable AI with Local Distillation

基于局部蒸馏的可解释人工智能

Erin Craig, Yiling Huang, Snigdha Panigrahi

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出局部蒸馏方法,以黑箱教师模型指导正则化线性学生模型,在17个基准数据集上近匹配教师模型准确性,还能识别癌症患者基因表达异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22179 2026-08-25 stat.ML cs.LG stat.ME 新提交 57%

Token-Level Likelihood-Array Regression for Membership Inference and AI-Generated Text Detection

用于成员推断与AI生成文本检测的令牌级似然数组回归

Jiajun Sun, Zhanrui Cai

机构 * Xiamen University(厦门大学) University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 提出似然数组回归(LAR)方法,通过嵌套左上下文窗口组织似然特征,在成员推断与AI生成文本检测任务上显著优于基线方法,且揭示短上下文似然及二阶特征的额外价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23417 2026-08-25 cs.AI 新提交 57%

SkillAlchemy: Open-World Agent Skill Creation

SkillAlchemy:开放世界智能体技能创建

Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

专题命中 效率与部署 :language agent(abstract);分类 cs.AI

AI总结 SkillAlchemy是一个以准入为中心的基于源的开放世界智能体技能创建框架,在87个SkillsBench v1.1任务上,其技能通过率较无技能执行提升19.9个百分点、较最强自动化基线提升8.6个百分点,性能接近人工策划技能。

Comments 33 pages, 7 figures, 8 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22917 2026-08-25 cs.CL cs.IR 新提交 57%

TSWAP: A Multilingual Retrieval-Augmented Thai Wellness Advisor

TSWAP:多语言检索增强型泰国健康顾问

Pornthep Ukosaramig, Kobkrit Viriyayudhakorn

机构 * Digital Touch Point Co., Ltd.(数字触点有限公司) iApp Technology Co., Ltd.(iApp技术有限公司)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL

AI总结 研究提出多语言检索增强型泰国健康顾问TSWAP,基于泰国传统医学知识库,采用混合检索等技术,发布相关基准与日志,发现量化及强制检索的部署要点。

Comments 8 pages, 2 tables. Data and evaluation logs: https://huggingface.co/datasets/iapp/tswap-wellness-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22847 2026-08-25 cs.AI 新提交 57%

GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis

GSAR:面向移动GUI智能体的目标-状态-锚点奖励,结合自进化数据合成技术

Long Zhang, Yuhan Chen, Chaoran Zhang, Wanxia Cao, Kun Huang, Pengzhi Gao, Wei Liu, Jian Luan, Chenliang Li, Lixin Zou

机构 * Wuhan University(武汉大学) Xiaomi Inc.(小米公司)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究提出GSAR奖励框架,结合自进化数据合成与状态-锚点机制,解决VLM-GUI智能体训练中数据合成及奖励信号的问题,在多基准测试中表现优异,为GUI智能体训练提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22638 2026-08-25 cs.SE cs.AI 新提交 57%

Do Not Copy/Paste: Soft Barriers for Copying in AI-Assisted Programming

请勿复制粘贴:AI辅助编程中的复制软屏障

Iyiola E. Olatunji, Alberick Euraste Djire, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 本文针对AI辅助编程中代码复制粘贴的问题,提出软屏障机制,通过Unicode扰动实现高复制粘贴抗性,可引导用户转向编辑重构,为AI代码交接研究提供方向。

Comments Accepted ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22364 2026-08-25 cs.AI cs.RO 新提交 57%

WAM-OPD: On-Policy Distillation for World Action Models

WAM-OPD:面向世界动作模型的策略内蒸馏

Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本研究提出WAM-OPD策略内蒸馏方案,用于修复世界动作模型学生模型,在RoboTwin 2.0两项机器人任务中提升了Flash-WAM的任务成功率,为视频优先WAM提供了有前景的后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22359 2026-08-25 cs.CV cs.AI cs.SD 新提交 57%

Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video

面向未修剪自我中心视频的预算受限视觉-语言字幕生成的预解码音频分诊

Masoud Jalayer, Changyi Li, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究针对预算受限的未修剪自我中心视频视觉-语言字幕生成问题,提出预解码音频分诊策略,通过音频优先选择窗口减少VLM调用,提升动作覆盖率,在多个数据集上优于现有方法。

Comments 18 pages, 5 figures, 9 tables. Under review at IEEE BigData 2026, Industrial and Government Track. Code: https://github.com/masjalayer/PreDecoding-AcousticTriage

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22042 2026-08-25 cs.LG 新提交 57%

ReMAP: Self-supervised learning to unveil brain representations and vulnerability

ReMAP:用于揭示大脑表征与脆弱性的自监督学习

Jade Perdereau, Virginie Loison, Kanssa El Ayeb, Louis Gervais, Melvin Berto Strouc, Fabrice Vallée, Thomas Moreau, Jérôme Cartailler

机构 * AP-HP(巴黎公立医院集团) Inserm(法国国家健康与医学研究院) Université Paris Cité(巴黎城市大学) Université Paris-Saclay(巴黎-萨克雷大学) Inria(法国国家信息与自动化研究所) CEA(法国原子能和替代能源委员会) Sorbonne Université(索邦大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出ReMAP自监督学习方法,基于EEG揭示大脑表征与脆弱性,可准确预测麻醉深度,其紧凑模型性能可媲美大规模EEG基础模型,还能关联临床结局与神经生理学特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21952 2026-08-25 cs.AI 新提交 57%

SSDi8: Accurate and Efficient 8-bit Quantization for State Space Duality

SSDi8:面向状态空间对偶的精准高效8比特量化方法

Hyunwoo Kim, Byoungchan Ko, Minseok Kang, Minwoo Kim, Dongjin Lee, Jaehoon Lee, Sungroh Yoon, Dahuin Jung

机构 * Chung-Ang University(中央大学) Soongsil University(崇实大学) Seoul National University(首尔大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI

AI总结 本研究针对结构化状态空间对偶(SSD)架构的内存与延迟开销问题,提出首个专为SSD设计的后训练量化框架SSDi8,通过解耦乘法、自适应量化等技术,在保持FP16精度的同时实现最高1.4倍加速,且适配资源受限环境。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21199 2026-08-24 cs.LG 新提交 57%

Tydra: An Efficient Hybrid Model for Tabular Data

Tydra:一种高效的表格数据混合模型

Mieszko Komisarczyk, Saurabh Mathur, Maurice Kraus, Sriraam Natarajan, Kristian Kersting

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出Tydra混合架构,平衡了表格基础模型的性能与效率,在30个OpenML数据集上较TabPFN提速30%,且优于规模大10倍的Hydra模型,为表格基础模型提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21134 2026-08-24 cs.CV cs.LG 新提交 57%

Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs

Llama-Mobile:视觉语言模型的高效2.7位量化

Luka Ribar, Jeevan Bhoot, Douglas Orr

机构 * Graphcore Research(Graphcore研究院) Arm(Arm公司)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 针对VLMs部署于移动设备的资源瓶颈,提出结合自生成训练数据的量化流水线与2.7位参数格式的框架,将Llama 3.2 11B Vision Instruct模型压缩至3.7 GB且保留视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20375 2026-08-24 cs.CL 新提交 57%

GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring

GRAFT:基于自适应DLM的草稿树构建与目标蒸馏边评分

Xuming Ye, Zeming Ma, Runjie Yu, Yuan Liu, Tianle Li, Shuhan Bai, Jian Zhou, Fei Wu

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 GRAFT 是用于基于 DLM 的推测解码的草稿树构建框架,通过 TDES 和 SABA 解决现有方法的父子兼容性与预算适配问题,实现了 2.13 倍至 6.36 倍的端到端加速,每轮开销不足 0.5 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20123 2026-08-21 stat.ML cs.LG 新提交 57%

Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo

基于嵌套序贯蒙特卡洛的离散扩散推理时控制

Lohithsai Yadala Chanchu, Hany Abdulsamad, Christian A. Naesseth

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对离散扩散语言模型文本生成的推理时控制问题,提出NSMC与FA-NSMC方法,修正了现有粒子方法的缺陷,在毒性和流畅度引导任务上表现优于n-best采样与bootstrap SMC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20026 2026-08-21 cs.CV cs.LG 新提交 57%

From Street View Imagery to Street Quality Indicators: Vision Language Inference for the Suburban 15-minute City

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

Joan Perez, Giovanni Fusco

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文以法国尼斯东北部郊区为研究对象,采用开源的SAGAI工作流,利用视觉语言模型从街景图像评估街景质量,发现理想街景仅存在于部分郊区区域,证明了VLM可支持郊区城市诊断,助力循证规划。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19891 2026-08-21 cs.AI 新提交 57%

EXIMO: VLM Guided Exploration of VLA Policies

EXIMO:基于视觉语言模型引导的视觉语言动作策略探索

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究提出EXIMO算法,通过VLM引导的探索、模仿、优化三阶段微调VLA策略,解决了VLA策略微调样本效率低的问题,性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 57%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18386 2026-08-20 cs.CV cs.AI 新提交 57%

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16837 2026-08-18 cs.RO cs.AI 新提交 57%

HAF: Adapting Generalist VLAs to Humanoid Whole-Body Loco-manipulation via Hierarchical Action Flow and Spectral Latent RL

HAF:通过分层动作流与谱潜在线性RL将通用VLAs适配至人形机器人全身运动操作

Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Nankai University(南开大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 研究针对通用VLAs难以适配人形机器人全身运动操作的问题,提出HAF框架,通过分层动作流生成器与潜空间RL流水线实现高效迁移优化,在7项任务上性能优于单阶段VLA基线。

Comments Project page: https://grange007.github.io/HAF

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15972 2026-08-18 cs.CV cs.AI 新提交 57%

CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications

CM-MAE:面向视觉-无线应用的物理引导跨模态自监督学习框架

Yubo Zhang, Yiyao Liu

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出CM-MAE框架,通过软对比对齐损失等技术实现视觉-无线跨场景表征迁移,在DeepSense 6G数据集上提升了跨场景任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15580 2026-08-18 cs.AI cs.CV 新提交 57%

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

从通用到专用:基于冻结视觉语言模型(VLM)的内窥镜息肉报告上下文融合框架

Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究针对内窥镜息肉报告需求,提出一种不修改预训练权重的上下文融合框架,通过隐式指令与显式转换上下文对冻结通用VLM专用化,在2056张标注图像实验中实现最优性能且参数量仅为冻结VLM的0.006%。

详情

展开后加载摘要…

URL PDF HTML 收藏