arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 973 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 973 篇

2608.01751 2026-08-04 cs.CV cs.AI 新提交 79%

SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation Models

SPECTRA:用于地理空间基础模型跨传感器微调的波段路由嵌入与分阶段LoRA

Xingyan Li, Jordan A. Caraballo-Vega, Jie Gong, Mark L. Carroll, Jianwu Wang

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出SPECTRA框架,通过波段路由嵌入(BRE)解决地理空间基础模型的光谱不匹配问题,利用分阶段可迁移性感知LoRA(ST-LoRA)降低微调成本,在多数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01290 2026-08-04 cs.LG cs.DC 新提交 79%

FedChronos: Federated Fine-Tuning of Time-Series Foundation Models for Privacy-Preserving Commodity Price Forecasting

FedChronos:用于隐私保护商品价格预测的时间序列基础模型联邦微调

Amit Sharma, Nitin Auluck, Akramul Azim

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 FedChronos是用于时间序列基础模型联邦微调的框架,结合LoRA与差分隐私,在非IID商品价格联邦预测中实现隐私与准确性互补,适配边缘部署

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00622 2026-08-04 cs.CL 新提交 79%

A Heuristic Perspective on Debiasing Language Models

语言模型去偏的启发式视角

Tian Lan, Yemin Wang, Chuancheng Shi, Xiangyu Wu, Zesheng Shi, Yuan Wang, Jiang Li, Guanglai Gao, Xiangdong Su

机构 * Inner Mongolia University(内蒙古大学) Xiamen University(厦门大学) University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Zhejiang University(浙江大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对现有语言模型去偏方法的局限,提出HEIMAT启发式自动去偏框架,经实验验证其可在保留NLU性能的同时有效缓解不同文化下的模型偏见。

Comments 13 pages in total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25763 2026-07-29 cs.NI cs.LG 新提交 79%

WALoMA: A Multitask Wireless Foundation Model via Adaptive Low-Rank Masked Autoencoders

WALoMA:一种通过自适应低秩掩码自动编码器实现的多任务无线基础模型

Madi Makin, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对6G无线物理层架构中特定任务模型局限和标记数据稀缺问题,提出WALoMA模型,利用自适应低秩掩码自动编码器,通过自监督学习从无标签数据中学习可转移表示,在五个下游任务中表现出色,显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23394 2026-07-28 cs.AI 新提交 79%

Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning

用于减轻大语言模型微调中隐藏行为的推理时共识

Adhyyan Narang, Artin Tajdini, Claire Zhang, Jamie Morgenstern

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型微调中隐藏行为问题,通过从不同源收集多数据集并学习共性,在解码时聚合参考模型下一个token分布,引入两种共识解码器,有效抑制特定源不当行为,保留共享期望行为。

Comments 21 pages, 4 figures. Code: https://github.com/AdhyyanNarang/consensus-aggregation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22861 2026-07-28 cs.CV cs.AI 新提交 79%

Robustifying pathology foundation models via fine-tuning

通过微调增强病理学基础模型的鲁棒性

Alexandre Filiot, Oskar Thaeter, Benoit Schmauch, Lionel Guillou

机构 * Waiv Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理学研究所) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对病理学基础模型对采集因素敏感问题,开发新颖微调方法,应用于十个不同模型提升鲁棒性与下游性能,平均鲁棒性指数提高23%,综合性能提高43%,并公开两个模型的微调版本。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 79%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16635 2026-07-21 cs.CV cs.AI 新提交 79%

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale:融合多实例LoRA文本编码器和零样本大语言模型判断器用于视频中的矛盾/犹豫识别

Abdel-Karim Al-Tamimi, Ali Rodan

机构 * Sheffield Hallam University(谢菲尔德哈勒姆大学) Yarmouk University(亚尔穆克大学) The University of Jordan(约旦大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 TellTale旨在解决视频中矛盾/犹豫识别问题,它融合多实例LoRA文本编码器和零样本大语言模型判断器,结合三个概率流,在BAH数据集上取得优异成绩,相比官方基于视觉的基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16325 2026-07-21 cs.CV cs.LG 新提交 79%

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings

RegionFM:使用基础模型嵌入进行可解释的基于区域的脑MRI分类

Wei Zhang

机构 * L3S Research Center(L3S研究中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对脑MRI基础模型预测难解释问题,提出RegionFM框架,将解剖分割与基础模型嵌入结合,通过划分区域、编码嵌入及构建模型组合,用于认知障碍分类评估,在保持性能同时使解释与临床推理更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13013 2026-07-15 cs.AI cs.SD 新提交 79%

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

使用冻结离散扩散语言模型的音频原生语音识别

Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal

机构 * Interfaze AI(Interfaze人工智能公司)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 探讨离散扩散语言模型能否用于语音识别,训练音频原生接口,用冻结Whisper编码器等,约42M参数。自然训练目标遇问题,连接主义时间分类损失打破僵局,模型在LibriSpeech test-clean上字错误率6.6%,能并行转录多种语言。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10371 2026-07-14 eess.AS cs.CL 新提交 79%

GigaAM Multilingual: Foundation Model for Underrepresented Languages

GigaAM多语言:针对低资源语言的基础模型

Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.CL

AI总结 针对多语言ASR中长尾语言数据稀缺问题,提出GigaAM Multilingual,用Conformer编码器在大量音频上预训练,预训练时引入聚类级数据平衡策略,微调时采用领域感知采样方法,在目标语言上优于其他编码器,发布相关模型提供多语言适应方法。

Comments Accepted to Interspeech 2026. Model weights: https://github.com/salute-developers/GigaAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11706 2026-07-14 cs.SD cs.AI 新提交 79%

VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion

VoxENES 2026:针对大语言模型时代文本转语音和语音转换的语音欺骗检测泛化基准测试

Aastha Sharma, Guangjing Wang

机构 * University of South Florida(佛罗里达州立大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型时代TTS和VC系统合成语音与传统基准测试不匹配问题,引入VoxENES 2026基准测试,对八个预训练检测器测试发现性能大幅下降,凸显当前检测器问题,确立该基准为开发音频欺骗对策的实用平台。

Comments Accepted in InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07951 2026-07-10 cs.LG physics.ao-ph 新提交 79%

Evaluating the Generalizability of Foundation Models for Extreme Environmental Events: Case Study of California Wildfire PM2.5

评估极端环境事件基础模型的泛化能力:以加利福尼亚野火PM2.5为例

Yongcan Huang, Li Jiang, Ze Yu Liu

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院) Information System Department, UMBC(马里兰大学巴尔的摩郡分校信息系统系) College of Graduate and Professional Studies, Trine University(特瑞大学研究生与专业研究学院) School of Professional Studies, Columbia University(哥伦比亚大学专业研究学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究以加利福尼亚野火PM2.5为例,比较六种时间序列基础模型配置与全训练基线及朴素持久性方法,通过留一事件法评估泛化能力,发现BiLSTM表现最佳,零样本TSFMs改进有限,LoRA微调有改善但未超循环基线,挑战大预训练模型主导环境预测的假设并提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04919 2026-07-07 cs.LG 新提交 79%

When Do Foundation Models Pay Off? A Break-Even Analysis of Pretrained Time Series Forecasters

基础模型何时能取得成效?预训练时间序列预测器的盈亏平衡分析

Nicholas Tan Jerome, Frank Simon

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究何时投资时间序列基础模型能有回报,通过对比基础模型和传统基线在不同训练集规模下的表现,给出部署规则和决策框架,助从业者决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03094 2026-07-07 cs.LG 新提交 79%

Stacked LoRA for Subject-Adaptive EEG Foundation Models in Motor Imagery Decoding

用于运动想象解码中主题自适应脑电基础模型的堆叠式LoRA

Aymen Sarhane, Fouad Lbakali, Mouad Souissi, Jonathan Lys, Giulia Lioi

机构 * IMT Atlantique, Lab-STICC(法国布雷斯特的IMT大西洋学院,Lab-STICC实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 脑机接口的脑电图解码面临受试者间差异大的挑战。基于现有脑电基础模型,研究不同低秩适应策略对运动想象分类的影响,提出堆叠式LoRA框架,有效减轻受试者间差异,在多数组合中获最佳准确率。

Comments 10 pages, 1 figure, 2 tables. Accepted at the 2026 IEEE World Congress on Computational Intelligence (WCCI 2026), Maastricht, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02995 2026-07-07 cs.CV cs.AI 新提交 79%

VISTA: Auditing Semantic Divergence in Vision-Language Models

VISTA:视觉语言模型中的语义差异审计

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型中视觉概念条件性差异,提出VISTA黑箱跨模型审计方法,结合语义熵与基于分布的差异标记异常,通过实验验证其有效性并发现新差异模式。

Comments Preprint. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02140 2026-07-03 cs.LG 新提交 79%

Probing Chemical Language Models: Effects of Pre-training and Fine-tuning

探测化学语言模型:预训练与微调的影响

Anna Karnysheva, Dietrich Klakow, Ji-Ung Lee

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 通过探测78种分子子结构,系统研究了预训练和微调对化学语言模型分子结构感知能力的影响,发现预训练提升上层结构意识,微调增强任务相关子结构表征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01918 2026-07-03 cs.LG 新提交 79%

Zeus: Towards Tuning-Free Foundation Model for Time Series Analysis

Zeus:面向时间序列分析的无调优基础模型

Yisong Fu, Zezhi Shao, Chengqing Yu, Yujie Li, Yongjun Xu, Xueqi Cheng, Fei Wang

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出统一无调优时间序列基础模型Zeus,通过多尺度Transformer和Multi-Objective Temporal Masking策略,在无需任务特定调优下实现多种分析任务的优异性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00417 2026-07-02 cs.CV cs.AI 新提交 79%

EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

EO-VGGT:用于卫星多视角重建的轨道光线条件化3D基础模型

Qiyan Luo, Yingdong Pi, Lekang Wen, Jie Yang, Xiaoyu Wang, Haiming Zhang, Mi Wang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 针对卫星遥感中透视模型与轨道几何不匹配的问题,提出EO-VGGT框架,通过几何相关约束选择、传感器射线编码器和射线指向适配器,实现冻结视角驱动模型适应轨道观测,提升多视角卫星3D重建质量。

Comments This article is submitted to journal and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26432 2026-06-26 cs.LG econ.EM 新提交 79%

Embedding Foundation Model Predictions in Discrete-Choice Models with Structural Guarantees

具有结构保证的嵌入基础模型预测的离散选择模型

Yingshuo Wang, Xian Sun, Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * University of California, Berkeley(加州大学伯克利分校) Duke University(杜克大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出两阶段适配器,将基础模型的预测嵌入多项Logit效用中,通过符号约束保持边际替代率,在三个数据集上平均提升6.4个百分点准确率,并保证成本单调性和合理时间价值。

Comments Extends arXiv:2605.26559 (ICML 2026 FMSD Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17999 2026-06-23 cs.CL 新提交 79%

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :language model(title);instruction tuning(abstract);分类 cs.CL

AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。

Comments Minor related-work revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20225 2026-06-19 cs.CL 新提交 79%

Actionable Activation Directions for Detecting and Mitigating Emergent Misalignment Across Language Model Families

可操作的激活方向:检测和缓解跨语言模型家族的突发性对齐失调

Abdul Rafay Syed

机构 * Universität des Saarlandes(萨尔大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 通过差分均值方向在最终层实现99.6%的对齐/失调分离,因果干预将代码泄露降低21-51点;跨架构迁移虽有效但缺乏特异性,揭示了两层特异性结构。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18691 2026-06-18 cs.LG cond-mat.mtrl-sci 新提交 79%

Robust and Interpretable Adaptation of Equivariant Materials Foundation Models via Sparsity-promoting Fine-tuning

通过稀疏性促进微调实现等变材料基础模型的鲁棒和可解释适应

Youngwoo Cho, Seunghoon Yi, Wooil Yang, Sungmo Kang, Young-woo Son, Jaegul Choo, Joonseok Lee, Soo Kyung Kim, Hongkee Yoon

机构 * KAIST(韩国科学技术院) Seoul National Univ.(首尔国立大学) KIAS(韩国宇宙科学研究所) Ewha Womans Univ.(成均馆大学) Kangwon National Univ.(江原国立大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出稀疏性促进微调方法,利用E(3)等变材料基础模型的结构特性选择性更新参数,在能量和力预测任务中以约3%参数达到或超越全微调性能,并展示在磁矩预测等任务中的泛化性和可解释性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17175 2026-06-17 cs.CL 新提交 79%

Self-Generated Error Training for Token Editing in Diffusion Language Models

扩散语言模型中令牌编辑的自生成错误训练

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与技术学院) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :language model(title);pretraining(abstract);分类 cs.CL

AI总结 针对LLaDA2.1中令牌编辑的训练-推理不匹配问题,提出自生成T2T方法,通过无梯度草稿传递和自生成错误监督,提升编辑准确率并减少编辑强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14883 2026-06-16 cs.CV cs.LG 新提交 79%

Understanding Cross-Modal Contributions in Continual Vision-Language Models: A Theoretical Perspective

理解连续视觉-语言模型中的跨模态贡献:一个理论视角

Salimeh Sekeh, Mary Wisell

机构 * San Diego State University(圣地亚哥州立大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 本文从理论角度分析连续视觉-语言模型中跨模态(视觉-语言)贡献,提出新视角并通过实验验证其有效性,揭示任务顺序和相似性对贡献鲁棒性的影响,提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14507 2026-06-15 cs.AI 新提交 79%

Dense Coordinate-List Fine-Tuning Induces a Controllable Interference Surface in Vision-Language Models

密集坐标列表微调在视觉语言模型中诱导可控干扰面

Chenyu Zhou, Qiliang Jiang, Boguang Pan

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Graduate School of Information, Production and Systems, Waseda University(早稻田大学信息生产系统研究生院)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 研究密集坐标列表微调对视觉语言模型结构化输出(如重复、终止)的影响,发现其产生结构绑定且跨家族的干扰面,可通过目标信号分离和结构轴探针进行测量与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12218 2026-06-11 cs.CV cs.AI 新提交 79%

Adapting Prithvi-EO for Fallow Detection for Food-Water Nexus: ViT-Adapter Necks and Parameter-Efficient Backbone tuning of Geospatial Foundation Model

为食物-水关系调整Prithvi-EO用于休耕地检测:地理空间基础模型的ViT-Adapter颈部与参数高效骨干微调

Sk Muhammad Asif, Orhun Aydin

机构 * Earth, Atmospheric and Geospatial Science, Saint Louis University(圣路易斯大学地球、大气与地理空间科学系)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 针对休耕地检测中多尺度特征需求与基础模型单尺度ViT骨干不匹配的问题,提出结合LoRA和混合PEFT的两种参数高效微调方案与三种颈部设计,其中Lite ViT-Adapter配合单阶段检测头在mAP@50上达到0.9479,优于无适配器方法25.70%。

Comments 10 pages, 6 figures. Preprint. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10428 2026-06-10 cs.CL 新提交 79%

Which LoRA? An Empirical Study on the Effectiveness of LoRA Techniques During Multilingual Instruction Tuning

哪种LoRA?多语言指令微调中LoRA技术有效性的实证研究

Thamali Wijewardhana, Napoleon H. Reyes, Surangika Ranathunga

机构 * School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院)

专题命中 指令微调 :instruction tuning(title,abstract);分类 cs.CL

AI总结 通过实验比较基本LoRA与四种变体在多语言指令微调中的效果,发现复杂变体在平衡跨语言迁移与知识保留方面并无显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10277 2026-06-10 cs.LG 新提交 79%

A Unified Adaptive Feature Composition Framework for Multi-Task Generalization in Wireless Foundation Models

无线基础模型中多任务泛化的统一自适应特征组合框架

Yuxuan Shi, Tingting Yang, Kangning Ma, Liwen Jing, Yuwei Wang, Mengfan Zheng, Li Sun

机构 * Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Purple Mountain Laboratories(紫金山实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出RAFC路由适配器,通过轻量级任务驱动网络动态组合Transformer各层隐藏特征,实现无线基础模型的多任务泛化,仅增加少于50K参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09142 2026-06-09 cs.CV cs.AI 新提交 79%

Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models

通过视觉语言模型从自我中心视觉解码行人过街意图

Danya Li, Xiang Su, Yan Feng, Rico Krueger

机构 * Technical University of Denmark(丹麦技术大学) University of Helsinki(赫尔辛基大学) Delft University of Technology(代尔夫特理工大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 利用视觉语言模型(VLM)将行人过街意图预测转化为视觉问答任务,通过参数高效微调并结合自我运动、车辆运动和眼动等上下文线索,在自我中心视频上实现了14.5%的准确率提升,创下新纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏