arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 973 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 973 篇

2607.07023 2026-07-09 cs.LG 新提交 77%

Online Data Selection Is Implicit Alignment

在线数据选择即隐式对齐

Aoxiong Zeng, Yuxin Yang, Xiangquan Yang

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.LG

AI总结 研究将在线数据选择视为隐式对齐机制,给定相同条件比较多种在线选择器在无偏好优化时引起的行为漂移,提出评估和量化方法,引入ADA和AAS,可在保持数据效率时限制安全和风格轴漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00572 2026-07-09 cs.AI cs.CR 新提交 77%

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04619 2026-07-07 cs.SD cs.CL 新提交 77%

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

CARD:用于无编码器音频字幕的跨组件音频表示蒸馏

Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis, Ravi Shekhar

机构 * School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院) Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出无编码器音频字幕模型CARD,去除推理时的编码器,用含合并LoRA适配器的投影仪给冻结的语言模型供能。通过跨组件蒸馏预训练音频教师模型,提升了CIDEr-D指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02010 2026-07-03 cs.AI 新提交 77%

InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应

Qianyu Chen, Ziteng Feng, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交 77%

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28249 2026-06-29 eess.AS cs.CL cs.SD 新提交 77%

HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech

HPRO:通过偏好提取的分层渐进奖励优化用于情感文本到语音

Sihang Nie, Xiaofen Xing, Rui Xing, Haoming Li, Ruitong Xiao, Jingyuan Xing, Baiji Liu, Xiangmin Xu

机构 * South China University of Technology, China(华南理工大学,中国) Huya Inc., China(欢丫公司,中国) Tongyi Fun Team, Alibaba Group, China(通义 Fun 团队,阿里巴巴集团,中国) Foshan University, China(佛山大学,中国)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出HPRO框架,通过HD-Emo编解码器分离内容与情感偏好,并分层对齐帧、词、句级别目标,解决信息冲突和尺度差距,提升情感表现力同时保持语言清晰度。

Comments 7 pages, 3 figures, 3 tables; Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28164 2026-06-29 cs.CV cs.LG 新提交 77%

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 提出EchoSonar-R,一种结合时空视频编码器和结构感知心脏检测器的多视图推理视觉语言模型,通过两阶段训练(监督微调+组相对策略优化)联合实现多标签疾病分类和报告生成,在私有数据集和公共基准上分别提升宏平衡准确率17.1%和6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27446 2026-06-29 cs.CL 新提交 77%

Causal Connections: Leveraging Multilingual Fine-Tuning for Financial QA@FinCausal 2026

因果联系:利用多语言微调进行金融问答@FinCausal 2026

Akash Kumar Gautam, Serhii Hamotskyi, Christian Hänig

机构 * Anhalt University of Applied Sciences(安哈尔特应用技术大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文通过对比编码器、编码器-解码器和仅解码器模型,发现监督微调效果最佳,GPT-4.1 Mini在英西双语微调后取得英语最高分和西班牙语第三名。

Journal ref Proceedings of the 7th Financial Narrative Processing Workshop (FNP 2026) at LREC 2026, pp. 132-138, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26578 2026-06-26 cs.AI 新提交 77%

EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling

EvoOptiGraph:基于图结构生成的弱点驱动协同进化优化建模

Qingcan Kang, Mingyang Liu, Xiaojin Fu, Shixiong Kai, Tao Zhong, Mingxuan Yuan

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 提出EvoOptiGraph框架,通过图结构表示混合整数线性规划并应用进化算子生成多样实例,结合监督微调和强化学习实现数据与模型的协同进化,显著提升优化建模的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 77%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23693 2026-06-24 cs.CL cs.IR 新提交 77%

EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL

EXPO-SQL:基于执行的子句级策略优化用于文本到SQL

Jaehoon Lee, CheolWon Na, Suyoung Bae, Jin-Seop Lee, Jihyung Lee, YunSeok Choi, Jee-Hyong Lee

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出EXPO-SQL方法,通过子句级奖励实现细粒度监督,解决现有强化学习在文本到SQL任务中粗粒度奖励导致学习信号不足的问题,显著提升性能。

Comments 20 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10610 2026-06-10 cs.CL 新提交 77%

Small Data, Big Noise: Adversarial Training for Robust Parameter-Efficient Fine-Tuning

小数据,大噪声:面向鲁棒参数高效微调的对抗训练

Eitan Cohen, Idan Simai, Uri Shaham

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.CL

AI总结 提出SDBN框架,将对抗训练与参数高效微调结合,通过离散不确定性集变体增强模型在低资源场景下的鲁棒性和泛化能力。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11047 2026-08-12 cs.AI cs.CE cs.LG 新提交 76%

V-FiLLM: Verified Financial LLM Reasoning Benchmark

V-FiLLM:经过验证的金融大语言模型推理基准

Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-Fantulin

机构 * ETH Zürich(苏黎世联邦理工学院) Aisot Technologies Ltd(艾索特科技有限公司)

专题命中 指令微调 :LLM(title);分类 cs.AI、cs.LG

AI总结 本文提出V-FiLLM框架生成高可靠性金融推理基准,发现开源模型在金融推理深度增加及数值扰动下准确率显著下降,轻量级LoRA微调可提升模型在相关任务的表现。

Comments 10 pages, 6 tables, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18283 2026-07-22 cs.LG cs.AI cs.CV 新提交 76%

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images

FedCC:用于胎儿超声图像中胼胝体稳健定位的基础模型低资源联邦适应

Alessandro Di Matteo, Sara Moccia, Giuseppe Rizzo, Gianpaolo Grisolia, Ricciarda Raffaelli, Lorenzo Vasciaveo, Francesco D'Antonio, Maria Chiara Fiorentino

机构 * unich(那不勒斯费德里克二世大学)

专题命中 指令微调 :foundation model(title);分类 cs.AI、cs.LG

AI总结 针对胎儿超声图像中胼胝体定位难题,提出FedCC框架,集成冻结的DINOv2主干与轻量级YOLO检测头,并引入LoRA模块。在多中心数据集上评估,该框架性能出色,减少了可训练参数与通信成本,迈向可临床部署的胎儿神经超声AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08404 2026-07-10 q-bio.QM cs.AI cs.LG 新提交 76%

DrugGen 2: A disease-aware language model for enhancing drug discovery

DrugGen 2:一种用于增强药物发现的疾病感知语言模型

Ali Motahharynia, Mohammadreza Ghaffarzadeh-Esfahani, Mahsa Sheikholeslami, Navid Mazrouei, Matin Irajpour, Yousof Gheisari, Hajar Sirous

机构 * Regenerative Medicine Research Center(再生医学研究中心) Isfahan University of Medical Sciences(伊斯法罕医科大学) Isfahan Neuroscience Research Center(伊斯法罕神经科学研究中心) School of Pharmacy(药学院) Department of Medicinal Chemistry(药理化学系) Cardiovascular Research Institute(心血管研究学院) Department of Genetics and Molecular Biology(基因与分子生物学系) Bioinformatics Research Center(生物信息学研究中心)

专题命中 指令微调 :language model(title);分类 cs.AI、cs.LG

AI总结 研究针对当前药物设计计算方法忽视疾病背景的问题,提出DrugGen-2模型,通过微调预训练GPT-2模型,经监督微调与强化学习两步策略,依疾病和靶点设计小分子,在糖尿病肾病靶点评估中性能超基线模型,推动AI辅助药物发现。

Comments 15 pages, 2 figures, 1 table, and 4 supplementary files. To use the model, see https://github.com/alimotahharynia/DrugGen-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08456 2026-07-10 cs.CL cs.AI 新提交 76%

Two Axes of LLM Abstention: Answer Correctness and Question Answerability

大语言模型弃权的两个轴:答案正确性和问题可回答性

Benedikt J. Wagner

机构 * University of London(伦敦大学)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型弃权的两个轴,即答案正确性和问题可回答性。发现普通方法无法区分二者,通过对多个模型研究找到不同轴的特点及问题所在,提出校准策略,可提高答案质量,在不同规模下控制不可回答答案率和错误答案率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19000 2026-08-20 cs.CV 新提交 75%

Mise-en-Scène: Implicit Layout Emergence in Diffusion Transformers for Human-AI Design Co-Creation

场景布置(Mise-en-Scène):用于人机协同设计共创的扩散Transformer中隐式布局的涌现

Zipeng Xu, Ryan Murdock, Umberto Michieli

机构 * Canva Research(Canva研究院)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出Mise-en-Scène框架,通过微调扩散Transformer实现隐式布局涌现,结合匹配放置步骤保证素材保真度,在PrismLayersPlus基准上生成的设计感知质量显著优于现有方法。

Comments Best Paper Award at ECCV Human-AI Co-Creation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07051 2026-08-10 cs.CV 新提交 75%

YOLO-PEFT: Parameter-Efficient Fine-Tuning on YOLO Family

YOLO-PEFT:针对YOLO系列的参数高效微调

Xu Lin, WenJie Nie, Jinlong Peng, Weifu Fu, YueXiao Ma, Xiawu Zheng, Yong Liu

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 YOLO-PEFT是一种针对YOLO系列的结构感知参数高效微调框架,将适配器部署建模为约束规划问题,在VOC数据集上的实验显示其检测精度优于全微调,且能减少训练内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05783 2026-08-07 cs.LG cs.AI cs.CL 新提交 75%

GROM: Gradient-Free Rapid One-Shot Machine Unlearning

GROM:无梯度快速一次性机器遗忘

Paweł Batorski, Przemysław Spurek, Paul Swoboda

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GROM是一种无梯度快速一次性机器遗忘方法,通过闭式加性更新实现高效知识移除,在多数据集上取得最优遗忘-效用权衡,且能抵御低比特量化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 75%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23917 2026-07-28 cs.CV 新提交 75%

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

凝视到文本生成:超越人类注意力的分类解码

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

机构 * Stony Brook University(纽约州立大学石溪分校) Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。

Comments To appear in European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18718 2026-07-22 eess.AS 新提交 75%

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

DCASE 2026任务5总结:音频相关问答

Haolin He, Renhe Sun, Zheqi Dai, Xingjian Du, Chunyat Wu, Zining Liang, Zhengxi Liu, Jiahe Lei, Runbang Wang, Jiayi Zhou, Mingru Yang, Xiquan Li, Yun Chen, Xie Chen, Zhiyao Duan, Weiqiang Wang, Mark D. Plumbley, Jian Liu, Qiuqiang Kong

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DCASE 2026任务5聚焦音频相关问答,用音频依赖过滤管道构建评估集。比赛分两轨道,众多团队参与。成均馆大学团队取得较好成绩,还分析了常见构建模块、测试方法及各系统普遍遗漏的项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09438 2026-07-13 cs.CL cs.AI cs.LG 新提交 75%

Test-Time Scaling for Small VLMs on Multilingual Visual MCQ

多语言视觉多项选择题中小视觉语言模型的测试时缩放

Spiros Baxevanakis, Peng-Jian Yang

机构 * ImageCLEF Lab(图像CLEF实验室) University of Amsterdam(阿姆斯特丹大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究小型视觉语言模型在多语言视觉多项选择题中的测试时缩放,比较多种方法,发现运行条件重要,可解析性是关键,增加解码预算有帮助,复杂方法贡献小,最佳配置在测试集上表现出色,位居排行榜首位。

Comments 14 pages, 2 figures, accepted at ImageCLEF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09316 2026-07-13 cs.CL cs.AI cs.DL cs.IR cs.LG 新提交 75%

Automatic Thematic Indexing of Large Literary Corpora: A Machine Learning Approach to Voltaire's Complete Works

大型文学语料库的自动主题索引:一种适用于伏尔泰全集的机器学习方法

Miguel Arana-Catania, Gillian Pink, Glenn Roe

机构 * University of Oxford(牛津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文以伏尔泰全集子语料库为测试案例,将自动主题索引任务设为多标签分类问题,比较多种机器学习方法,最佳模型F1分数达0.67,还评估跨语料库泛化及分析模型行为,为大规模文学和历史语料库的结构化主题访问提供了启示。

Comments 22 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05114 2026-07-07 cs.LG cs.AI cs.CL 新提交 75%

Localized LoRA-MoE: Block-wise Low-Rank Experts With Adaptive Routing

局部化LoRA-MoE:具有自适应路由的逐块低秩专家模型

Babak Barazandeh, Subhabrata Majumdar, Vinay Prithyani, George Michailidis

机构 * Fortinet(Fortinet公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型等依赖参数高效微调方法的局限,提出融合局部空间分块与动态上下文条件路由的Localized LoRA-MoE框架,介绍两种架构范式并证明其能解决静态基线优化死锁问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04582 2026-07-07 cs.SE 新提交 75%

Finetuning Lightweight LLMs for Control Flow Graph Generation

用于控制流图生成的轻量级语言模型微调

Hanyu Zhang, Tomoji Kishi

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究用微调轻量级大语言模型生成控制流图,设计统一输出格式和特定任务微调提示,构建数据集,在六个模型上评估,结果表明微调后的轻量级模型在生成控制流图上效果良好,有跨语言泛化能力。

Comments Accept by The 38th International Conference on Software Engineering & Knowledge Engineering Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01181 2026-07-02 cs.LG cs.AI cs.CL 新提交 75%

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

以正确的方式正确:结合可验证奖励和人类演示的LM训练

Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas

机构 * MIT EECS(麻省理工学院电气工程与计算机科学系)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出对抗生成器-判别器框架,在可验证奖励基础上加入人类演示信号,同时优化任务准确性和非可验证属性,在代码修复、故事生成等任务中提升人类相似度并减少奖励黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30704 2026-07-01 cs.LG cs.AI cs.CL 新提交 75%

From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

从搜索到合成:训练大语言模型为零样本工作流生成器

Gan Luo, Zihan Qin, Bin Dong, Wotao Yin

机构 * School of Mathematics Science, Peking University(北京大学数学科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MetaFlow,将工作流生成视为元学习问题,通过两阶段训练(监督微调+强化学习)使模型能生成可泛化的任务级工作流,在问答、代码生成和数学推理任务上实现零样本泛化。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24740 2026-06-24 cs.CV 新提交 75%

BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming

BioMedVR: 面向生物医学视觉重编程的混淆感知提示专家混合模型

Jiaxiang Liu, Tianxiang Hu, Juwei Guan, Yujie Wu, Yusong Wang, Yao Mu, Zuozhu Liu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科技研究院) Zhejiang University(浙江大学) Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Science Tokyo(东京科学大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 提出BioMedVR框架,通过可学习的VR模块实现预训练VLM在生物医学图像上的少样本适应,利用混淆最小化机制和提示专家混合模型解决细粒度分类中的类间混淆问题,在18个数据集上验证了优越性能。

Comments Accepted at ECCV 2026. 19 pages, 6 figures. Project page: https://jxliu-ai.github.io/biomedvr-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23700 2026-06-24 cs.CL cs.AI cs.LG 新提交 75%

Self-Recognition Finetuning can Prevent and Reverse Emergent Misalignment

自我识别微调可以预防和逆转突现性失调

Arush Tagade, Shaoheng Zhou, Jiaxin Wen, Shi Feng

机构 * George Washington University(乔治·华盛顿大学) Google(谷歌) UC Berkeley(伯克利大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过自我生成文本识别微调作为角色定向干预,在GPT-4.1等模型上实验发现,该方法能有效预防和逆转突现性失调,且预防效果优于其他干预。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏