arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11653 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11653 篇

2607.10797 2026-07-14 cs.CV 新提交 80%

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

用于从视频理解复杂装配动作的组合上下文微调视觉语言模型

Hao Zheng, Jinyi Huang, Tiantian Zheng, Xun Xu, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) The University of Auckland(奥克兰大学)

专题命中 指令微调 :language model(title,abstract);LLM(comments)

AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。

Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01050 2026-07-07 cs.CV 新提交 80%

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督

Dianyu Wang, Peirong Zhang, Xuyang Li, Xiaoxuan Liu, Lei Wang

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。

Comments 14 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02479 2026-07-03 cs.CV 新提交 80%

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

EAGLE-360: 360°环境中的具身主动全局到局部探索

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学) Central China Normal University(华中师范大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 80%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 80%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21495 2026-07-01 cs.LG cs.AI cs.CL 版本更新 80%

Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

通过操作草图和自监督学习推广表格数据中的数值推理

Hanjun Cho, Gahyun Yoo, Hanseong Kim, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TaNOS框架,通过操作草图和自监督学习提升表格数据中数值推理的泛化能力,实验显示其在FinQA数据集上表现优异,且在领域转移中鲁棒性更强。

Comments Accepted to TACL. This is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 80%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);post-training(abstract)

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23889 2026-06-24 cs.IR 新提交 80%

INSPIRE: Intent-aware Neural Sponsored Product Retrieval for E-commerce

INSPIRE:面向电子商务的意图感知神经赞助商品检索

Shasvat Desai, Hong Yao, Utkarsh Porwal, Kuang-chih Lee

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对电商搜索中用户意图与商品不匹配问题,提出INSPIRE框架,利用结构化意图信号(如品牌、口味、饮食限制)增强查询与赞助商品的匹配,通过弱监督意图学习和大模型蒸馏实现精准检索。

Comments Accepted to ACM SIGIR E-commerce Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交 80%

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23494 2026-06-23 cs.CV 新提交 80%

Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies

Brain-Adapter: 一种用于急性颅内病理综合3D CT诊断的双流视觉-语言MIL框架

Zhenyu Yi, Zhiyun Song, Yusong Sun, Zelin Liu, Manman Fei, Zhenhao Li, Jiaxuan Zhao, Xu Han, Lichi Zhang

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Brain-Adapter双流多实例学习框架,利用预训练2D生物医学视觉-语言模型和原始诊断报告,通过文本条件注意力和不确定性感知融合实现3D CT扫描的多标签分类,无需密集标注。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15963 2026-06-16 cs.DC cs.AI cs.CL cs.LG 新提交 80%

PreLort: Prefix-Nested LoRA for Federated Fine-Tuning under Rank Heterogeneity

PreLort: 面向秩异构联邦微调的前缀嵌套LoRA

Muhammad Waseem, Nurbek Tastan, Andrej Jovanovic, Nicholas D. Lane, Nils Lukas, Karthik Nandakumar, Samuel Horvath

机构 * MBZUAI, UAE University of Cambridge, UK(MBZUAI,阿联酋剑桥大学,英国) Flower Labs, UK(Flower Labs,英国) Michigan State University, USA(密歇根州立大学,美国)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦LoRA中异构秩导致的信息分布不均问题,提出PreLort方法,通过前缀层次化嵌套低秩结构、分段聚合规则和前缀嵌套训练策略,使低秩客户端受益于高秩客户端的丰富信息,在准确率和ROUGE-L上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14228 2026-06-15 cs.NI cs.DC 新提交 80%

Selective Field Transmission: Bandwidth Efficient Communication under Standardized Message Schemas

选择性字段传输:标准化消息模式下的带宽高效通信

David Philipp Klüner, David Murach, Stefan Kowalewski, Alexandru Kampmann

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出选择性字段传输(SFT)机制,通过动态适配传输内容至接收方实际需求,在保持标准接口不变的同时显著降低带宽消耗,且无额外延迟开销。

Comments 8 pages, 9 figures, IEEE ETFA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10279 2026-06-10 cs.AI cs.CL cs.LG 新提交 80%

Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction

使用合成理由数据进行监督微调损害真实世界疾病预测

Buxin Su, Bingxuan Li, Cheng Qian, Yiwei Wang, Jin Jin, Bingxin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00915 2026-06-02 physics.optics 80%

Autonomous agentic design for photonics

光子学的自主智能体设计

Prashanta Kharel, Amin Khavasi, Xinzhong Chen, Tyler W. Hughes

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于大型语言模型的自主智能体方法,通过自动设计循环(提出、模拟、评估、迭代)实现光子器件的高性能设计,并成功应用于无源、有源、射频及芯片布局四类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29287 2026-06-02 cs.IR cs.CV 80%

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote: 一种用于多模态表示和排序的统一嵌入模型

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

机构 * Xiaohongshu Beijing China(小红书北京中国) Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出UniNote统一嵌入模型,通过两阶段训练(对比SFT和强化学习)解决工业级Item-to-Item检索中全局表示与局部检索的平衡、解耦流水线效率及精度-延迟权衡问题,在小红书部署后显著提升检索质量和成本效率。

Comments Accepted by KDD Ads Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 80%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 80%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);preference optimization(abstract)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21668 2026-05-28 cs.CV 80%

Encoder-Free Human Motion Understanding via Structured Motion Descriptions

通过结构化运动描述实现无编码器的人体运动理解

Yao Zhang, Zhuchenyang Liu, Thomas Ploetz, Yu Xiao

机构 * Aalto University(阿alto大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出结构化运动描述(SMD),将关节位置序列转换为结构化自然语言描述,使大语言模型无需专用编码器即可直接进行运动推理,在运动问答和字幕生成任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03328 2026-05-28 cs.CR 80%

GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio

GuardReasoner-Omni:一种基于推理的多模态护栏,适用于文本、图像、视频和音频

Zhenhao Zhu, Yue Liu, Yanpei Guo, Wenjie Qu, Cancan Chen, Yufei He, Yibo Li, Yulin Chen, Tianyi Wu, Huiying Xu, Xinzhong Zhu, Jiaheng Zhang

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出GuardReasoner-Omni,一种基于推理的多模态护栏模型,通过两阶段训练(SFT和RL)在3B和7B参数规模上实现对文本、图像、视频和音频数据的有效审核,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25851 2026-05-26 cs.RO 80%

RePlan-Bot: Multi-Level Replanning for Embodied Instruction Following

RePlan-Bot:面向具身指令跟随的多级重规划

Xicheng Gong, Guozheng Sun, Peiran Xu, Yadong Mu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(summary_cn,abstract)

AI总结 提出RePlan-Bot,通过多级连续重规划(高层LLM审计器、常识引导搜索、轻量级ViT校正器)解决具身指令跟随中的长时规划和不可逆状态变化问题,在ALFRED基准上取得最佳性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24873 2026-05-26 cs.CL cs.AI cs.LG 80%

Towards a Universal Causal Reasoner

迈向通用因果推理器

Qirun Dai, Xiao Liu, Jiawei Zhang, Dylan Zhang, Hao Peng, Chenhao Tan

机构 * The University of Chicago(芝加哥大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出UniCo数据生成框架,覆盖Pearl因果阶梯的18种查询类型,将符号示例转化为代码和自然语言,通过监督微调显著提升LLM的因果推理能力和推理忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15606 2026-05-22 cs.AR 80%

Spec2Cov: An Agentic Framework for Code Coverage Closure of Digital Hardware Designs

Spec2Cov: 一种用于数字硬件设计代码覆盖率闭合的代理框架

Sean Lowe, Elias Hilaneh, Alma Babbit, Nakul Gopalan, Vidya Chhabria, Aman Arora

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于代理框架的代码覆盖率闭合方法,利用大型语言模型和硬件仿真器的协同工作,自动迭代生成测试刺激以加速覆盖率闭合,并在不同复杂度的设计上实现了高达49%的覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11499 2026-05-21 cs.CV 80%

What if Agents Could Imagine? Reinforcing Open-Vocabulary HOI Comprehension through Generation

如果智能体能够想象?通过生成强化开放词汇人-物交互理解

Zhenlong Yuan, Yue Wang, Dapeng Zhang, Kejin Cui, Rui Chen, Jing Tang, Lei Sun, Hongwei Yu, Chengxuan Qian, Xiangxiang Chu, Shuo Li, Yuyin Zhou

机构 * Dream-X Team(Dream-X团队) Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究者) Case Western Reserve University(凯斯西储大学) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ImagineAgent框架,通过生成式世界建模和工具增强强化学习,解决开放词汇人-物交互理解中的跨模态幻觉和视角限制问题,实现了高效且鲁棒的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11519 2026-05-13 cs.AI cs.CL cs.LG 80%

Controllable User Simulation

可控用户模拟

Guy Tennenholtz, Ofer Meshi, Amir Globerson, Uri Shalit, Jihwan Jeong, Craig Boutilier

机构 * Google Research(谷歌研究) Tel Aviv University(特拉维夫大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将可控模拟视为因果推断问题,通过改进模拟器训练方法消除 lookahead 偏差,实现更稳定的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10903 2026-05-12 cs.CV cs.RO 80%

CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models

CapVector:在参数空间中学习可转移的能力向量用于视觉-语言-动作模型

Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 本文提出一种方法,通过在参数空间中解耦辅助目标SFT的两个目标,提升通用能力与任务特定动作分布拟合,从而在减少计算开销的同时提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11258 2026-05-12 cs.LG cs.AI cs.CL 80%

Knowledge is Not Enough: Injecting RL Skills for Continual Adaptation

知识不足:注入强化学习技能以实现持续适应

Pingzhi Tang, Yiding Wang, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 80%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18731 2026-05-01 cs.CL cs.AI cs.LG 80%

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

通过可验证准确性和回避奖励的课程强化学习缓解多轮对话中的迷失问题

Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLAAR框架,通过可验证准确性和回避奖励的课程强化学习,减少多轮对话中因提前回答导致的性能下降,提升模型可靠性。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11342 2026-04-29 astro-ph.SR 80%

Ultra-fast simulations of the solar dipole and open flux

超快太阳偶极子和开放磁通量模拟

Ismo Tähtinen, Timo Asikainen, Kalevi Mursula

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 本文提出一种结合经典SFT模型和偶极子向量表示的DFT方法,通过压缩传播矩阵显著加快太阳偶极子模拟,实现比传统SFT模型快数百至数万倍的计算速度,适用于研究太阳偶极子和开放磁通量的发展。

Comments 5 pages, 1 figure, Accepted for publication in A&A

Journal ref A&A 708, L21 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 80%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏