arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4556 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4556 篇

2604.23113 2026-04-28 cs.SI 85%

Reducing Detail Hallucinations in Long-Context Regulatory Understanding via Targeted Preference Optimization

通过定向偏好优化减少长上下文监管理解中的细节幻觉

Yang Liu, Bin Chong, Yuhan Lin, Chongyang Zhang, Hao Zheng, Ziyi Zhang, Jiayu Liang, Ran Ran, Qian Li, Kefu Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DetailDPO框架,通过定向偏好优化减少长上下文监管文档中的细节幻觉,实验显示在不同模型和上下文长度下,DetailDPO有效降低细节错误率,跨领域迁移表现良好。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13818 2026-04-23 cs.LG cs.AI cs.CL 85%

Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning

并非所有回放都有效:在大语言模型强化学习中的回放下采样

Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。

Comments 19 pages, 10 figures, TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16027 2026-04-20 cs.CL cs.AI cs.LG 85%

Where does output diversity collapse in post-training?

在微调后输出多样性为何会崩溃?

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras

机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL 85%

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08519 2026-03-10 cs.RO 85%

AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models

AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练

Xiaoquan Sun, Zetian Xu, Chen Cao, Zonghe Liu, Yihan Sun, Jingrui Pang, Ruijian Zhang, Zhen Yang, Kang Pang, Dingxin He, Mingqi Yuan, Jiayu Chen

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-03-06 cs.CV 85%

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01393 2026-03-05 cs.CE q-fin.PM 85%

Adaptive Alpha Weighting with PPO: Enhancing Prompt-Based LLM-Generated Alphas in Quant Trading

自适应Alpha加权与PPO:增强量化交易中基于提示的LLM生成Alpha

Qizhao Chen, Hiroaki Kawashima

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用PPO优化LLM生成的Alpha权重,以提升量化交易策略的风险调整后表现。

Comments This paper has been accepted by International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18991 2026-03-03 cs.CL cs.AI cs.LG 85%

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

逆强化学习与动态奖励缩放用于大语言模型对齐

Ruoxi Cheng, Haoxuan Ma, Weixin Wang, Ranjie Duan, Jiexi Liu, Xiaoshuang Jia, Simeng Qin, Xiaochun Cao, Yang Liu, Xiaojun Jia

机构 * Beijing Electronic Science and Technology Institute(北京电子科技学院) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) Duke University(杜克大学) BraneMatrix AI Renmin University of China(中国人民大学) Northeast University(东北大学) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DR-IRL通过动态奖励缩放和逆强化学习提升大语言模型的安全对齐性能,有效解决数据不平衡和静态奖励模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20150 2026-02-17 cs.IR 85%

Rank-GRPO: Training LLM-based Conversational Recommender Systems with Reinforcement Learning

Rank-GRPO: 基于强化学习训练基于大语言模型的对话推荐系统

Yaochen Zhu, Harald Steck, Dawen Liang, Yinhan He, Vito Ostuni, Jundong Li, Nathan Kallus

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Rank-GRPO通过两阶段框架提升LLM对话推荐系统的训练效果,解决排名质量下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02341 2026-02-03 cs.CV 85%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22385 2026-02-02 cs.CL cs.AI cs.LG 85%

SP^2DPO: An LLM-assisted Semantic Per-Pair DPO Generalization

SP^2DPO: 一种基于大语言模型的语义逐对DPO泛化

Chaoyue He, Xin Zhou, Di Wang, Hong Xu, Wei Liu, Chunyan Miao

机构 * Alibaba--NTU Global e-Sustainability CorpLab (ANGEL), Singapore(阿里-NTU全球可持续性公司实验室(ANGEL),新加坡) Alibaba Group, China(阿里集团,中国)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SP^2DPO通过语义逐对DPO泛化提升AlpacaEval 2.0的长度控制胜率,避免每模型beta扫描。

Comments 39 pages, 15 figures, 16 tables, 60 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07981 2026-01-28 cs.CL cs.AI cs.LG stat.ML 85%

Why is Your Language Model a Poor Implicit Reward Model?

为什么你的语言模型是一个差的隐式奖励模型?

Noam Razin, Yong Lin, Jiarui Yao, Sanjeev Arora

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现隐式奖励模型(IM-RM)在泛化能力上劣于显式奖励模型(EX-RM),因其更依赖表面token级线索,而设计选择对模型泛化行为有显著影响。

Comments Accepted to ICLR 2026; Code available at https://github.com/princeton-pli/exrm-vs-imrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16356 2026-01-26 cs.HC 85%

The Behavioral Fabric of LLM-Powered GUI Agents: Human Values and Interaction Outcomes

LLM驱动的GUI代理的行为织体:人类价值观与交互结果

Simret Araya Gebreegziabher, Yukun Yang, Charles Chiang, Hojun Yoo, Chaoran Chen, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Diego Gómez-Zará, Toby Jia-Jun Li

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM驱动的GUI代理中人类价值观如何影响其行为和交互结果,提出了一种开源测试平台和实证分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09992 2026-01-16 eess.SP 85%

Towards Native Intelligence: 6G-LLM Trained with Reinforcement Learning from NDT Feedback

迈向原生智能:通过NDT反馈强化学习训练的6G-LLM

Zhuoran Xiao, Tao Tao, Chenhui Ye, Yunbo Hu, Yijia Feng, Tianyu Jiao, Liyu Cai

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过NDT反馈强化学习训练6G-LLM,以提升网络调度精度和解决方案最优性。

Comments The paper has been accepted IEEE WCNC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07723 2026-01-07 cs.AI cs.CL cs.LG 85%

Stable Preference Optimization: A Bilevel Approach to Catastrophic Preference Shift

稳定偏好优化:一种针对灾难性偏好转移的双层方法

Chengtao Jian, Kai Yang, Tianhao Gao, Wuguang Ni, Keying Yang, Bowen Xiao, Jiajun Liu, Ye Ouyang

机构 * Tongji University(同济大学) AsiaInfo Technologies(亚洲信息科技)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出稳定偏好优化框架,通过约束偏好学习在安全对齐区域,解决灾难性偏好转移问题,提升偏好学习方法的稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21828 2025-12-29 eess.AS 85%

Contextual Biasing for LLM-Based ASR with Hotword Retrieval and Reinforcement Learning

基于上下文偏置的LLM语音识别中的热点词检索与强化学习

YuXiang Kong, JunFeng Hou, Jian Tang, Bingqing Zhu, Jicheng Zhang, Shaofei Xue

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于热点词检索与强化学习的LLM语音识别框架,通过增强数据增强和模糊匹配提高热点词识别准确性,从而降低关键词错误率并保持整体转录准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18736 2025-12-25 cs.CV 85%

Rethinking Direct Preference Optimization in Diffusion Models

重新思考扩散模型中的直接偏好优化

Junyong Kang, Seohyun Lim, Kyungjune Baek, Hyunjung Shim

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种改进扩散模型偏好优化的方法,通过稳定参考模型更新和时间步感知训练策略,提升模型在人类偏好评估中的性能。

Comments Accepted by SPIGM@NeurIPS 2025 and AAAI-26 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13507 2025-12-24 cs.CV 85%

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Seedance 1.5 pro: 一种原生音频视频联合生成基础模型

Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Qide Dong, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Han Feng, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Tuyen Hoang, Ruoqing Hu, Xi Hu, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Donglei Ji, Siqi Jiang, Wei Jiang, Yunpu Jiang, Zhuo Jiang, Ashley Kim, Jianan Kong, Zhichao Lai, Shanshan Lao, Yichong Leng, Ai Li, Feiya Li, Gen Li, Huixia Li, JiaShi Li, Liang Li, Ming Li, Shanshan Li, Tao Li, Xian Li, Xiaojie Li, Xiaoyang Li, Xingxing Li, Yameng Li, Yifu Li, Yiying Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Zhiqiang Liang, Wang Liao, Yalin Liao, Heng Lin, Kengyu Lin, Shanchuan Lin, Xi Lin, Zhijie Lin, Feng Ling, Fangfang Liu, Gaohong Liu, Jiawei Liu, Jie Liu, Jihao Liu, Shouda Liu, Shu Liu, Sichao Liu, Songwei Liu, Xin Liu, Xue Liu, Yibo Liu, Zikun Liu, Zuxi Liu, Junlin Lyu, Lecheng Lyu, Qian Lyu, Han Mu, Xiaonan Nie, Jingzhe Ning, Xitong Pan, Yanghua Peng, Lianke Qin, Xueqiong Qu, Yuxi Ren, Kai Shen, Guang Shi, Lei Shi, Yan Song, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Yan Sun, Zeyu Sun, Wenjing Tang, Yaxue Tang, Zirui Tao, Feng Wang, Furui Wang, Jinran Wang, Junkai Wang, Ke Wang, Kexin Wang, Qingyi Wang, Rui Wang, Sen Wang, Shuai Wang, Tingru Wang, Weichen Wang, Xin Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Ziyu Wang, Guoqiang Wei, Wanru Wei, Di Wu, Guohong Wu, Hanjie Wu, Jian Wu, Jie Wu, Ruolan Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Liang Xiang, Fei Xiao, XueFeng Xiao, Pan Xie, Shuangyi Xie, Shuang Xu, Jinlan Xue, Shen Yan, Bangbang Yang, Ceyuan Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yang Yang, Yihang Yang, ZhiXian Yang, Ziyan Yang, Songting Yao, Yifan Yao, Zilyu Ye, Bowen Yu, Jian Yu, Chujie Yuan, Linxiao Yuan, Sichun Zeng, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Chuntao Zhang, Heng Zhang, Jingjie Zhang, Kuo Zhang, Liang Zhang, Liying Zhang, Manlin Zhang, Ting Zhang, Weida Zhang, Xiaohe Zhang, Xinyan Zhang, Yan Zhang, Yuan Zhang, Zixiang Zhang, Fengxuan Zhao, Huating Zhao, Yang Zhao, Hao Zheng, Jianbin Zheng, Xiaozheng Zheng, Yangyang Zheng, Yijie Zheng, Jiexin Zhou, Jiahui Zhu, Kuan Zhu, Shenhan Zhu, Wenjia Zhu, Benhui Zou, Feilong Zuo

专题命中 后训练与偏好优化 :foundation model(title);post-training(abstract);SFT(abstract);RLHF(abstract)

AI总结 Seedance 1.5 pro是一款专为原生音频视频联合生成设计的基础模型,通过双分支扩散变压器架构实现高质量生成,支持多语言唇形同步和动态摄像机控制,提升专业内容创作效率。

Comments Seedance 1.5 pro Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12036 2025-11-18 cs.CE cond-mat.mtrl-sci cs.AI cs.CL cs.LG 85%

Preference Learning from Physics-Based Feedback: Tuning Language Models to Design BCC/B2 Superalloys

Satanu Ghosh, Collin Holgate, Neal R. Brodnik, Doug Downey, Samantha Daly, Tresa M. Pollock, Samuel Carton

机构 * Department of Computer Science, University of New Hampshire(新罕布什尔大学计算机科学系) Materials Department, University of California, Santa Barbara(加州大学圣芭芭拉分校材料系) Department of Mechanical Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校机械工程系) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16927 2025-11-17 cs.CL cs.AI cs.LG 85%

Latent Principle Discovery for Language Model Self-Improvement

Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo

机构 * IBM Research AI(IBM人工智能研究)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07384 2025-11-11 cs.CL cs.AI cs.LG 85%

Teaching Pretrained Language Models to Think Deeper with Retrofitted Recurrence

Sean McLeish, Ang Li, John Kirchenbauer, Dayal Singh Kalra, Brian R. Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Jonas Geiping, Tom Goldstein, Micah Goldblum

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of North Carolina(北卡罗来纳大学) ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心) Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments code: https://github.com/mcleish7/retrofitting-recurrence, models: https://huggingface.co/collections/tomg-group-umd/retrofitting-recurrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10637 2025-10-28 cs.CL cs.AI cs.LG 85%

Better Estimation of the Kullback--Leibler Divergence Between Language Models

Afra Amini, Tim Vieira, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15020 2025-10-23 stat.ML cs.AI cs.CL cs.LG math.ST stat.TH 85%

The Coverage Principle: How Pre-Training Enables Post-Training

Fan Chen, Audrey Huang, Noah Golowich, Sadhika Malladi, Adam Block, Jordan T. Ash, Akshay Krishnamurthy, Dylan J. Foster

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03517 2025-10-13 cs.CV 85%

DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models

Ziyi Wu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Ashkan Mirzaei, Igor Gilitschenski, Sergey Tulyakov, Aliaksandr Siarohin

机构 * Snap Research University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract)

Comments NeurIPS 2025 Spotlight. Project page: https://snap-research.github.io/DenseDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23761 2025-10-03 cs.LG cs.AI cs.CL 85%

Differential Information Distribution: A Bayesian Perspective on Direct Preference Optimization

Yunjae Won, Hyunji Lee, Hyeonbin Hwang, Minjoon Seo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint, under review. 39 pages, 12 figures. Updates from v1: Added new theoretical results on DPO training dynamics and policy exploration, included experiments with Qwen3-4B, and refined the discussion of log-margin dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25190 2025-09-30 cs.CV 85%

Visual Jigsaw Post-Training Improves MLLMs

Penghao Wu, Yushan Zhang, Haiwen Diao, Bo Li, Lewei Lu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Linköping University(_linköping大学) SenseTime Research(商汤科技研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16560 2025-09-23 cs.CV 85%

Captioning for Text-Video Retrieval via Dual-Group Direct Preference Optimization

Ji Soo Lee, Byungoh Ko, Jaewon Cho, Howoong Lee, Jaewoon Byun, Hyunwoo J. Kim

机构 * Korea University(韩国大学) Hanwha Vision(翰威英航) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13919 2025-09-03 cs.CV cs.AI cs.CL cs.LG cs.RO 85%

Temporal Preference Optimization for Long-Form Video Understanding

Rui Li, Xiaohan Wang, Yuhui Zhang, Orr Zohar, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12597 2025-09-03 cs.CR 85%

UAV Individual Identification via Distilled RF Fingerprints-Based LLM in ISAC Networks

Haolin Zheng, Ning Gao, Donghong Cai, Shi Jin, Michail Matthaiou

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00624 2025-08-12 cs.CV 85%

VideoSAVi: Self-Aligned Video Language Models without Human Supervision

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);preference optimization(abstract)

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏