arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-16 至 2026-02-16 共收录 164 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 19 篇

2602.12461 2026-02-16 cs.CV 50%

Semantic-aware Adversarial Fine-tuning for CLIP

语义感知对抗微调用于CLIP

Jiacheng Zhang, Jinhao Li, Hanxun Huang, Sarah M. Erfani, Benjamin I. P. Rubinstein, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出语义感知对抗微调方法,通过生成语义感知的对抗性示例提升CLIP模型在零样本分类任务中的对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21370 2026-02-16 cs.RO cs.CV 50%

Language-in-the-Loop Culvert Inspection on the Erie Canal

Erie运河的循环检测

Yash Turkar, Yashom Dighe, Karthik Dantu

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 指令微调 :language model(abstract)

AI总结 VISION通过结合视觉-语言模型和受限视角规划,实现Erie运河涵洞的自主检测,生成高分辨率图像并提升专家评估一致性。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 3 篇

2602.13035 2026-02-16 cs.LG cs.AI cs.CL 87%

Look Inward to Explore Outward: Learning Temperature Policy from LLM Internal States via Hierarchical RL

向内看,向外探:通过分层强化学习从LLM内部状态学习温度策略

Yixiao Zhou, Yang Li, Dongzhou Cheng, Hehe Fan, Yu Cheng

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Introspective LLM通过分层强化学习从LLM内部状态学习温度策略,提升数学推理任务中的探索效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13055 2026-02-16 cs.CV cs.AI cs.LG 84%

Curriculum-DPO++: Direct Preference Optimization via Data and Model Curricula for Text-to-Image Generation

Curriculum-DPO++: 通过数据和模型课程直接优化偏好用于文本到图像生成

Florinel-Alin Croitoru, Vlad Hondru, Radu Tudor Ionescu, Nicu Sebe, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) University of Trento(特伦托大学) Center for Research in Computer Vision (CRCV), University of Central Florida(中央佛罗里达大学计算机视觉研究中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 Curriculum-DPO++通过数据和模型课程增强直接偏好优化,提升文本到图像生成的性能。

Comments arXiv admin note: substantial text overlap with arXiv:2405.13637

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 79%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 5 篇

2503.03704 2026-02-16 cs.LG 85%

Memory Injection Attacks on LLM Agents via Query-Only Interaction

通过仅查询交互对LLM代理进行内存注入攻击

Shen Dong, Shaochen Xu, Pengfei He, Yige Li, Jiliang Tang, Tianming Liu, Hui Liu, Zhen Xiang

机构 * Michigan State University(密歇根州立大学) University of Georgia(佐治亚大学) Singapore Management University(新加坡管理大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MINJA攻击,通过仅查询交互向LLM代理注入恶意记录,破坏其内存安全,揭示了代理内存安全的潜在风险。

Comments Code released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12235 2026-02-16 cs.CL 77%

Detecting Overflow in Compressed Token Representations for Retrieval-Augmented Generation

检测压缩标记表示中的溢出以用于检索增强生成

Julia Belikova, Danila Rozhevskii, Dennis Svirin, Konstantin Polev, Alexander Panchenko

机构 * Skoltech(斯克利切夫斯基技术学院) Sber AI Lab(Sber AI实验室) AIRI Institute for Information Transmission Problems of the Russian Academy of Sciences(俄罗斯科学院信息传输问题研究所)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种检测压缩标记表示中溢出的方法,通过轻量级探测分类器在多个数据集上实现了较高的检测性能,提升了检索增强生成任务的可靠性。

Comments Accepted to EACL 2026 Student Research Workshop. 14 pages, 6 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10915 2026-02-16 cs.CR cs.AI 70%

Blind Gods and Broken Screens: Architecting a Secure, Intent-Centric Mobile Agent Operating System

无目神祇与破碎屏幕:构建一个安全的、以意图为中心的移动代理操作系统

Zhenhua Zou, Sheng Guo, Qiuyang Zhan, Lepeng Zhao, Shuo Li, Qi Li, Ke Xu, Mingwei Xu, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Aura架构,通过结构化交互模型和四项防御支柱,提升移动代理系统的安全性与效率。

Comments 35 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19561 2026-02-16 cs.LG 57%

Harnessing intuitive local evolution rules for physical learning

利用直观的局部演化规则进行物理学习

Roie Ezraty, Menachem Stern, Shmuel M. Rubinstein

机构 * Racah Institute of Physics(拉卡学院物理研究所) Hebrew University of Jerusalem(耶路撒冷希伯来大学) AMOLF

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.LG

AI总结 BEASTAL通过直观的局部演化规则实现物理学习,无需复杂架构,可高效完成线性及非线性任务。

Comments 26 pages, 6 figures (with appendices). Submitted to Physical Review E

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16348 2026-02-16 cs.CL 57%

Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization

具身智能体与个性化:通过记忆利用的视角探讨挑战与解决方案

Taeyoon Kwon, Dongwook Choi, Hyojun Kim, Sunghwan Kim, Seungjun Moon, Beong-woo Kwak, Kuan-Hao Huang, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Department of Computer Science and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 本文提出MEMENTO框架,通过分析记忆利用中的挑战,设计了基于层次知识图谱的用户档案记忆模块,提升智能体在个性化任务中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 28 篇

2602.12574 2026-02-16 cs.DB cs.AI 89%

Monte Carlo Tree Search with Reasoning Path Refinement for Small Language Models in Conversational Text-to-NoSQL

具有推理路径细化的蒙特卡洛树搜索用于对话文本到NoSQL

Xubang Xiong, Raymond Chi-Wing Wong, Yuanfeng Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出Stage-MCTS框架,通过蒙特卡洛树搜索和推理路径细化,提升小型语言模型在对话文本到NoSQL任务中的查询生成能力,实验显示其EVM准确性提升达7.93%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12846 2026-02-16 cs.LG cs.AI 88%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12889 2026-02-16 cs.CL 88%

BaziQA-Benchmark: Evaluating Symbolic and Temporally Compositional Reasoning in Large Language Models

BaziQA-Benchmark:评估大语言模型中的符号性和时间组合推理

Jiangxi Chen, Qian Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 BaziQA-Benchmark通过结构化推理协议评估大语言模型在符号性和时间组合推理中的表现,揭示其在时间难度和推理顺序上的敏感性及系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19135 2026-02-16 cs.AI 88%

Understanding Chain-of-Thought in Large Language Models via Topological Data Analysis

通过拓扑数据分析理解大语言模型中的推理链

Chenghao Li, Chaoning Zhang, Yi Lu, Shuxu Chen, Xudong Wang, Jiaquan Zhang, Zhicheng Wang, Zhengxun Jin, Kuien Liu, Sung-Ho Bae, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * UESTC CNU KHU CAS Tongji Univ(同济大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过拓扑数据分析评估大语言模型推理链的结构复杂性,揭示其与准确性的正相关关系,为优化推理过程提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05004 2026-02-16 cs.LG cs.AI cs.CL 87%

R-Zero: Self-Evolving Reasoning LLM from Zero Data

R-Zero:从零数据自演化推理大语言模型

Chengsong Huang, Wenhao Yu, Xiaoyang Wang, Hongming Zhang, Zongxia Li, Ruosen Li, Jiaxin Huang, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland, College Park(马里兰大学科廷分校) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 R-Zero通过自动生成训练数据,实现无需人工干预的自演化推理大语言模型,显著提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 86%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10246 2026-02-16 cs.DC cs.AI 85%

KORAL: Knowledge Graph Guided LLM Reasoning for SSD Operational Analysis

KORAL: 基于知识图谱的LLM推理用于SSD运维分析

Mayur Akewar, Sandeep Madireddy, Dongsheng Luo, Janki Bhimani

机构 * Florida International University, Miami, FL, USA(佛罗里达国际大学) Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KORAL结合LLM和知识图谱,实现SSD的端到端推理分析,提供专家级诊断和可解释的运维建议。

Journal ref Proc. IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20577 2026-02-16 cs.RO 85%

MeCo: Enhancing LLM-Empowered Multi-Robot Collaboration via Similar Task Memoization

MeCo:通过相似任务记忆增强基于大语言模型的多机器人协作

Baiqing Wang, Helei Cui, Bo Zhang, Xiaolong Zheng, Bin Guo, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MeCo通过引入相似任务记忆化机制,有效提升多机器人协作的效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02995 2026-02-16 cs.SD 85%

AudioToolAgent: An Agentic Framework for Audio-Language Models

AudioToolAgent: 一种用于音频-语言模型的代理框架

Gijs Wijngaard, Elia Formisano, Michel Dumontier, Jenia Jitsev

机构 * Maastricht University(马斯特里赫特大学) LAION Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(尤利希超级计算中心(JSC),尤利希研究中心(FZJ))

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 AudioToolAgent通过中央LLM代理协调音频-语言模型作为工具,提升音频理解任务的多步骤推理和工具调用能力,实验结果显示在多个基准测试中达到最先进的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25889 2026-02-16 cs.CV cs.CL 83%

Multimodal LLM With Hierarchical Mixture-of-Experts for VQA on 3D Brain MRI

多模态大语言模型与分层混合专家用于3D脑部MRI的视觉问答

Arvind Murari Vepa, Yannan Yu, Jingru Gan, Anthony Cuturrufo, Michael F. Romano, Weikai Li, Fabien Scalzo, Wei Wang, Yizhou Sun

机构 * UCLA Computer Science(UCLA计算机科学系) UCSF Radiology(UCSF放射学) UCLA Medicine(UCLA医学)

专题命中 推理与问题求解 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究提出了一种多模态大语言模型mpLLM,用于3D脑部MRI的视觉问答,通过分层混合专家架构提升肿瘤描述的临床可解释性,并在多个数据集上优于现有基线模型。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19852 2026-02-16 cs.SD cs.AI 79%

Eliminating stability hallucinations in llm-based tts models via attention guidance

通过注意力引导消除基于大语言模型的TTS模型中的稳定性幻觉

ShiMing Wang, ZhiHao Du, Yang Xiang, TianYu Zhao, Han Zhao, Qian Chen, XianGang Li, HanJie Guo, ZhenHua Ling

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过改进注意力机制,减少基于大语言模型的TTS模型中的稳定性幻觉,提升语音合成的稳定性和连续性。

Comments The authors are withdrawing this preprint as it was submitted prematurely without the final approval of all collaborating institutions. We apologize for any inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 79%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(title);LLM(abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12422 2026-02-16 cs.AR cs.AI cs.LG 79%

CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement

CacheMind: 从缺失率到原因 -- 基于自然语言和跟踪数据的缓存替换推理

Kaushal Mhapsekar, Azam Ghanbari, Bita Aslrousta, Samira Mirbagher-Ajorpaz

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CacheMind通过自然语言和跟踪数据推理提升缓存替换性能,实现高准确率和实际应用效果。

Comments 16 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 77%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13444 2026-02-16 cs.HC 75%

DuetUI: A Bidirectional Context Loop for Human-Agent Co-Generation of Task-Oriented Interfaces

DuetUI: 人机协同生成面向任务的界面的双向上下文循环

Yuan Xu, Shaowen Xiang, Yizhi Song, Ruoting Sun, Xin Tong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DuetUI通过双向上下文循环实现人机协同生成面向任务的界面,提升任务效率和界面可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 75%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00020 2026-02-16 cs.CY cs.AI 74%

Beyond Static Question Banks: Dynamic Knowledge Expansion via LLM-Automated Graph Construction and Adaptive Generation

超越静态问题库:通过LLM自动图构建与自适应生成实现动态知识扩展

Yingquan Wang, Tianyu Wei, Qinsi Li, Li Zeng

机构 * Dalian University of Technology(大连理工大学) Chengdu Technological University(成都理工大学) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 本文提出生成式图RAG框架,通过自动图构建和自适应生成,实现动态知识扩展,提升个性化教育系统的适应性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12287 2026-02-16 cs.CL cs.AI eess.AS 73%

Retrieval-Augmented Self-Taught Reasoning Model with Adaptive Chain-of-Thought for ASR Named Entity Correction

带有自适应思维链的检索增强自教推理模型用于ASR命名实体修正

Junjie An, Jingguang Tian, Tianyi Wang, Yu Gao, Xiaofeng Mou, Yi Xu

机构 * AI Research Institute, Midea Group (Shanghai) Co.,Ltd., China(美的集团(上海)研究院) Zhejiang University, China(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强自教推理模型,用于改进ASR中命名实体修正,通过自适应思维链和音节级编辑距离提升纠错效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16198 2026-02-16 cs.CL cs.AI cs.SE 73%

RPG: A Repository Planning Graph for Unified and Scalable Codebase Generation

RPG:一个用于统一和可扩展代码库生成的仓库规划图

Jane Luo, Xin Zhang, Steven Liu, Jie Wu, Jianfeng Liu, Yiming Huang, Yangyu Huang, Chengyu Yin, Ying Xin, Yuefeng Zhan, Hao Sun, Qi Chen, Scarlett Li, Mao Yang

机构 * Microsoft(微软公司) Tsinghua University(清华大学) University of California, San Diego(加州大学圣地亚哥分校) Beijing Jiaotong University(北京交通大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RPG通过统一的图结构提升代码库生成效率,ZeroRepo在真实项目基准上实现显著更高的代码生成量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12395 2026-02-16 cs.CV cs.AI 70%

What does RL improve for Visual Reasoning? A Frankenstein-Style Analysis

强化学习在视觉推理中提升了什么?一种弗兰肯斯坦式分析

Xirui Li, Ming Li, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文通过弗兰肯斯坦式分析框架,揭示强化学习在视觉推理中通过中到晚期变压器计算的系统性细化,改进了视觉到推理的对齐和推理性能,而非单纯的视觉感知增强。

详情

展开后加载摘要…

URL PDF HTML 收藏