arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-12 至 2026-02-12 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 41 篇

2602.10485 2026-02-12 cs.AI 89%

Abstraction Generation for Generalized Planning with Pretrained Large Language Models

基于预训练大语言模型的通用规划抽象生成

Zhenhe Cui, Huaxiang Xia, Hangjun Shen, Kailun Luo, Yong He, Wei Liang

机构 * Hunan University of Science and Technology(湖南科技大学) Dongguan University of Technology(东莞理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出利用预训练大语言模型生成通用规划的抽象,并通过自动化调试修正抽象,以提升规划效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06717 2026-02-12 cs.LG cs.AI 89%

Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models

通过在大型语言模型上积累知识来精通图神经网络设计

Jialiang Wang, Hanmo Liu, Shimin Di, Zhili Wang, Jiachuan Wang, Lei Chen, Xiaofang Zhou

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Southeast University(东南大学) HoHuawei Hong Kong Research Center (HKRC)(华为香港研究中心) University of Tsukuba(筑波大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 DesiGNN通过在大型语言模型上积累知识,提升图神经网络设计的自动化水平,实现高效精准的模型生成。

Comments Accepted at WSDM 2026. Title changed from "Computation-friendly graph neural network design by accumulating knowledge on large language models" to "Proficient Graph Neural Network Design by Accumulating Knowledge on Large Language Models"

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16814 2026-02-12 cs.LG cs.CL 88%

From Belief Entrenchment to Robust Reasoning in LLM Agents

从信念固化到LLM代理的稳健推理

Jihwan Oh, Minchan Jeong, Jongwoo Ko, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 DReaMAD通过引入多样化推理和动态辩论机制,有效缓解了LLM代理中的信念固化问题,提升了推理准确性与胜率。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10522 2026-02-12 cs.SE 88%

Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions

一致性与验证:在没有真实解决方案的情况下提升大型语言模型的测试生成质量

Hamed Taherkhani, Alireza DaghighFarsoodeh, Mohammad Chowdhury, Hung Viet Pham, Hadi Hemmati

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 ConVerTest通过自我一致性、验证链和双执行协议,在无需真实解决方案的情况下提升大型语言模型的测试生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14986 2026-02-12 cs.AI cs.CL 87%

Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models

隐式概率推理不反映大语言模型中的显式答案

Manuel Mondal, Ljiljana Dolamic, Gérôme Bovet, Philippe Cudré-Mauroux, Julien Audiffren

机构 * University of Fribourg, Switzerland(弗里堡大学) armasuisse S+T, Switzerland(armasuisse S+T)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大语言模型在显式概率推理中表现良好,但在隐式概率推理中预测与真实情况存在显著差异,且传统评估方法无法检测此类错误。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16376 2026-02-12 cs.CL 86%

Polymer-Agent: Large Language Model Agent for Polymer Design

聚合物代理:用于聚合物设计的大型语言模型代理

Vani Nigam, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Materials Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出基于LLM的聚合物代理,通过结构-性质预测和生成技术,助力实验室研究人员高效发现新型聚合物结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07695 2026-02-12 cs.AI cs.CL cs.IR cs.MM 86%

EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge

EventCast:基于LLM事件知识的电子商务混合需求预测

Congcong Hu, Yuang Shi, Fan Huang, Yang Xiang, Zhou Ye, Ming Jin, Shiyu Wang

机构 * ByteDance China(字节跳动中国) National University of Singapore(新加坡国立大学) Griffith University(格里菲斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EventCast通过整合LLM事件知识提升电子商务需求预测精度,实现86.9%和97.7%的MAE和MSE改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04683 2026-02-12 cs.SD 85%

UniAudio 2.0: A Unified Audio Language Model with Text-Aligned Factorized Audio Tokenization

UniAudio 2.0:一种具有文本对齐因子化音频标记化的统一音频语言模型

Dongchao Yang, Yuanyuan Wang, Dading Chong, Songxiang Liu, Xixin Wu, Helen Meng

机构 * The Chinese University of Hong Kong, China(香港中文大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);foundation model(abstract)

AI总结 UniAudio 2.0通过引入ReasoningCodec和统一自回归架构,实现了文本对齐的因子化音频标记化,提升了音频理解和生成性能,并在多种任务中展现了强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10684 2026-02-12 cs.HC 85%

Privacy Control in Conversational LLM Platforms: A Walkthrough Study

对话式大语言模型平台中的隐私控制:一项 walkthrough 研究

Zhuoyang Li, Yanlai Wu, Yao Li, Xinning Gui, Yuhan Luo

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究对话式大语言模型平台的数据控制机制,揭示用户数据生成与共享的复杂性,并为开发者和政策制定者提供隐私控制优化的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12365 2026-02-12 cs.CL cs.DB 84%

Advances in LLMs with Focus on Reasoning, Adaptability, Efficiency and Ethics

大语言模型的进展:聚焦推理、适应性、效率和伦理

Asifullah Khan, Muhammad Zaeem Khan, Aleesha Zainab, Saleha Jamshed, Sadia Ahmad, Kaynat Khatib, Faria Bibi, Abdul Rehman

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文综述了大语言模型在推理、适应性、效率和伦理方面的进展,探讨了关键技术和挑战,提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08554 2026-02-12 cs.LG stat.ML 83%

Improving Reasoning for Diffusion Language Models via Group Diffusion Policy Optimization

通过群体扩散策略优化提升扩散语言模型的推理能力

Kevin Rojas, Jiahe Lin, Kashif Rasul, Anderson Schneider, Yuriy Nevmyvaka, Molei Tao, Wei Deng

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Research, Morgan Stanley(摩根士丹利机器学习研究部)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出GDPO算法,通过减少ELBO估计的方差提升扩散语言模型的推理能力,实验证明其在多个基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10787 2026-02-12 cs.SE cs.AI cs.CR cs.IR 81%

VulReaD: Knowledge-Graph-guided Software Vulnerability Reasoning and Detection

VulReaD: 基于知识图谱的软件漏洞推理与检测

Samal Mukhtar, Yinghua Yao, Zhu Sun, Mustafa Mustafa, Yew Soon Ong, Youcheng Sun

机构 * The University of Manchester(曼彻斯特大学) Agency for Science, Technology and Research(科技研究局) Singapore University of Technology and Design(新加坡科技设计大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 VulReaD通过知识图谱引导的推理方法,在软件漏洞检测中实现CWE级别的分类,提升二元和多类检测性能,增强可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10210 2026-02-12 cs.LG 81%

How Much Reasoning Do Retrieval-Augmented Models Add beyond LLMs? A Benchmarking Framework for Multi-Hop Inference over Hybrid Knowledge

检索增强模型在大语言模型之上添加多少推理能力?一种用于混合知识多跳推理的基准评估框架

Junhong Lin, Bing Zhang, Song Wang, Ziyan Liu, Dan Gutfreund, Julian Shun, Yada Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) University of Central Florida(中央佛罗里达大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 HybridRAG-Bench通过混合知识和多跳推理评估框架,有效区分真实检索与参数回忆,为混合知识增强推理系统提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01304 2026-02-12 cs.AI cs.CL 81%

Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models

代理拼图交互学习:提升视觉感知与推理能力在视觉-语言模型中

Yu Zeng, Wenxuan Huang, Shiting Huang, Xikun Bao, Yukun Qi, Yiming Zhao, Qiuchen Wang, Lin Chen, Zehui Chen, Huaian Chen, Wanli Ouyang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 AGILE通过代理拼图交互学习提升视觉-语言模型的感知与推理能力,显著提高拼图任务性能并增强多模态模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21124 2026-02-12 cs.AI cs.CL 81%

Expanding Reasoning Potential in Foundation Model by Learning Diverse Chains of Thought Patterns

通过学习多样的思维链模式扩展基础模型的推理潜力

Xuemiao Zhang, Can Ren, Chengying Tu, Rongxiang Weng, Shuo Wang, Hongfei Yan, Jingang Wang, Xunliang Cai

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Meituan(美团) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过学习富含高价值推理模式的多样化数据,扩展基础模型的推理潜力,显著提升模型在数学推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23798 2026-02-12 cs.CL cs.AI cs.CV 81%

Unveiling the "Fairness Seesaw": Discovering and Mitigating Gender and Race Bias in Vision-Language Models

揭示'公平性之锯':在视觉-语言模型中发现并缓解性别和种族偏见

Jian Lan, Udo Schlegel, Tanveer Hannan, Gengyuan Zhang, Haokun Chen, Thomas Seidl

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RES-FAIR框架,通过调整隐藏状态缓解视觉-语言模型中的性别和种族偏见,提升响应公平性和置信度校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11057 2026-02-12 cs.LG 79%

Divide, Harmonize, Then Conquer It: Shooting Multi-Commodity Flow Problems with Multimodal Language Models

分割、调和、然后征服:利用多模态语言模型解决多商品流问题

Xinyu Yuan, Yan Qiao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学) Co-corresponding authors(共同通讯作者)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 Pram利用多模态语言模型解决多商品流问题,通过分解和调和子问题实现高效优化,性能接近线性规划求解器且运行时间显著降低。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10148 2026-02-12 cs.CR cs.AI 79%

Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks

多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型

Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) People’s Public Security University of China(中国人民公安大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出CrossTALK方法,通过跨模态纠缠攻击提升对视觉-语言模型的劫持效果,实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13444 2026-02-12 cs.CL cs.CV 79%

ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models

ChartMuseum: 测试大型视觉-语言模型的视觉推理能力

Liyan Tang, Grace Kim, Xinyu Zhao, Thom Lake, Wenxuan Ding, Fangcong Yin, Prasann Singhal, Manya Wadhwa, Zeyu Leo Liu, Zayne Sprague, Ramya Namuduri, Bodun Hu, Juan Diego Rodriguez, Puyuan Peng, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 ChartMuseum通过评估复杂视觉和文本推理能力,揭示了大型视觉-语言模型在视觉推理上的不足。

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10816 2026-02-12 cs.CL cs.AI 79%

Beyond Confidence: The Rhythms of Reasoning in Generative Models

超越置信度:生成模型推理的节奏

Deyuan Liu, Zecheng Wang, Zhanyue Qin, Zhiying Tu, Dianhui Chu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出δ_TC B度量标准,用于评估生成模型在预测稳定性方面的鲁棒性,揭示了传统度量在上下文学习中的不足,并为提升模型稳定性提供新方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09447 2026-02-12 cs.SE cs.AI cs.CL 79%

SWE-AGI: Benchmarking Specification-Driven Software Construction with MoonBit in the Era of Autonomous Agents

SWE-AGI:在自主代理时代利用MoonBit进行规范驱动软件构建的基准测试

Zhirui Zhang, Hongbo Zhang, Haoxiang Fei, Zhiyuan Bao, Yubin Chen, Zhengyu Lei, Ziyue Liu, Yixuan Sun, Mingkun Xiao, Zihang Ye, Yu Zhang, Hongcheng Zhu, Yuxiang Wen, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SWE-AGI通过MoonBit评估LLM在规范驱动下的软件构建能力,揭示了AI辅助开发中代码阅读瓶颈及模型性能随任务难度变化的特性。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00036 2026-02-12 nlin.CG cs.AI cs.FL cs.NE 77%

LOGOS-CA: A Cellular Automaton Using Natural Language as State and Rule

LOGOS-CA: 一种使用自然语言作为状态和规则的细胞自动机

Keishu Utimula

机构 * Keishu Utimula(独立研究者)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LOGOS-CA利用自然语言作为细胞自动机的状态和规则,通过LLM实现更新,拓展了细胞自动机的模拟能力,用于森林火灾模拟和人工生命研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10494 2026-02-12 cs.CL 77%

Canvas-of-Thought: Grounding Reasoning via Mutable Structured States

Canvas-of-Thought:通过可变的结构化状态进行推理

Lingzhuang Sun, Yuxia Zhu, Ruitong Liu, Hao Liang, Zheng Sun, Caijun Jia, Honghao He, Yuchen Wu, Siyuan Li, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) New York University(纽约大学) Westlake University(西湖大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10481 2026-02-12 cs.CR cs.AI cs.MA 77%

Protecting Context and Prompts: Deterministic Security for Non-Deterministic AI

保护上下文和提示:非确定性AI的确定性安全

Mohan Rajagopalan, Vinay Rao

机构 * MACAW Security, Inc.(MACAW安全公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出认证提示和上下文技术,通过加密验证和策略代数实现LLM的预防性安全,有效防止提示注入和上下文操纵攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10133 2026-02-12 cs.SE cs.AI 77%

AgentTrace: A Structured Logging Framework for Agent System Observability

AgentTrace: 一种面向智能体系统的结构化日志框架用于可观测性

Adam AlSayyad, Kelvin Yuxiang Huang, Richik Pal

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentTrace是一种面向智能体系统的结构化日志框架,旨在通过动态可观测性和遥测功能提升智能体的安全性和可追溯性。

Comments AAAI 2026 Workshop LaMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10399 2026-02-12 cs.RO 75%

LocoVLM: Grounding Vision and Language for Adapting Versatile Legged Locomotion Policies

LocoVLM:为适应多功能腿式运动策略而 grounding 视觉和语言

I Made Aswin Nahrendra, Seunghyun Lee, Dongkyu Lee, Hyun Myung

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程学院,韩国科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 LocoVLM通过整合高层常识推理和视觉语言模型,实现了基于指令的实时腿式运动策略适应,准确率达87%。

Comments Project page: https://locovlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16858 2026-02-12 cs.CL cs.AI 73%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11024 2026-02-12 cs.CV cs.AI 70%

Chain-of-Look Spatial Reasoning for Dense Surgical Instrument Counting

密集手术器械计数的链式观察空间推理

Rishikesh Bhyri, Brian R Quaranto, Philip J Seger, Kaity Tung, Brendan Fox, Gene Yang, Steven D. Schwaitzberg, Junsong Yuan, Nan Xi, Peter C W Kim

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Chain-of-Look框架,通过结构化视觉链提升密集手术器械计数的准确性,并引入邻近损失函数和SurgCount-HD数据集,实验证明其在复杂场景中的优越性能。

Comments Accepted to WACV 2026. This version includes additional authors who contributed during the rebuttal phase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02482 2026-02-12 cs.LG 70%

Expanding the Capabilities of Reinforcement Learning via Text Feedback

通过文本反馈扩展强化学习的能力

Yuda Song, Lili Chen, Fahim Tajwar, Remi Munos, Deepak Pathak, J. Andrew Bagnell, Aarti Singh, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 推理与问题求解 :LLM(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出通过文本反馈改进强化学习的方法,通过自我蒸馏和反馈建模在推理、数学和写作任务中超越基线性能。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 70%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏