arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2512.06201 2026-01-28 cs.LG 79%

K2-V2: A 360-Open, Reasoning-Enhanced LLM

K2-V2:一种360开放、推理增强的LLM

K2 Team, Zhengzhong Liu, Liping Tang, Linghao Jin, Haonan Li, Nikhil Ranjan, Desai Fan, Shaurya Rohatgi, Richard Fan, Omkar Pangarkar, Huijuan Wang, Zhoujun Cheng, Suqi Sun, Seungwook Han, Bowen Tan, Gurpreet Gosal, Xudong Han, Varad Pimpalkhute, Shibo Hao, Ming Shan Hee, Joel Hestness, Haolong Jia, Liqun Ma, Aaryamonvikram Singh, Daria Soboleva, Natalia Vassilieva, Renxi Wang, Yingquan Wu, Yuekai Sun, Taylor Killian, Alexander Moreno, John Maggs, Hector Ren, Guowei He, Hongyi Wang, Xuezhe Ma, Yuqi Wang, Mikhail Yurochkin, Eric P. Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 K2-V2是一种通过注入领域知识、推理、长上下文和工具使用能力,提升复杂推理任务性能的360开放LLM,具备强大的推理能力和开源训练资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10539 2026-01-28 cs.AI cs.CL 79%

Improving Value-based Process Verifier via Low-Cost Variance Reduction

通过低成本方差减少改进基于价值的过程验证器

Zetian Sun, Dongfang Li, Baotian Hu, Min Zhang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ComMCS方法,通过低成本方差减少改进基于价值的过程验证器,有效提升数学推理能力。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21961 2026-01-28 cs.CL cs.AI 79%

Entropy-Gated Branching for Efficient Test-Time Reasoning

熵门分支用于高效的测试时间推理

Xianzhi Li, Ethan Callanan, Abdellah Ghassel, Xiaodan Zhu

机构 * Department of Electrical and Computer Engineering & Ingenuity Labs Research Institute(电气与计算机工程系及创新实验室研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 熵门分支通过在高不确定步骤进行分支并修剪扩展,提升LLM测试时间推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19204 2026-01-28 cs.AI cs.CV 77%

MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning

MATA:一种用于多智能体视觉推理的可训练分层自动机系统

Zhixi Cai, Fucai Ke, Kevin Leo, Sukai Huang, Maria Garcia de la Banda, Peter J. Stuckey, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 MATA是一种基于分层自动机的多智能体系统,通过可训练超智能体选择最优智能体进行视觉推理,实现高效任务解决。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19447 2026-01-28 cs.CL cs.AI 73%

KG-CRAFT: Knowledge Graph-based Contrastive Reasoning with LLMs for Enhancing Automated Fact-checking

基于知识图谱的对比推理:利用大语言模型增强自动事实核查

Vítor N. Lourenço, Aline Paes, Tillman Weyde, Audrey Depeige, Mohnish Dubey

机构 * Universidade Federal Fluminense(联邦Fluminense大学) Amazon(亚马逊) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KG-CRAFT通过结合知识图谱和大语言模型,提升自动事实核查的准确性与性能。

Comments Accepted to publication at the 19th Conference of the European Chapter of the Association for Computational Linguistics, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19273 2026-01-28 cs.CL cs.AI cs.IT math.IT 73%

Riddle Quest : The Enigma of Words

谜题 quest:词语的谜题

Niharika Sri Parasa, Chaitali Diwan, Srinath Srinivasa

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种生成和评估基于类比谜题的流程,研究大型语言模型在不同谜题类型中恢复完整答案集的能力,发现模型在推理覆盖和歧义处理方面存在不足。

Comments This paper is submitted under 'Demo track' for WWW conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19834 2026-01-28 cs.AI 70%

Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models

视觉生成通过多模态世界模型解锁类人推理

Jialong Wu, Xiaoying Zhang, Hongyi Yuan, Xiangcheng Zhang, Tianhao Huang, Changjing He, Chaoyi Deng, Renrui Zhang, Youbin Wu, Mingsheng Long

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出视觉生成在特定任务中优于纯语言推理,通过构建VisWorld-Eval评估套件验证了多模态世界模型提升类人推理的能力。

Comments Project page: https://thuml.github.io/Reasoning-Visual-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19825 2026-01-28 cs.AI cs.DB 70%

Routing End User Queries to Enterprise Databases

将用户查询路由到企业数据库

Saikrishna Sudarshan, Tanay Kulkarni, Manasi Patwardhan, Lovekesh Vig, Ashwin Srinivasan, Tanmay Tulsidas Verlekar

机构 * TCS Research(TCS研究机构) Department of CSIS, BITS Pilani KK Birla Goa Campus(计算机科学与信息系统系,比斯科恩理工学院KK Birla Goa校区)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种基于推理的重新排序策略,通过建模模式覆盖、结构连接性和语义对齐,提升多数据库环境中自然语言查询路由的准确性。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19170 2026-01-28 cs.AI 70%

Multi-Agent Procedural Graph Extraction with Structural and Logical Refinement

多代理过程图提取与结构逻辑细化

Wangyang Ying, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Wenchao Yu, Yanjie Fu, Haifeng Chen

机构 * Arizona State University(亚利桑那州立大学) NEC Labs America(NEC美国实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多代理框架\model{},通过结构和逻辑细化提升过程图提取的准确性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19151 2026-01-28 cs.AI cs.MA 70%

TS-Debate: Multimodal Collaborative Debate for Zero-Shot Time Series Reasoning

TS-Debate:多模态协作辩论用于零样本时间序列推理

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST Seoul(韩国科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TS-Debate通过多模态协作辩论框架,在零样本时间序列推理中实现显著性能提升,通过专门代理和结构化协议提升模态保真度和数值精度。

Comments Code will be available at https://github.com/DeepAuto-AI/TS-Debate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13887 2026-01-28 cs.AI 70%

Human Simulation Computation: A Human-Inspired Framework for Adaptive AI Systems

人类模拟计算:一种受人类启发的自适应人工智能系统框架

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出人类模拟计算框架,通过结合人类思维策略与行动反馈,提升AI在动态环境中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24940 2026-01-28 cs.CL 70%

SemCoT: Accelerating Chain-of-Thought Reasoning through Semantically-Aligned Implicit Tokens

SemCoT:通过语义对齐的隐式令牌加速链式推理

Yinhan He, Wendy Zheng, Yaochen Zhu, Zaiyi Zheng, Lin Su, Sriram Vasudevan, Qi Guo, Liangjie Hong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) LinkedIn Inc.(领英公司)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 SemCoT通过语义对齐的隐式令牌优化,提升链式推理的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20691 2026-01-28 cs.AI 70%

Plan Then Retrieve: Reinforcement Learning-Guided Complex Reasoning over Knowledge Graphs

计划后再检索:强化学习引导的知识图谱复杂推理

Yanlin Song, Ben Liu, Víctor Gutiérrez-Basulto, Zhiwei Hu, Qianqian Xie, Min Peng, Sophia Ananiadou, Jeff Z. Pan

机构 * School of Computer Science(计算机科学学院) Wuhan University(武汉大学) School of Computer Science and Informatics(计算机科学与信息学院) Cardiff University(卡迪夫大学) College of Information Science and Engineering(信息科学与工程学院) Shanxi Agricultural University(山西农业大学) School of Artificial Intelligence(人工智能学院) Center for Language and Information Research(语言与信息研究中心) University of Manchester(曼彻斯特大学) ILCC, School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Graph-RFT通过强化学习引导的知识图谱复杂推理框架,实现自主规划与适应性检索调度,解决KGQA中的冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 70%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19686 2026-01-28 cs.CV 67%

Video-KTR: Reinforcing Video Reasoning via Key Token Attribution

Video-KTR: 通过关键令牌 attribution 增强视频推理

Ziyue Wang, Sheng Jin, Zhongrong Zuo, Jiawei Wu, Han Qiu, Qi She, Hao Zhang, Xudong Jiang

机构 * ByteDance(字节跳动) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) National University of Singapore(国立新加坡大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Video-KTR通过结合三种attribution信号,提升视频推理的准确性和可解释性,实现状态-of-the-art性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19203 2026-01-28 cs.HC 67%

Before Smelling the Video: A Two-Stage Pipeline for Interpretable Video-to-Scent Plans

在嗅觉之前:一种可解释的视频到香氛计划的两阶段流程

Kaicheng Wang, Kevin Zhongyang Shao, Ruiqi Chen, Sep Makhsous, Denise Wilson

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种两阶段流程,通过视觉语言模型和大型语言模型分离视频语义提取与气味推断,验证了语义规划在提升嗅觉媒体体验中的有效性。

Comments In submission of poster as ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12241 2026-01-28 cs.AI cs.LG 62%

Privacy Reasoning in Ambiguous Contexts

模糊情境中的隐私推理

Ren Yi, Octavian Suciu, Adria Gascon, Sarah Meiklejohn, Eugene Bagdasarian, Marco Gruteser

机构 * Google Research(谷歌研究)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过设计Camber框架,探讨上下文消歧对提升语言模型隐私推理能力的影响,实验显示消歧可显著提高精度和召回率,减少提示敏感性。

Journal ref Advances in Neural Information Processing Systems 38 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02834 2026-01-28 cs.LG cs.CL 62%

ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning

ExPO: 通过自我解释引导的强化学习解锁复杂推理

Ruiyang Zhou, Shuozhe Li, Amy Zhang, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 ExPO通过自我解释引导强化学习,提升模型在复杂推理任务中的学习效率和性能。

Comments Accepted to NeurIPS 2025 (Poster). Code available at https://github.com/HumainLab/ExPO_rl_reasoning_by_explanation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19752 2026-01-28 cs.AI 57%

Agentic Design Patterns: A System-Theoretic Framework

代理设计模式:一种系统理论框架

Minh-Dung Dao, Quy Minh Le, Hoang Thanh Lam, Duc-Trong Le, Quoc-Viet Pham, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork Vietnam National University(越南国家大学) IBM Research Ireland(IBM爱尔兰研究) Trinity College Dublin(都柏林三一学院)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种系统理论框架,通过分解代理AI系统为五个核心功能子系统,提出12种代理设计模式,以解决代理设计中的重复问题,提升自主系统的模块化和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16778 2026-01-28 cs.HC cs.AI 57%

GTA: Generative Traffic Agents for Simulating Realistic Mobility Behavior

GTA:生成交通代理用于模拟真实移动行为

Simon Lämmer, Mark Colley, Patrick Ebel

机构 * Leipzig University(莱比锡大学) UCL Interaction Centre(UCL互动中心) ScaDS.AI, Leipzig University(ScaDS.AI,莱比锡大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 GTA通过基于角色的代理和大语言模型模拟大规模交通行为,提供了一种无需手工规则的类人交通模拟方法,用于研究未来创新对出行决策的影响。

Comments This version has been conditionally accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19433 2026-01-28 cs.CV 50%

RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming

RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成

Jisheng Chu, Wenrui Li, Rui Zhao, Wangmeng Zuo, Shifeng Chen, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanyang Technological University(南洋理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18305 2026-01-28 cs.CV 50%

DiVE-k: Differential Visual Reasoning for Fine-grained Image Recognition

DiVE-k:基于微细图像识别的差分视觉推理

Raja Kumar, Arka Sadhu, Ram Nevatia

机构 * University of Southern California(南加州大学) Meta

专题命中 推理与问题求解 :language model(abstract)

AI总结 DiVE-k通过利用模型自身top-k预测作为训练信号,提升细粒度图像识别的差分推理能力,显著优于现有方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11027 2026-01-28 cs.CV 50%

Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning

Vlaser:具有协同具身推理能力的视觉-语言-动作模型

Ganlin Yang, Tianyi Zhang, Haoran Hao, Weiyun Wang, Yibin Liu, Dehui Wang, Guanzhou Chen, Zijian Cai, Junting Chen, Weijie Su, Wengang Zhou, Yu Qiao, Jifeng Dai, Jiangmiao Pang, Gen Luo, Wenhai Wang, Yao Mu, Zhi Hou

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Fudan University(复旦大学) Tsinghua University(清华大学) NUS(新加坡国立大学) Northeastern University(东北大学) Shenzhen University(深圳大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Vlaser通过整合高级推理与低级控制,解决了具身推理与VLA策略学习之间的关键差距,在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 54 篇

2601.18945 2026-01-28 cs.DL 89%

Large Language Models for Departmental Expert Review Quality Scores

大型语言模型用于部门专家评审质量评分

Liv Langfeldt, Dag W. Aksnes, Henrik Karlstrøm, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了大型语言模型在内部部门评审中预测学术文章质量评分的能力,发现其与专家评分存在中等相关性,但报告质量低于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 88%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11254 2026-01-28 cs.CL 88%

Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality

心理测试在大语言模型中是否有效?对性别歧视、种族主义和道德的测试评估

Jana Jung, Marlene Lutz, Indira Sen, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Complexity Science Hub Vienna(维也纳复杂科学中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了心理测试在大语言模型上的有效性,发现其在性别歧视、种族主义和道德方面的测试分数与模型行为不一致,表明需进一步调整以适应LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00961 2026-01-28 cs.AI cs.LG 88%

LLM-Generated Explanations Do Not Suffice for Ultra-Strong Machine Learning

LLM生成的解释不足以实现超强机器学习

Lun Ai, Johannes Langer, Ute Schmid, Stephen Muggleton

机构 * Department of Computing, Imperial College London(帝国理工学院计算系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出LENS框架,通过神经符号方法生成逻辑程序解释,发现LLM生成的解释在人类学习中效果有限,需结合人类认知约束实现超强机器学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05895 2026-01-28 cs.CV 88%

BTCChat: Advancing Remote Sensing Bi-temporal Change Captioning with Multimodal Large Language Model

BTCChat: 通过多模态大语言模型推进遥感双时相变化描述

Yujie Li, Wenjia Xu, Yuanben Zhang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Aerospace Information Research Institute(航天信息研究所) Chinese Academy of Sciences(中国科学院) School of Geographical Sciences(地理科学学院) Hunan Normal University(湖南师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 BTCChat通过多模态大语言模型提升遥感双时相变化描述能力,引入变化提取模块和提示增强机制,实现更精确的视觉-语义对齐和更优的性能表现。

Comments 5 pages, 2 figures; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18949 2026-01-28 cs.SE cs.AI 87%

Tricky$^2$: Towards a Benchmark for Evaluating Human and LLM Error Interactions

Tricky$^2$:面向评估人类与LLM错误交互的基准

Cole Granger, Dipin Khati, Daniel Rodriguez-Cardenas, Denys Poshyvanyk

机构 * William and Mary(威廉玛丽学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Tricky$^2$是一个混合数据集,用于评估人类和LLM错误交互,包含人类和LLM生成的错误,支持混合错误行为分析和修复鲁棒性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19267 2026-01-28 cs.CL 86%

DiaDem: Advancing Dialogue Descriptions in Audiovisual Video Captioning for Multimodal Large Language Models

DiaDem: 促进音频视频字幕中的对话描述以提升多模态大语言模型

Xinlong Chen, Weihong Lin, Jingyun Hua, Linli Yao, Yue Ding, Bozhou Li, Bohan Zeng, Yang Shi, Qiang Liu, Yuanxing Zhang, Pengfei Wan, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Peking University(北京大学) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(title);language model(title);SFT(abstract);分类 cs.CL

AI总结 DiaDem通过合成高质量数据集和难度分区的两阶段GRPO策略,提升了音频视频字幕中的对话描述准确性,并在多种基准测试中表现出色。

Comments Project webpage: https://diadem-captioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏