arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2601.22035 2026-01-30 cs.CL cs.AI 81%

Thinking Out of Order: When Output Order Stops Reflecting Reasoning Order in Diffusion Language Models

脱离顺序思考:当输出顺序不再反映推理顺序时扩散语言模型的表现

Longxuan Yu, Yu Fu, Shaorong Zhang, Hui Liu, Mukund Varma T, Greg Ver Steeg, Yue Dong

机构 * University of California, Riverside, CA, USA(加州大学河滨分校) Independent Researcher(独立研究者) University of California, San Diego, CA, USA(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出屏蔽扩散语言模型(MDLMs)在处理输出顺序与推理顺序不一致时展现出的顺序鲁棒性,通过实验验证其在不同基准上的稳定性能。

Comments 18 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17915 2026-01-30 cs.AI cs.LG cs.LO 81%

Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation

局部思考,全球解释:通过局部推理和信念传播的图引导LLM研究

Saurabh Jha, Rohan Arora, Bhavya, Noah Zheutlin, Paulina Toro Isaza, Laura Shwartz, Yu Deng, Daby Sow, Ruchi Mahindru, Ruchir Puri

机构 * IBM Research(IBM研究院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 EoG通过图引导的局部推理和信念传播提升LLM在开放性研究中的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16218 2026-01-26 cs.CL cs.AI 81%

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

M3Kang: 评估视觉-语言模型在多语言多模态数学推理中的表现

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 M3Kang是一个大规模多语言多模态数学推理数据集,用于评估视觉-语言模型在多语言数学推理中的表现,通过基准测试揭示模型在基础数学和图表推理上的不足,并展示多语言技术在多模态设置中的有效性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02076 2026-01-21 cs.CL cs.AI 81%

Deferred Commitment Decoding for Diffusion Language Models

延迟承诺解码用于扩散语言模型

Yingte Shu, Yuchuan Tian, Chao Xu, Yunhe Wang, Hanting Chen

机构 * Peking University(北京大学) Huawei Technologies(华为技术)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出延迟承诺解码方法,通过基于不确定性的策略提升扩散语言模型解码质量和效率,实验显示在多个模型和基准测试中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20543 2026-01-21 cs.CL cs.AI 81%

The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts

狗追猫的猫让模型困惑:衡量语言模型何时放弃结构分析而采用捷径

Sangmitra Madhusudan, Kaige Chen, Ali Emami

机构 * Emory University(埃默里大学) Brock University(布罗克大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CenterBench数据集,用于衡量语言模型在处理中心嵌套句子时何时从结构分析转向语义捷径,揭示模型在复杂性增加时性能差距扩大及人类与模型的差异。

Comments 9 pages (excluding references), accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23311 2026-01-15 cs.CV cs.AI cs.CL 81%

Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning

识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理

Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi

机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) Faculty of Arts, Xiamen University(厦门大学艺术学院) University of Birmingham(伯明翰大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。

Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025

Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16769 2026-01-12 cs.AI cs.CL 81%

See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models

见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解

Shuo Han, Yukun Cao, Zezhong Ding, Zengyi Gao, S Kevin Zhou, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06478 2026-01-06 cs.LG cs.AI 81%

Anytime-Valid Answer Sufficiency Certificates for LLM Generation via Sequential Information Lift

通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction & Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过顺序信息提升实现LLM生成的任何时间有效性答案充分性证书,利用经验动态形式提升方法,在减少生成长度的同时保持delta级误差控制,并通过轻量级正确性门提升端任务正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24103 2026-01-01 cs.LG cs.AI 81%

Enhancing LLM Planning Capabilities through Intrinsic Self-Critique

通过内在自我批评增强大语言模型的规划能力

Bernd Bohnet, Pierre-Alexandre Kamienny, Hanie Sedghi, Dilan Gorur, Pranjal Awasthi, Aaron Parisi, Kevin Swersky, Rosanne Liu, Azade Nova, Noah Fiedel

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 通过内在自我批评方法提升大语言模型的规划能力,实现Blocksworld、Logistics和Mini-grid数据集上的性能改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15834 2026-01-01 cs.DC cs.AI cs.CR cs.LG 81%

FEDSTR: Money-In AI-Out | A Decentralized Marketplace for Federated Learning and LLM Training on the NOSTR Protocol

FEDSTR: 人工智能无钱 | 基于NOSTR协议的去中心化市场

Konstantinos E. Nikolakakis, George Chantzialexiou, Dionysis Kalogerias

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 FEDSTR提出基于NOSTR协议的去中心化市场,允许用户通过数据集训练AI模型并支付费用获取优化模型,旨在实现公平且开放的AI训练市场。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22931 2025-12-30 cs.AI cs.LG 81%

Geometric Structural Knowledge Graph Foundation Model

几何结构知识图谱基础模型

Ling Xin, Mojtaba Nayyeri, Zahra Makki Nayeri, Steffen Staab

机构 * University of Stuttgart(斯图加特大学) University of Southampton(南安普顿大学) Shahrood University of Technology(沙霍尔德大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Gamma通过引入多头几何注意力机制,提升知识图谱推理的表达能力,优于现有方法Ultra,在零样本归纳链接预测中表现更优。

Comments Submitted to IEEE TPAMI, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13159 2025-12-16 cs.AI cs.CL 81%

SpeakRL: Synergizing Reasoning, Speaking, and Acting in Language Models with Reinforcement Learning

SpeakRL: 在语言模型中协同推理、说话与行动以增强强化学习

Emre Can Acikgoz, Jinoh Oh, Jie Hao, Joo Hyuk Jeon, Heng Ji, Dilek Hakkani-Tür, Gokhan Tur, Xiang Li, Chengyuan Ma, Xing Fan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Alexa(亚马逊Alexa)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SpeakRL通过强化学习提升语言模型的对话能力,通过奖励主动互动提高任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18491 2025-12-08 cs.CL cs.AI 81%

MindEval: Benchmarking Language Models on Multi-turn Mental Health Support

MindEval: 在多轮心理健康支持中对语言模型进行基准测试

José Pombal, Maya D'Eon, Nuno M. Guerreiro, Pedro Henrique Martins, António Farinhas, Ricardo Rei

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MindEval通过与临床心理学家合作,提出了一种自动评估语言模型在多轮心理健康对话中表现的框架,评估了12种先进模型,发现其在复杂交互中表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05826 2025-12-04 cs.CV cs.AI cs.LG 81%

From Pixels to Prose: Advancing Multi-Modal Language Models for Remote Sensing

从像素到 prose:推进遥感多模态语言模型

Xintian Sun, Benji Peng, Charles Zhang, Fei Jin, Qian Niu, Junyu Liu, Keyu Chen, Ming Li, Pohsun Feng, Ziqian Bi, Ming Liu, Xinyuan Song, Yichao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Minnesota - Twin Cities(明尼苏达大学双城分校) Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) National Taiwan Normal University(台湾师范大学) Purdue University(普渡大学) Emory University(埃默里大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了多模态语言模型在遥感中的应用,分析了其技术基础、挑战及未来发展方向,强调了其在环境监测和灾害响应中的重要作用。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15209 2025-12-02 cs.CV cs.AI cs.LG 81%

PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation

PRIMA:多图像视觉-语言模型用于推理分割

Muntasir Wahed, Kiet A. Nguyen, Adheesh Sunil Juvekar, Xinzhuo Li, Xiaona Zhou, Vedant Shah, Tianjiao Yu, Pinar Yanardag, Ismini Lourentzou

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PRIMA通过整合像素级定位与多图像推理,提升了多图像分割任务的性能,其在Recall和S-IoU上分别优于现有基线7.83%和11.25%。

Comments Project page: https://plan-lab.github.io/prima

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22441 2025-12-01 cs.CR cs.AI cs.CV cs.LG 81%

GEO-Detective: Unveiling Location Privacy Risks in Images with LLM Agents

GEO-Detective:利用LLM代理揭示图像中的位置隐私风险

Xinyu Zhang, Yixin Wu, Boyang Zhang, Chenhao Lin, Chao Shen, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) Xi’an Jiaotong University(西安交通大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 GEO-Detective利用LLM代理进行图像地理定位推断,通过自适应策略和专用工具提升定位精度并降低隐私风险。

Comments 15 pages with 7 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21688 2025-12-01 cs.CV cs.AI cs.CL 81%

G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning

G$^2$VLM:基于几何的视觉语言模型,实现统一的3D重建与空间推理

Wenbo Hu, Jingli Lin, Yilin Long, Yunlong Ran, Lihan Jiang, Yifan Wang, Chenming Zhu, Runsen Xu, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) UCLA(加州大学洛杉矶分校) SJTU(上海交通大学) FDU(福建师范大学) ZJU(浙江大学) USTC(中国科学技术大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 G$^2$VLM通过统一3D重建与空间推理,提升视觉语言模型在空间智能任务中的性能。

Comments code are released at https://github.com/InternRobotics/G2VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01943 2025-12-01 cs.CL cs.AI cs.CV cs.RO 81%

ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks

ROVER:基于视觉语言模型的视频递归推理用于具身任务

Philip Schroeder, Ondrej Biza, Thomas Weng, Hongyin Luo, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) RAI Institute(RAI研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ROVER通过递归分解视频轨迹提升具身任务中的视频推理能力,有效减少幻觉并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17967 2025-11-26 cs.LG cs.AI cs.CV 81%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24068 2025-11-24 cs.LG cs.AI 81%

A Small Math Model: Recasting Strategy Choice Theory in an LLM-Inspired Architecture

一个小数学模型:在LLM启发式架构中重构策略选择理论

Roussel Rahman, Jeff Shrager

机构 * Stanford University(斯坦福大学) Bennu Climate, Inc.(Bennu气候公司)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM架构的小数学模型,重构策略选择理论,扩展其功能并研究数学推理中的数字特征与关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15069 2025-11-20 cs.AI cs.CL 81%

ProRAC: A Neuro-symbolic Method for Reasoning about Actions with LLM-based Progression

Haoyong Wu, Yongmei Liu

机构 * Haoyong Wu, Yongmei Liu(作者)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13378 2025-11-18 cs.DL cs.AI cs.LG cs.MM 81%

Moving Pictures of Thought: Extracting Visual Knowledge in Charles S. Peirce's Manuscripts with Vision-Language Models

Carlo Teo Pedretti, Davide Picca, Dario Rodighiero

机构 * Department of Classics, University Sapienza of Rome(罗马大学萨皮恩扎文学院) Department of Language and Communication Sciences, University of Lausanne(洛桑大学语言与沟通科学系) Campus Fryslân, University of Groningen(格罗宁根大学弗里斯兰校区)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11810 2025-11-18 cs.CL cs.AI 81%

On the Notion that Language Models Reason

Bertram Højer

机构 * Department of Computer Science(计算机科学系) IT University of Copenhagen(哥本哈根IT大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at the 1st Workshop on Epistemic Intelligence in Machine Learning, EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09030 2025-11-13 cs.AI cs.CL cs.MA 81%

Solving a Million-Step LLM Task with Zero Errors

Elliot Meyerson, Giuseppe Paolo, Roberto Dailey, Hormoz Shahrzad, Olivier Francon, Conor F. Hayes, Xin Qiu, Babak Hodjat, Risto Miikkulainen

机构 * Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Main paper: 14 pages, 29 pages with references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08052 2025-11-12 cs.AI cs.CL cs.SE 81%

Dual-Process Scaffold Reasoning for Enhancing LLM Code Debugging

Po-Chung Hsieh, Chin-Po Chen, Jeng-Lin Li, Ming-Ching Chang

机构 * National Taiwan University(国立台湾大学) AI Research Center, Inventec Corporation(Inventec公司人工智能研究中心) University at Albany, SUNY(纽约州立大学阿尔巴尼分校)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06146 2025-11-11 cs.CL cs.AI cs.CV 81%

Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models

Akshar Tumu, Varad Shinde, Parisa Kordjamshidi

机构 * UC San Diego(加州大学圣地亚哥分校) IIT Kanpur(印度理工学院坎pur) Michigan State University(密歇根州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05563 2025-11-11 cs.LG cs.AI 81%

Lookahead Unmasking Elicits Accurate Decoding in Diffusion Language Models

Sanghyun Lee, Seungryong Kim, Jongho Park, Dongmin Park

机构 * KAIST(韩国科学技术院) University of California, Berkeley(加州大学伯克利分校) KRAFTON

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27558 2025-11-03 cs.RO cs.AI cs.LG 81%

Toward Accurate Long-Horizon Robotic Manipulation: Language-to-Action with Foundation Models via Scene Graphs

Sushil Samuel Dinesh, Shinkyu Park

机构 * Department of Electrical and Computer Engineering, King Abdullah University of Science and Technology (KAUST)(电气与计算机工程系,国王 Abdullah 科学与技术大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24320 2025-10-29 cs.CL cs.AI 81%

Critique-RL: Training Language Models for Critiquing through Two-Stage Reinforcement Learning

Zhiheng Xi, Jixuan Huang, Xin Guo, Boyang Hong, Dingwen Yang, Xiaoran Fan, Shuo Li, Zehui Chen, Junjie Ye, Siyu Yuan, Zhengyin Du, Xuesong Yao, Yufei Xu, Jiecao Chen, Rui Zheng, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) ByteDance Seed(字节跳动种子)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Preprint, 25 pages, 9 figures. Code: https://github.com/WooooDyy/Critique-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22993 2025-10-28 cs.LG cs.CL 81%

Can Language Models Compose Skills In-Context?

Zidong Liu, Zhuoyan Xu, Zhenmei Shi, Yingyu Liang

机构 * The University of Hong Kong(香港大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏