arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2601.20757 2026-01-29 cs.CL 90%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21293 2026-01-29 cs.RO cs.HC 89%

Quadrupped-Legged Robot Movement Plan Generation using Large Language Model

四足机器人运动计划生成使用大语言模型

Muhtadin, Vincentius Gusti Putu A. B. M., Ahmad Zaini, Mauridhi Hery Purnomo, I Ketut Eddy Purnama, Chastine Fatichah

机构 * Institut Teknologi Sepuluh Nopember(十月份十号技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大语言模型生成四足机器人运动计划,通过分布式架构和实时传感器融合实现直观自然语言导航,实验显示系统在多种场景中成功率超过90%。

Journal ref 2025 International Conference on Computer Engineering, Network and Intelligent Multimedia (CENIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20856 2026-01-29 cs.AI 88%

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

SokoBench:评估大型语言模型的长周期规划与推理能力

Sebastiano Monti, Carlo Nicolini, Gianni Pellegrini, Jacopo Staiano, Bruno Lepri

机构 * Ipazia SpA(Ipazia公司) University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SokoBench通过简化俄罗斯方块谜题评估大型语言模型的长周期规划与推理能力,揭示了其在复杂任务中的性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20141 2026-01-29 cs.CY cs.AI 88%

Large language models accurately predict public perceptions of support for climate action worldwide

大型语言模型能准确预测全球对气候行动的支持感知

Nattavudh Powdthavee, Sandra J. Geiger

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 大型语言模型能准确预测全球对气候行动的支持感知,为评估气候行动中的感知差距提供快速工具,尤其在资源丰富的国家可作为替代调查手段。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09785 2026-01-29 cs.AI 87%

AI Annotation Orchestration: Evaluating LLM verifiers to Improve the Quality of LLM Annotations in Learning Analytics

AI标注协调:评估LLM验证器以提高学习分析中LLM标注的质量

Bakhtawar Ahtisham, Kirk Vanacore, Jinsook Lee, Zhuqian Zhou, Doug Pietrzak, Rene F. Kizilcec

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过评估LLM验证器提升学习分析中标注质量,提出灵活的协调框架和实证比较方法,展示验证在提高标注可靠性中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20194 2026-01-29 cs.HC 86%

An Autonomous Agent Framework for Feature-Label Extraction from Device Dialogues and Automatic Multi-Dimensional Device Hosting Planning Based on Large Language Models

基于大语言模型的自主代理框架:用于设备对话中特征-标签提取与自动多维设备托管规划

Huichao Men, Yizhen Hu, Yu Gao, Xiaofeng Mou, Yi Xu, Xinhua Xiao

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出AirAgent框架,利用大语言模型实现家庭空气系统的自主管理,通过双层协作架构提升空气质量和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01146 2026-01-29 cs.CL cs.AI cs.LG 83%

mR3: Multilingual Rubric-Agnostic Reward Reasoning Models

mR3:多语言无评分标准奖励推理模型

David Anugraha, Shou-Yi Hung, Zilu Tang, Annie En-Shiun Lee, Derry Tanti Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学) Boston University(波士顿大学) Ontario Tech University(安大略技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One(Capital One公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 mR3是一种多语言无评分标准奖励推理模型,通过72种语言训练实现广泛语言覆盖,超越更大模型并验证其在多语言奖励模型基准上的最佳性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20659 2026-01-29 cs.CL cs.MA 83%

A Dialectic Pipeline for Improving LLM Robustness

辩证管道用于提升大语言模型鲁棒性

Sara Candussio

机构 * Università degli Studi di Trieste(特里埃斯特大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出一种辩证管道,通过自我对话提升大语言模型的鲁棒性,有效减少幻觉并提高输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20641 2026-01-29 cs.AI 83%

Investigating the Development of Task-Oriented Communication in Vision-Language Models

探究视觉-语言模型中以任务为导向的交流发展

Boaz Carmeli, Orr Paradise, Shafi Goldwasser, Yonatan Belinkov, Ron Meir

机构 * Technion – Israel Institute of Technology(技术ion–以色列理工学院) EPFL(苏黎世联邦理工学院) University of California, Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究视觉-语言模型在协作任务中发展以任务为导向的通信协议的潜力与风险

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 82%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 79%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20270 2026-01-29 cs.CR cs.AI 77%

Eliciting Least-to-Most Reasoning for Phishing URL Detection

诱发最小到最大推理以检测钓鱼网址

Holly Trikilis, Pasindu Marasinghe, Fariza Rashid, Suranga Seneviratne

机构 * University of Sydney(悉尼大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出了一种最小到最大提示框架,通过引入答案敏感性机制提升钓鱼网址检测的推理能力和准确性,优于一次性方法和监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19061 2026-01-29 cs.CR cs.LG 77%

Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models

思维转移:链式思维推理模型的间接针对性污染攻击

Harsh Chaudhari, Ethan Rathbun, Hanna Foerster, Jamie Hayes, Matthew Jagielski, Milad Nasr, Ilia Shumailov, Alina Oprea

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种名为思维转移的新型攻击方法,通过操纵不同任务学习的推理痕迹,对链式思维推理模型进行间接针对性污染攻击,成功影响目标任务的输出并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13332 2026-01-29 cs.CL 77%

The Imitation Game: Turing Machine Imitator is Length Generalizable Reasoner

模仿游戏:图灵机模仿器是长度可推广的推理机

Zhouqi Hua, Wenwei Zhang, Chengqi Lyu, Yuzhe Gu, Songyang Gao, Kuikun Liu, Dahua Lin, Kai Chen

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TAIL方法,通过合成图灵机执行过程的链式思维数据,提升LLM的长度泛化能力,超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08477 2026-01-29 cs.CL 77%

Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection

读取即可见:引导单模LLM进行低资源可解释有害迷因检测

Fengjun Pan, Xiaobao Wu, Tho Quan, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Ho Chi Minh City University of Technology(胡志明市技术大学) VinUniversity(文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 U-CoT+通过轻量级单模LLM和高保真迷因到文本管道,实现低资源、可解释的有害迷因检测,有效提升模型灵活性和适应性。

Comments Accepted to ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19620 2026-01-29 cs.LG cs.AI 76%

R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning

R^3: 为大语言模型强化学习的回放、反思与奖励排名

Zhizheng Jiang, Kang Zhao, Weikai Xu, Xinkui Lin, Wei Liu, Jian Luan, Shuo Shang, Peng Han

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Unaffiliated(无隶属机构) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI、cs.LG

AI总结 R^3通过回放、反思和奖励排名机制,提升大语言模型在强化学习中的稳定性和效率,实现数学领域性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19851 2026-01-29 cs.RO 75%

Where Did I Leave My Glasses? Open-Vocabulary Semantic Exploration in Real-World Semi-Static Environments

我放哪里了我的眼镜?在现实世界半静态环境中进行开放式词汇语义探索

Benjamin Bogenberger, Oliver Harrison, Orrin Dahanaggamaarachchi, Lukas Brunke, Jingxing Qian, Siqi Zhou, Angela P. Schoellig

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出了一种适用于半静态环境的开放式词汇语义探索系统,通过概率模型和大语言模型推理实现高效对象导航和地图维护。

Journal ref IEEE RA-L, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04207 2026-01-29 cs.LG cs.AI cs.CL cs.CV 75%

Advancing Multimodal Reasoning: From Optimized Cold Start to Staged Reinforcement Learning

推动多模态推理:从优化冷启动到分阶段强化学习

Shuang Chen, Yue Guo, Zhaochen Su, Yafu Li, Yulun Wu, Jiacheng Chen, Jiayu Chen, Weijie Wang, Xiaoye Qu, Yu Cheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Soochow University(苏州大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReVisual-R1,通过优化冷启动和分阶段强化学习提升多模态推理能力,在多个挑战性基准测试中取得新突破。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14957 2026-01-29 cs.CV 75%

Neuro Symbolic Knowledge Reasoning for Procedural Video Question Answering

用于过程视频问答的神经符号知识推理

Basura Fernando, Thanh-Son Nguyen, Hong Yang, Tzeh Yuan Neoh, Hao Zhang, Ee Yeo Keat

机构 * Centre for Frontier AI Research, A*STAR, Singapore(前沿人工智能研究所以(A*STAR)) Institute of High-Performance Computing, A*STAR, Singapore(高性能计算研究所(A*STAR)) College of Computing and Data Science, NTU, Singapore(计算与数据科学学院(NTU))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出KML框架,通过神经符号方法提升过程视频问答的推理能力,结合知识图谱实现可解释的多步骤推理。

Comments This paper is under review at IEEE Transactions on Neural Networks and Learning Systems. Personal use is permitted, but republication/redistribution requires IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20467 2026-01-29 cs.AI cs.CL 73%

CtrlCoT: Dual-Granularity Chain-of-Thought Compression for Controllable Reasoning

CtrlCoT:用于可控推理的双粒度推理链压缩

Zhenxuan Fan, Jie Cao, Yang Dai, Zheqi Lv, Wenqiao Zhang, Zhongle Xie, Peng LU, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 CtrlCoT通过双粒度方法实现高效可控推理,结合语义抽象与标记级删除,提升推理效率和可靠性。

Comments 16 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA 73%

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09332 2026-01-29 cs.RO cs.AI cs.CL cs.CV 73%

OmniEVA: Embodied Versatile Planner via Task-Adaptive 3D-Grounded and Embodiment-aware Reasoning

OmniEVA:通过任务自适应3D grounded和 embodiment-aware推理实现具身 versatile规划

Yuecheng Liu, Dafeng Chi, Shiguang Wu, Zhanguang Zhang, Yuzheng Zhuang, Bowen Yang, He Zhu, Lingfeng Zhang, Pengwei Xie, David Gamaliel Arcos Bravo, Yingxue Zhang, Jianye Hao, Xingyue Quan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OmniEVA通过任务自适应3D grounding和具身aware推理,解决具身系统中几何适应性和具身约束的限制,实现先进的具身推理和任务规划。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18944 2026-01-29 cs.AI cs.PL cs.SE 70%

Neural Theorem Proving for Verification Conditions: A Real-World Benchmark

为验证条件进行神经定理证明:一个现实世界的基准测试

Qiyuan Xu, Xiaokun Luan, Renxi Wang, Joshua Ong Jun Leang, Peixin Wang, Haonan Li, Wenda Li, Conrad Watt

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) MBZUAI Imperial College London(帝国理工学院) East China Normal University(华东师范大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出NTP4VC,首个现实世界多语言基准测试,评估LLMs在自动验证条件证明中的表现,揭示程序验证中的挑战与未来研究方向。

Comments Accepted in ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20604 2026-01-29 cs.AI 70%

Dialogical Reasoning Across AI Architectures: A Multi-Model Framework for Testing AI Alignment Strategies

跨AI架构的对话推理:一种多模型框架用于测试AI对齐策略

Gray Cox

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多模型框架,通过对话推理测试AI对齐策略,展示不同AI模型在处理复杂对齐框架时的表现及新兴见解。

Comments 23 pages, 5 tables, 5 appendices. Code and data: https://github.com/jgraycox-coa/vcw-multi-ai-dialogue

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20014 2026-01-29 cs.AI 70%

Teaching LLMs to Ask: Self-Querying Category-Theoretic Planning for Under-Specified Reasoning

教大语言模型提问:面向不充分推理的自查询范畴规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SQ-BCP通过自查询和桥梁假设解决不充分推理问题,显著降低资源违规率并保持高质量计划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19180 2026-01-29 cs.CR cs.AI 70%

Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning

通过主动安全推理增强模型对劫持的防御

Xianglin Yang, Gelei Deng, Jieming Shi, Tianwei Zhang, Jin Song Dong

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学) School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20552 2026-01-29 cs.CV 67%

DeepSeek-OCR 2: Visual Causal Flow

DeepSeek-OCR 2: 视觉因果流

Haoran Wei, Yaofeng Sun, Yukun Li

机构 * DeepSeek-AI

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 DeepSeek-OCR 2通过两个级联的一维因果推理结构实现二维图像理解,提升视觉处理的语义连贯性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19968 2026-01-29 cs.CR 67%

What is the AGI in Offensive Security ?

进攻性安全中的AGI是什么?

Youngwoong Cho

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 本文探讨进攻性安全中的AGI,提出将任务归结为符号语言操作,并通过状态机和符号代理模型分析交互编码问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01544 2026-01-29 cs.LG cs.AI cs.CL 67%

Compositional Reasoning with Transformers, RNNs, and Chain of Thought

基于变换器、RNN和思维链的组合推理

Gilad Yehudai, Noah Amsel, Joan Bruna

机构 * Courant Institute of Mathematical Sciences(Courant数学科学研究所) New York University(纽约大学) Center for Data Science(数据科学中心) Center for Computational Mathematics(计算数学中心) Flatiron Institute(Flatiron研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了变换器、RNN和思维链架构在解决组合推理问题上的表现,证明了不同架构在处理此类问题时各有优劣,无一严格优于其他。

Comments NeurIPS CR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19915 2026-01-29 cs.CL cs.AI cs.LO 62%

Modeling Next-Token Prediction as Left-Nested Intuitionistic Implication

将下一个词预测建模为左嵌套直觉蕴含

Paul Tarau

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了一种基于直觉逻辑的神经架构,通过左嵌套蕴含链实现下一个词预测,展示了其与Transformer和状态空间模型的对比。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏