arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 299 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 55 篇

2602.02975 2026-02-04 cs.CL cs.AI cs.LG 75%

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

规范与参照的碰撞:评估大语言模型在规范推理中的能力

Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SNIC测试平台,评估大语言模型在基于规范的参照解析任务中的能力,发现现有模型在处理隐含或冲突规范时存在显著不足。

Comments Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03635 2026-02-04 cs.CL cs.LG 73%

TRE: Encouraging Exploration in the Trust Region

TRE: 在信任区域中鼓励探索

Chao Huang, Yujing Lu, Quangang Li, Shenghe Wang, Yan Wang, Yueyang Zhang, Long Xia, Jiashu Zhao, Zhiyuan Sun, Daiting Shi, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TRE通过在模型信任区域内鼓励探索,提升了大型语言模型在数学推理、组合搜索和偏好对齐任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02545 2026-02-04 cs.LG cs.AI 73%

Beyond Alignment: Expanding Reasoning Capacity via Manifold-Reshaping Policy Optimization

超越对齐:通过流形重塑策略优化扩展推理能力

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出流形重塑策略优化方法,通过几何干预扩展LLM的推理能力,实验证明其在数学任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03442 2026-02-04 cs.CL 70%

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

A-RAG:通过分层检索接口扩展代理检索增强生成

Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 A-RAG通过分层检索接口提升检索增强生成效果,有效利用模型能力并适应不同任务。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03414 2026-02-04 cs.CV cs.AI 70%

Socratic-Geo: Synthetic Data Generation and Geometric Reasoning via Multi-Agent Interaction

Socratic-Geo:通过多智能体交互实现合成数据生成与几何推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai University of Finance(上海财经大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Socratic-Geo通过多智能体交互实现合成数据生成与几何推理,利用教师代理和求解代理动态耦合数据合成与模型学习,提升图像生成和推理能力。

Comments 18pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03094 2026-02-04 cs.CL 70%

Test-time Recursive Thinking: Self-Improvement without External Feedback

测试时递归思考:无需外部反馈的自我提升

Yufan Zhuang, Chandan Singh, Liyuan Liu, Yelong Shen, Dinghuai Zhang, Jingbo Shang, Jianfeng Gao, Weizhu Chen

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 TRT 框架,使 LLM 在无需外部反馈的情况下实现自我提升,开源模型在 AIME-25/24 上达到 100% 准确率,闭源模型在 LiveCodeBench 最难问题上提升 10.4-14.8 个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02601 2026-02-04 cs.SI cs.AI 70%

CaST: Causal Discovery via Spatio-Temporal Graphs in Disaster Tweets

基于灾难推文的时空图因果发现:CaST

Hieu Duong, Eugene Levin, Todd Gary, Long Nguyen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CaST通过整合语义、时空信息,利用大规模语言模型构建事件图,实现灾难推文中更稳健和可解释的因果发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02496 2026-02-04 cs.CL 70%

The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders

虚假差距:通过稀疏自编码器量化内部信念与思维链解释之间的分歧

Shikhar Shiromani, Archie Chaudhury, Sri Pranav Kunda

机构 * Independent(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过稀疏自编码器量化模型内部信念与生成回答之间的差异,以检测模型的不忠实行为。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02453 2026-02-04 cs.AI 70%

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00611 2026-02-04 cs.AI 70%

Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome

结构自一致性:基于虚拟家庭的多任务评估

Jiaqi Xu, Tao Huang, Kai Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结构自一致性方法,评估两种大型语言模型在虚拟家庭任务中的表现,发现不同模型在不同任务中各有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11361 2026-02-04 cs.AI 70%

MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization

MAPGD:多智能体提示梯度下降用于协作提示优化

Yichen Han, Yuhang Han, Siteng Huang, Guanyu Liu, Zhengpeng Zhou, Bojun Liu, Yujia Zhang, Isaac N Shi, Lewei He, Tianyu Shi

机构 * South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Macau(澳门大学) University of Sydney(悉尼大学) Silicon Sapiens LLC University of Alberta(阿尔伯塔大学) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MAPGD通过多智能体协作机制提升提示优化的鲁棒性和效率,结合梯度融合与动态加权实现高效且可解释的优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 67%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 推理与问题求解 :language model(abstract);preference optimization(abstract)

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23155 2026-02-04 cs.RO 67%

LAGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Rabeya Akter, Safaeid Hossain Arib

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract)

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03647 2026-02-04 cs.AI cs.CL 62%

Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration

Search-R2: 通过演员-细化协作提升搜索集成推理

Bowei He, Minda Hu, Zenan Xu, Hongru Wang, Licheng Zong, Yankai Chen, Chen Ma, Xue Liu, Pluto Zhou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯语言模型部门) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) McGill University(麦吉尔大学) City University of Hong Kong(香港城市大学) The University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 Search-R2通过演员-细化协作框架提升搜索集成推理,通过针对性干预和混合奖励设计,在多种QA数据集上超越强基线,实现更优的推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03640 2026-02-04 cs.IR cs.AI cs.CL 62%

Tutorial on Reasoning for IR & IR for Reasoning

信息检索与推理 for 推理的教程

Mohanna Hoveyda, Panagiotis Efstratiadis, Arjen de Vries, Maarten de Rijke

机构 * Radboud University(拉德堡德大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 本教程探讨了信息检索与推理之间的关系,提出统一框架以指导推理增强的信息检索系统发展。

Comments Accepted to ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00197 2026-02-04 q-bio.QM cs.AI cs.CL 62%

Rank-and-Reason: Multi-Agent Collaboration Accelerates Zero-Shot Protein Mutation Prediction

Rank-and-Reason: 多智能体协作加速零样本蛋白质突变预测

Yang Tan, Yuanxi Yu, Can Wu, Bozitao Zhong, Mingchen Li, Guisheng Fan, Jiankang Zhu, Yafeng Liang, Nanqing Dong, Liang Hong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science(南方大学(科学)) East China University of Science and Technology(东中国科学与技术大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 Rank-and-Reason通过多智能体协作提升零样本蛋白质突变预测的准确性与效率,显著提高湿实验验证的成功率。

Comments 22 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03798 2026-02-04 cs.SE cs.CL cs.CV 57%

FullStack-Agent: Enhancing Agentic Full-Stack Web Coding via Development-Oriented Testing and Repository Back-Translation

全栈代理:通过面向开发的测试和仓库反翻译增强全栈网页编码

Zimu Lu, Houxing Ren, Yunqiao Yang, Ke Wang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 FullStack-Agent通过面向开发的测试和仓库反翻译提升全栈网页编码能力,其多代理框架和自我改进方法在多个测试用例中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03038 2026-02-04 cs.CV cs.AI 57%

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

Bongards在感知与推理边界上的问题:程序还是语言?

Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

机构 * Cornell University(康奈尔大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种神经符号方法,利用大语言模型和贝叶斯优化解决Bongard问题,通过生成参数化程序化表示来提升视觉推理能力。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03026 2026-02-04 cs.AI cs.MA 57%

Visual Reasoning over Time Series via Multi-Agent System

通过多智能体系统进行时间序列的视觉推理

Weilin Ruan, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 MAS4TS通过多智能体系统实现时间序列的视觉推理,利用分析-推理-执行范式,结合视觉语言模型和工具链,提升时间序列任务的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 57%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03530 2026-02-04 cs.CV 50%

Interpretable Logical Anomaly Classification via Constraint Decomposition and Instruction Fine-Tuning

通过约束分解和指令微调实现可解释的逻辑异常分类

Xufei Zhang, Xinjiao Zhou, Ziling Deng, Dongdong Geng, Jianxiong Wang

机构 * Beijing XingYun Digital Technology Co., Ltd.(北京星云数字技术有限公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 LogiCls通过约束分解和指令微调实现工业逻辑异常的可解释分类,结合视觉-语言框架和数据驱动的监督方法,提升异常检测的准确性和可解释性。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20272 2026-02-04 cs.CV 50%

Ground-R1: Incentivizing Grounded Visual Reasoning via Reinforcement Learning

Ground-R1: 通过强化学习激励基于地面的视觉推理

Meng Cao, Haoze Zhao, Can Zhang, Xiaojun Chang, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Ground-R1 通过 Scale Relative Policy Optimization 方法,解决 LVLM 在视觉证据 grounding 方面的偏差问题,提升推理准确性和证据 grounding 能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03432 2026-02-04 cs.IR 50%

Failure is Feedback: History-Aware Backtracking for Agentic Traversal in Multimodal Graphs

失败是反馈:面向多模态图中代理遍历的历史感知回溯

Joohyung Yun, Doyup Lee, Wook-Shin Han

专题命中 推理与问题求解 :LLM(abstract)

AI总结 FiF通过历史感知回溯和经济理性的代理工作流程,提升多模态图中检索的适应性和效率。

Comments Project page: https://failureisfeedback.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03197 2026-02-04 cs.HC 50%

Exploring the Role of Tracing in AI-Supported Planning for Algorithmic Reasoning

探索在AI支持的规划中追踪的作用:用于算法推理

Yoshee Jain, Heejin Do, Zihan Wu, April Yi Wang

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本研究探讨了在AI支持的规划中使用追踪对算法推理的影响,发现追踪促使学习者转向目标导向的推理,并提高了部分正确解决方案的一致性,但未显著影响反馈质量。

Comments 14 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02963 2026-02-04 cs.CV 50%

TRACE: Temporal Radiology with Anatomical Change Explanation for Grounded X-ray Report Generation

TRACE: 基于解剖变化解释的时序放射学用于 grounded X-ray 报告生成

OFM Riaz Rahman Aranya, Kevin Desai

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 推理与问题求解 :language model(abstract)

AI总结 TRACE 是首个结合时序比较、变化分类和空间定位的模型,通过边界框坐标实现对胸片变化的自然语言描述,提升放射学报告生成的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 50%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01693 2026-02-04 cs.RO 50%

GSR: Learning Structured Reasoning for Embodied Manipulation

GSR:为具身操作学习结构化推理

Kewei Hu, Michael Zhang, Wei Ying, Tianhao Liu, Guoqiang Hao, Zimeng Li, Wanchan Yu, Jiajian Jing, Fangwen Chen, Hanwen Kang

机构 * Klmmotion

专题命中 推理与问题求解 :prompting(abstract)

AI总结 GSR通过显式建模世界状态演变,提升具身操作中长周期任务的完成能力和零样本泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 51 篇

2602.02497 2026-02-04 cs.CL cs.AI 90%

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models

STEMVerse: 一种用于大型语言模型中STEM推理的双轴诊断框架

Xuzhao Li, Xuchen Li, Jian Zhao, Shiyu Hu

机构 * NTU(国立科技大学) ZGCA(智能计算协会) ZGCI(智能计算研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 STEMVerse通过双轴诊断框架系统分析LLM在STEM领域的推理能力,揭示其结构失败模式,提供科学推理的深入理解。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02641 2026-02-04 cs.CR cs.AI 89%

Benchmarking Large Language Models for Zero-shot and Few-shot Phishing URL Detection

对零样本和少样本钓鱼网址检测的大型语言模型进行基准测试

Najmul Hasan, Prashanth BusiReddyGari

机构 * University of North Carolina at Pembroke(北卡罗来纳大学帕克分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文通过统一的零样本和少样本提示框架,评估了大型语言模型在钓鱼网址检测中的性能,揭示了不同模型在泛化能力和实用性上的差异。

Comments 9 pages, accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025 LAW Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07077 2026-02-04 cs.CL cs.CY cs.HC 89%

Multi-turn Evaluation of Anthropomorphic Behaviours in Large Language Models

多轮评估大型语言模型中的人格化行为

Lujain Ibrahim, Canfer Akbulut, Rasmi Elasmar, Charvi Rastogi, Minsuk Kahng, Meredith Ringel Morris, Kevin R. McKee, Verena Rieser, Murray Shanahan, Laura Weidinger

机构 * University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出多轮评估方法,评估大型语言模型的人格化行为,发现SOTA模型表现出关系建立和第一人称代词使用等行为,并强调多轮评估对复杂社会现象的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏