arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-06 至 2026-02-06 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2602.05385 2026-02-06 cs.CL 89%

IESR:Efficient MCTS-Based Modular Reasoning for Text-to-SQL with Large Language Models

IESR:基于MCTS的高效模块化推理用于文本到SQL with大型语言模型

Tao Liu, Jiafan Lu, Bohan Yu, Pengcheng Wu, Liu Haixin, Guoyu Xu, Li Xiangheng, Lixiao Li, Jiaming Hou, Zhao Shijun, Xinglin Lyu, Kunli Zhang, Yuxiang Jia, Hongyin Zan

机构 * Zhengzhou University(郑州大学) Tianjin University(天津大学) Zhongshan University(中山大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);SLM(abstract);分类 cs.CL

AI总结 IESR提出一种基于MCTS的高效模块化推理框架,用于文本到SQL任务,通过信息增强和结构化推理提升复杂查询处理能力。

Comments 25 pages, 16 figures, 8 tables. Hongyin Zan is corresponding author, Jiafan Lu is first co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05279 2026-02-06 cs.AI cs.CR 89%

Hallucination-Resistant Security Planning with a Large Language Model

具备抗幻觉能力的安全规划与大语言模型

Kim Hammar, Tansu Alpcan, Emil Lupu

机构 * The University of Melbourne(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种抗幻觉的安全规划框架,通过迭代循环和上下文学习优化LLM决策,减少恢复时间30%。

Comments Accepted to IEEE/IFIP Network Operations and Management Symposium 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04919 2026-02-06 cs.LG 89%

Gradually Compacting Large Language Models for Reasoning Like a Boiling Frog

逐步压缩大型语言模型以像沸 frog 一样进行推理

Yiran Zhao, Shengyang Zhou, Zijian Wu, Tongyan Hu, Yuhui Xu, Rengan Dou, Kenji Kawaguchi, Shafiq Joty, Junnan Li, Michael Qizhe Shieh

机构 * Salesforce AI Research(Salesforce AI研究部) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出了一种渐进压缩方法,通过剪枝-微调循环逐步减少大型语言模型大小,同时保持推理性能,适用于多种剪枝策略和后期训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21826 2026-02-06 cs.CL 88%

Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models

Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试

Aadi Palnitkar, Mingyang Mao, Nicholas Waytowich, Vinicius G. Goecks, Xiaomin Lin

机构 * University of Maryland, College Park MD, USA(马里兰大学) ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10829 2026-02-06 cs.CV 88%

LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation

LayoutCoT: 解锁大型语言模型在布局生成中的深度推理潜力

Hengyu Shi, Junhao Su, Tianyang Han, Junfeng Luo, Jialin Gao

机构 * Meituan(美团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 LayoutCoT通过结合RAG和CoT技术,利用LLMs的推理能力实现无需训练的高质量布局生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16928 2026-02-06 cs.CR 88%

From Sands to Mansions: Towards Automated Cyberattack Emulation with Classical Planning and Large Language Models

从沙子到豪宅:迈向自动化网络攻击仿真的方法:经典规划与大语言模型

Lingzhi Wang, Zhenyuan Li, Yi Jiang, Zhengkai Wang, Xiangmin Shen, Wei Ruan, Yan Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出Aurora系统,结合经典规划与大语言模型,实现自动化网络攻击仿真,生成大规模数据集并验证其在入侵检测系统中的有效性。

Comments This is the author-accepted version of a paper accepted at the Applied Cryptography and Network Security (ACNS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05544 2026-02-06 cs.AI 87%

Reasoning-guided Collaborative Filtering with Language Models for Explainable Recommendation

基于语言模型的推理引导协同过滤用于可解释推荐

Fahad Anwaar, Adil Mehmood Khan, Muhammad Khalid, Usman Zia, Kezhi Wang

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 RGCF-XRec通过融合推理引导的协同过滤知识与语言模型,实现可解释的序列推荐,提升了推荐性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17406 2026-02-06 cs.AI 87%

Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning

鲁棒答案,脆弱逻辑:在LLM推理中探究解耦假说

Enyi Jiang, Changming Xu, Nischay Singh, Tian Qiu, Gagandeep Singh

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究揭示LLM在面对微小输入扰动时,仍能保持正确答案但推理过程不稳定,提出MATCHA框架以探测解耦假说,发现多步骤和常识任务更易受此影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04773 2026-02-06 cs.CL cs.CY cs.SI 85%

Invisible Walls in Cities: Designing LLM Agent to Predict Urban Segregation Experience with Social Media Content

城市中的隐形墙壁:设计LLM代理以通过社交媒体内容预测城市隔离体验

Bingbing Fan, Lin Chen, Songwei Li, Jian Yuan, Fengli Xu, Pan Hui, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学) Hong Kong University of Science(科学大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于LLM的代理,通过社交媒体内容预测城市隔离体验,利用代码本整合多通道特征,提升预测准确性并促进社会包容性。

Comments 11 pages, 6 figures. This paper has been accepted at The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17767 2026-02-06 cs.CL 85%

Position: The Real Barrier to LLM Agent Usability is Agentic ROI

位置:LLM代理可用性的真正障碍是代理的ROI

Weiwen Liu, Jiarui Qin, Xu Huang, Xingshan Zeng, Yunjia Xi, Jianghao Lin, Chuhan Wu, Yasheng Wang, Lifeng Shang, Ruiming Tang, Defu Lian, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LLM代理可用性的核心问题在于其投资回报率,主张通过Z字型发展路径提升其在日常应用中的可用性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05446 2026-02-06 cs.HC 85%

DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors

通过代理行为分层总结实现基于大语言模型的多代理系统交互诊断:DiLLS

Rui Sheng, Yukun Yang, Chuhan Shi, Yanna Lin, Zixin Chen, Huamin Qu, Furui Cheng

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 DiLLS通过多层行为总结,帮助开发者更高效地诊断和理解基于LLM的多代理系统故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04972 2026-02-06 cs.CY 85%

Learning Context Matters: Measuring and Diagnosing Personalization Gaps in LLM-Based Instructional Design

学习上下文很重要:在基于LLM的教学设计中测量和诊断个性化差距

Johaun Hatchett, Debshila Basu Mallick, Brittany C. Bradford, Richard G. Baraniuk

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种框架,用于测量和诊断学习上下文对基于LLM教学系统的影响,发现提供学习上下文能改善LLM的教学策略,但尚未实现可靠的个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21051 2026-02-06 cs.CL cs.AI cs.CY 84%

Language Models and Logic Programs for Trustworthy Tax Reasoning

语言模型与逻辑程序用于可信的税务推理

William Jurayj, Nils Holzenberger, Benjamin Van Durme

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合语言模型与符号求解器的方法,用于提升税务推理的准确性与经济可行性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08194 2026-02-06 cs.CV 82%

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

GIQ:基于模拟和真实多面体的3D几何推理视觉基础模型基准测试

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

机构 * Rice University(里士大学) The University of Queensland(昆士兰大学)

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)

AI总结 GIQ通过模拟和真实多面体评估视觉基础模型的3D几何推理能力,揭示了现有模型在几何理解上的不足。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04925 2026-02-06 cs.LG cs.AI cs.CL 82%

Internalizing LLM Reasoning via Discovery and Replay of Latent Actions

将LLM推理内化:通过发现和重播潜在动作

Zhenning Shi, Yijia Zhu, Junhan Shi, Xun Zhang, Lei Wang, Congcong Miao

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Fuzhou University(福州大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STIR通过动态潜在轨迹控制实现LLM推理内化,提升准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03493 2026-02-06 cs.LG cs.AI 81%

On Entropy Control in LLM-RL Algorithms

在LLM-RL算法中的熵控制

Han Shen

机构 * Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEnt方法,通过改进的熵控制策略提升LLM-RL算法在数学推理任务中的性能。

Comments Updated with ICLR 2026 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20295 2026-02-06 cs.CL cs.AI cs.LG stat.ML 80%

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

SelfReflect: LLMs能否传达其内部答案分布?

Michael Kirchhof, Luca Füger, Adam Goliński, Eeshan Gunesh Dhekane, Arno Blaas, Seong Joon Oh, Sinead Williamson

机构 * Apple(苹果公司) Independent Researcher(独立研究者) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SelfReflect通过评估LLM内部信念分布与总结之间的信息论距离,发现现代LLM无法有效传达其不确定性,但通过多输出采样可生成忠实的不确定性总结。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05570 2026-02-06 cs.AI 79%

TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?

TangramSR: 视觉-语言模型能否在连续几何空间中推理?

Yikun Zong, Cheston Tan

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 TangramSR通过测试时自我改进框架,结合上下文学习和奖励循环,提升视觉-语言模型在连续几何空间中的推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05552 2026-02-06 cs.RO cs.CV 78%

VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator

VLN-Pilot: 大型视觉-语言模型作为自主室内无人机操作员

Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla

机构 * University Institute for Compute Research(计算研究大学研究所) University of Alicante(阿利坎特大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 VLN-Pilot利用大型视觉-语言模型实现自主室内无人机导航,通过自然语言指令和视觉感知结合,提高飞行任务的自主性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02648 2026-02-06 eess.SY cs.CY cs.GT cs.MA cs.SI cs.SY 78%

Steering the Herd: A Framework for LLM-based Control of Social Learning

引导 herd:一种基于 LLM 的社会学习控制框架

Raghu Arghal, Kevin He, Shirin Saeedi Bidokhti, Saswati Sarkar

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出了一种基于 LLM 的社会学习控制框架,研究信息中介如何通过动态规划和贝叶斯更新影响社会福利和群体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06039 2026-02-06 cs.AI 77%

DyTopo: Dynamic Topology Routing for Multi-Agent Reasoning via Semantic Matching

DyTopo:通过语义匹配实现多智能体推理的动态拓扑路由

Yuxing Lu, Yucheng Hu, Xukai Zhao, Jiuxin Cao

机构 * Peking University, Beijing, China(北京大学) Georgia Institute of Technology, Atlanta, United States(佐治亚理工学院) Southeast University, Location, Country(东南大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DyTopo通过语义匹配实现多智能体推理的动态拓扑路由,提升多轮推理性能并提供可解释的协调轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08641 2026-02-06 cs.AI q-fin.TR 77%

Resisting Manipulative Bots in Meme Coin Copy Trading: A Multi-Agent Approach with Chain-of-Thought Reasoning

抵制操纵机器人在表情包加密货币复制交易中的应用:一种基于多智能体的链式推理方法

Yichen Luo, Yebo Feng, Jiahua Xu, Yang Liu

机构 * UCL, Centre for Blockchain Technologies(伦敦大学区块链技术中心) The University of Hong Kong, FinTech Academy(香港大学金融科技学院) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于多智能体和链式推理的复制交易系统,以抵御操纵机器人,通过多模态大语言模型提升预测准确度和经济表现,实现加密货币投资的稳健收益。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06040 2026-02-06 cs.CV 75%

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

SwimBird: 在混合自回归大语言模型中实现可切换的推理模式

Jintao Tong, Shilin Yan, Hongwei Xue, Xiaojun Tang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Accio Team, Alibaba Group(阿里集团Accio团队)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)

AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。

Comments Project Page: https://accio-lab.github.io/SwimBird

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11361 2026-02-06 cs.PL 75%

Opportunistically Parallel Lambda Calculus

机会性并行λ演算

Stephen Mell, Konstantinos Kallas, Steve Zdancewic, Osbert Bastani

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Opal通过机会性并行λ演算提升脚本语言的执行效率,显著减少外部调用的等待时间,性能优于Python和Rust。

Journal ref Proc. ACM Program. Lang. 9, OOPSLA2, Article 365 (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02276 2026-02-06 cs.LG cs.AI cs.CL q-bio.QM 75%

CellForge: Agentic Design of Virtual Cell Models

CellForge: 虚拟细胞模型的代理设计

Xiangru Tang, Zhuoyun Yu, Jiapeng Chen, Yan Cui, Daniel Shao, Weixu Wang, Fang Wu, Yuchen Zhuang, Wenqi Shi, Zhi Huang, Arman Cohan, Xihong Lin, Fabian Theis, Smita Krishnaswamy, Mark Gerstein

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CellForge通过多代理协作自主设计虚拟细胞模型,生成高竞争力的计算方法,推动计算生物学的自主科学方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05189 2026-02-06 cs.CL cs.HC cs.LG cs.SI 73%

Are Open-Weight LLMs Ready for Social Media Moderation? A Comparative Study on Bluesky

开放权重大语言模型是否准备好用于社交媒体审查?对Bluesky的比较研究

Hsuan-Yu Chou, Wajiha Naveed, Shuyan Zhou, Xiaowei Yang

机构 * Duke University(杜克大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文评估了开放权重LLMs在社交媒体审查中的表现,发现其在敏感性和特异性上与专有模型有较高重叠,并探讨了在不同审查场景下的应用考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05805 2026-02-06 cs.AI 70%

NEX: Neuron Explore-Exploit Scoring for Label-Free Chain-of-Thought Selection and Model Ranking

NEX: 无标签的神经元探索-利用评分用于无标签的思维链选择和模型排名

Kang Chen, Zhuoka Feng, Sihan Zhao, Kai Xiong, Junjie Nian, Yaoning Wang, Changyi Xiao, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NEX通过神经元活动信号实现无标签的思维链选择和模型排名,通过探索与利用的交替阶段提升预测准确性。

Comments 21 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05789 2026-02-06 cs.CV cs.AI 70%

Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation

非自体参照感知器:通过帧实例化解耦非自体参照推理与自体参照视觉先验

Hengyi Wang, Ruiqiang Zhang, Chang Liu, Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science(安徽数字安全重点实验室,科学大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 非自体参照感知器通过帧实例化解耦非自体参照推理与自体参照视觉先验,提升空间推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05176 2026-02-06 cs.CL 70%

Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems

Among Us: 在模型协作系统中衡量并减轻恶意贡献

Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对模型协作系统中的恶意贡献问题,通过实验评估恶意模型的影响,并提出外部监督策略以缓解其影响。

Comments 19 pages, 15 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 70%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏