arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 162 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 28 篇

2601.17897 2026-01-27 cs.AI 57%

UniCog: Uncovering Cognitive Abilities of LLMs through Latent Mind Space Analysis

UniCog: 通过潜在思维空间分析揭示大语言模型的认知能力

Jiayu Liu, Yinhe Long, Zhenya Huang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 UniCog通过潜在思维空间分析揭示大语言模型的认知能力,提出统一框架并提升推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17542 2026-01-27 cs.AI cs.SE 57%

Cognitive Platform Engineering for Autonomous Cloud Operations

认知平台工程用于自主云操作

Vinoth Punniyamoorthy, Nitin Saksena, Srivenkateswara Reddy Sankiti, Nachiappan Chockalingam, Aswathnarayan Muthukrishnan Kirubakaran, Shiva Kumar Reddy Carimireddy, Durgaraman Maruthavanan

机构 * IEEE Senior Texas USA(IEEE高级工程师,得克萨斯州,美国) Albertsons Companies California USA(Albertsons公司,加利福尼亚州,美国) Cleveland State University Ohio USA(克利夫兰州立大学,俄亥俄州,美国) IEEE Senior Massachusetts USA(IEEE高级工程师,马萨诸塞州,美国) IEEE Senior California USA(IEEE高级工程师,加利福尼亚州,美国)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出认知平台工程,通过整合感知、推理和自主行动,提升云操作的自动化与智能化水平,实现更高效的云环境管理。

Journal ref International Journal of Computer Applications. 187, 72 ( Jan 2026), 17-23

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17530 2026-01-27 cs.CL 57%

Revealing the Truth with ConLLM for Detecting Multi-Modal Deepfakes

用ConLLM揭示真相以检测多模态深度伪造

Gautam Siddharth Kashyap, Harsh Joshi, Niharika Jain, Ebad Shabbir, Jiechao Gao, Nipun Joshi, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Bharati Vidyapeeth’s College Of Engineering(巴里蒂大学工程学院) Vivekananda Institute of Professional Studies (VIPS)(维维kananda专业研究学院) DSEU-Okhla Center for SDGC(SDGC研究中心) Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 ConLLM通过对比学习和大语言模型推理,有效提升多模态深度伪造检测的准确率和泛化能力。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17008 2026-01-27 cs.LG 57%

Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs

Turn-PPO:基于PPO的回合级优势估计以提升代理语言模型中的多回合强化学习

Junbo Li, Peng Zhou, Rui Meng, Meet P. Vadera, Lihong Li, Yang Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出turn-PPO,通过回合级MDP公式化提升多回合强化学习在代理语言模型中的表现,验证其在WebShop和Sokoban数据集上的有效性。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19113 2026-01-27 cs.CL 57%

Argument-Based Consistency in Toxicity Explanations of LLMs

基于论证的一致性:大语言模型毒性解释的评估

Ramaravind Kommiya Mothilal, Joanna Roy, Syed Ishtiaque Ahmed, Shion Guha

机构 * University of Toronto(多伦多大学) trail-ml

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出基于论证的一致性标准,评估大语言模型对毒性的推理能力,发现其在复杂关系下的解释不一致。

Comments 29 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11740 2026-01-27 cs.LG cs.CV 57%

Mitigating Visual Knowledge Forgetting in MLLM Instruction-tuning via Modality-decoupled Gradient Descent

通过模态解耦梯度下降缓解MLLM指令微调中的视觉知识遗忘

Junda Wu, Yuxin Xiong, Xintong Li, Yu Xia, Ruoyu Wang, Yu Wang, Tong Yu, Sungchul Kim, Ryan A. Rossi, Lina Yao, Jingbo Shang, Julian McAuley

机构 * UC San Diego(加州大学圣迭戈分校) University of New South Wales(新南威尔士大学) Adobe Research(Adobe研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出模态解耦梯度下降方法,通过有效秩量化视觉退化并缓解过度压缩,保留预训练视觉知识并提升任务适应能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17084 2026-01-27 physics.chem-ph cs.AI physics.comp-ph 57%

ChemNavigator: Agentic AI Discovery of Design Rules for Organic Photocatalysts

ChemNavigator: 基于代理AI的有机光催化剂设计规则发现

Iman Peivaste, Ahmed Makradi, Salim Belouettar

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学技术研究所) University of Luxembourg(卢森堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ChemNavigator通过代理AI自主发现有机光催化剂设计规则,推导出六个化学基础设计原则,为AI辅助材料发现提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18240 2026-01-27 cs.CV 50%

V-Loop: Visual Logical Loop Verification for Hallucination Detection in Medical Visual Question Answering

V-Loop:用于医学视觉问答中幻觉检测的视觉逻辑循环验证

Mengyuan Jin, Zehui Liao, Yong Xia

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 V-Loop通过双向推理和视觉逻辑循环验证,提升医学视觉问答中幻觉检测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18239 2026-01-27 cs.HC 50%

Probing the Future of Meta-Analysis: Eliciting Design Principles via an Agentic Research IDE

探索元分析的未来:通过代理研究IDE eliciting设计原则

Sizhe Cheng, Feng Liang, Yuhan Wen, Xipei Yu, Yong Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 Research IDE通过'研究作为代码'隐喻,提供一种多代理后端支持的写作环境,通过'假设断点'实现现场验证,提升研究人员的自主权和智力所有权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17627 2026-01-27 cs.SE 50%

Code Change Characteristics and Description Alignment: A Comparative Study of Agentic versus Human Pull Requests

代码变更特征与描述对齐:代理与人类拉取请求的比较研究

Dung Pham, Taher A. Ghaleb

专题命中 其他推理 :reasoning(abstract)

AI总结 研究比较了代理与人类生成的拉取请求在代码变更特征和描述质量上的差异,发现代理在提交级消息质量上表现更好,但在PR级总结上不如人类,揭示了代理在微观精确性与宏观沟通之间的差距。

Comments Accepted at the 23rd International Conference on Mining Software Repositories (MSR '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20844 2026-01-27 cs.MA 50%

TrustResearcher: Automating Knowledge-Grounded and Transparent Research Ideation with Multi-Agent Collaboration

TrustResearcher: 通过多智能体协作实现知识导向且透明的研究构想自动化

Jiawei Zhou, Ruicheng Zhu, Mengshi Chen, Jianwei Wang, Kai Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 TrustResearcher通过多智能体协作实现知识导向且透明的研究构想自动化,提供可配置的智能体和证据一致的构想生成。

Comments Accepted to The Web Conference (WWW) 2026 as a demo paper. 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10978 2026-01-27 cs.IR 50%

Does LLM Focus on the Right Words? Mitigating Context Bias in LLM-based Recommenders

LLM是否聚焦在正确的词语?基于组分布鲁棒优化的推荐系统去偏方法

Bohao Wang, Jiawei Chen, Feng Liu, Changwang Zhang, Jun Wang, Canghong Jin, Chun Chen, Can Wang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出GDRT方法,通过组分布鲁棒优化减轻LLM推荐系统中的上下文偏见,提升推荐准确性和公平性。

Comments Accepted by WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏