arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-14 至 2026-01-14 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 9 篇

2601.08511 2026-01-14 cs.CL cs.CR cs.LG 86%

STAR: Detecting Inference-time Backdoors in LLM Reasoning via State-Transition Amplification Ratio

STAR: 通过状态转移放大比率检测推理时后门

Seong-Gyu Park, Sohee Park, Jisu Lee, Hyunsik Na, Daeseon Choi

机构 * Department of Software, Soongsil University(软件系,顺斯大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 STAR通过分析输出概率变化检测推理时后门,利用状态转移放大比率和CUSUM算法实现高效率和高准确率的后门检测。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08734 2026-01-14 cs.SE cs.AI 83%

TerraFormer: Automated Infrastructure-as-Code with LLMs Fine-Tuned via Policy-Guided Verifier Feedback

TerraFormer:基于LLM的自动化基础设施即代码生成与变异框架

Prithwish Jana, Sam Davidson, Bhavana Bhasker, Andrey Kan, Anoop Deoras, Laurent Callot

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon Web Services(亚马逊网络服务)

专题命中 测试时计算 :verifier(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 TerraFormer通过结合监督微调与验证器引导强化学习,提升LLM生成IaC的准确性与合规性,实现更高的正确率和安全性。

Comments The paper has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE 2026), Rio de Janeiro, Brazil, April 12-18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17627 2026-01-14 cs.CL cs.AI 81%

The Evolution of Thought: Tracking LLM Overthinking via Reasoning Dynamics Analysis

思维的演变:通过推理动态分析追踪LLM过度思考

Zihao Wei, Liang Pang, Jiahao Liu, Wenjie Shi, Jingcheng Deng, Shicheng Xu, Zenghao Duan, Fei Sun, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety,Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过分析推理动态,提出RCPD方法以识别LLM推理完成点,减少token使用量同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20315 2026-01-14 cs.CL cs.AI 76%

Arctic-Text2SQL-R1: Simple Rewards, Strong Reasoning in Text-to-SQL

Arctic-Text2SQL-R1: 简单奖励,强推理的文本到SQL

Zhewei Yao, Guoheng Sun, Lukasz Borchmann, Gaurav Nuti, Zheyu Shen, Minghang Deng, Bohan Zhai, Hao Zhang, Ang Li, Yuxiong He

机构 * Snowflake AI Research(Snowflake AI研究院) University of Maryland(马里兰大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI

AI总结 Arctic-Text2SQL-R1通过简单奖励机制和强化学习框架,在文本到SQL任务中实现高准确率和高效性,优于现有大型模型。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06224 2026-01-14 cs.CV 67%

Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization

在所见之地接地:通过标题反馈、多样性感知采样和冲突正则化实现抗幻觉的MLLMs

Miao Pan, Wangjie Gan, Jintao Chen, Wenqi Zhang, Bing Sun, Jianwei Yin, Xuhong Zhang

专题命中 测试时计算 :reasoning(abstract);planning(abstract)

AI总结 本文提出抗幻觉的MLLMs方法,通过标题反馈、多样性感知采样和冲突正则化减少幻觉,提升推理准确性。

Comments AAAI-2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08302 2026-01-14 cs.CL cs.AI 62%

Enhancing Sentiment Classification and Irony Detection in Large Language Models through Advanced Prompt Engineering Techniques

通过高级提示工程技术增强大型语言模型的情感分类和讽刺检测

Marvin Schmitt, Anne Schwerk, Sebastian Lempert

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过高级提示工程技术提升大型语言模型在情感分类和讽刺检测中的性能,发现不同提示策略对不同模型和任务效果显著。

Comments 21 pages, 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26167 2026-01-14 cs.AI cs.CL 62%

ToolRM: Towards Agentic Tool-Use Reward Modeling

ToolRM: 向代理工具使用奖励建模迈进

Renhao Li, Jianhong Tu, Yang Su, Yantao Liu, Fei Huang, Hamid Alinejad-Rokny, Derek F. Wong, Junyang Lin, Min Yang

机构 * University of Macau(澳门大学) Qwen Team, Alibaba Inc.(阿里云Qwen团队) UNSW Sydney(新南威尔士大学悉尼分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 ToolRM通过构建高质量偏好数据集和基准,提升代理AI在工具调用任务中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15793 2026-01-14 cs.CL cs.LG 62%

Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data

以格式为先:量化和分析LLM在异构数据中的偏见

Jiacheng Liu, Mayi Xu, Qiankun Pi, Wenli Li, Ming Zhong, Yuanyuan Zhu, Mengchi Liu, Tieyun Qian

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过三阶段分析,揭示了LLM在处理异构数据时的格式偏见问题,提出通过数据预处理、推理干预和平衡训练语料库来减少偏见的方法。

Comments Accepted by AAAI 2026, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 50%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏