arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2512.01222 2025-12-09 cs.AI 83%

Unsupervised decoding of encoded reasoning using language model interpretability

使用语言模型可解释性进行无监督解码编码推理

Ching Fang, Samuel Marks

机构 * Goodfire AI Anthropic Cambridge-Boston Alignment Initiative(剑桥-波士顿对齐计划)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究通过微调模型进行加密推理并利用logit lens分析,验证了可解释性技术在解码隐藏推理过程中的有效性,提出了无监督解码方法以提升对AI系统监督能力。

Comments Modifying author contact information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06663 2025-12-09 cs.CV 82%

CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks

CoT4Det:面向感知导向视觉-语言任务的链式思维框架

Yu Qi, Yumeng Zhang, Chenting Gong, Xiao Tan, Weiming Zhang, Wei Zhang, Jingdong Wang

机构 * Baidu Inc.(百度公司)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 CoT4Det通过将感知任务分解为分类、计数和定位三个步骤,提升视觉-语言模型在目标检测等任务中的性能,使mAP从19%提升至33%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20549 2025-12-09 cs.LG cs.AI 81%

MedGR$^2$: Breaking the Data Barrier for Medical Reasoning via Generative Reward Learning

MedGR$^2$: 通过生成奖励学习突破医学推理的数据壁垒

Weihai Zhi, Jiayan Guo, Shangyang Li

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MedGR$^2$通过生成奖励学习解决医学推理中的数据稀缺问题,实现高效训练和泛化,优于现有方法。

Comments 8 pages, 5 figures

Journal ref AAAI'2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07533 2025-12-09 cs.CR cs.AI 79%

VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection

VulnLLM-R:基于代理架构的专用推理LLM用于漏洞检测

Yuzhou Nie, Hongwei Li, Chengquan Guo, Ruizhe Jiang, Zhun Wang, Bo Li, Dawn Song, Wenbo Guo

机构 * Department of Computer Science, University of California, Santa Barbara, CA, USA(加州大学圣芭芭拉分校计算机科学系) Department of Computer Science, University of Chicago, Chicago, IL, USA(芝加哥大学计算机科学系) Department of Electrical Engineering and Computer Sciences, University of California, Berkeley, CA, USA(加州大学伯克利分校电子工程与计算机科学系) Department of Computer Science, University of Illinois Urbana-Champaign, Champaign, IL, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 VulnLLM-R通过专用推理模型和代理架构,在漏洞检测中实现高效准确的AI驱动检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13191 2025-12-09 cs.CL 79%

Grounding Long-Context Reasoning with Contextual Normalization for Retrieval-Augmented Generation

通过上下文归一化增强长上下文推理用于检索增强生成

Jiamin Chen, Yuchen Li, Xinyu Ma, Xinran Chen, Xiaokun Zhang, Shuaiqiang Wang, Chen Ma, Dawei Yin

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过上下文归一化策略提升RAG在长上下文推理中的鲁棒性和稳定性

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08519 2025-12-09 cs.CL 79%

Bridging Relevance and Reasoning: Rationale Distillation in Retrieval-Augmented Generation

弥合相关性与推理:检索增强生成中的推理蒸馏

Pengyue Jia, Derong Xu, Xiaopeng Li, Zhaocheng Du, Xiangyang Li, Yichao Wang, Yuhao Wang, Qidong Liu, Maolin Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 RADIO通过推理提取和基于推理的对齐方法,弥合检索增强生成中重排器与生成器之间的相关性差距。

Comments Accepted to ACL 25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06502 2025-12-09 cs.CE q-bio.QM 78%

Small Language Models Can Use Nuanced Reasoning For Health Science Research Classification: A Microbial-Oncogenesis Case Study

小型语言模型可以用于健康科学研究分类的细致推理:微生物肿瘤发生案例研究

Muhammed Muaaz Dawood, Mohammad Zaid Moonsamy, Kaela Kokkas, Hairong Wang, Robert F. Breiman, Richard Klein, Emmanuel K. Sekyi, Bruce A. Bassett

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文研究小型语言模型在健康科学文献分类中的表现,发现其通过细致推理可达到大型语言模型的性能,但需结合有效提示策略以提高准确性。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07086 2025-12-09 cs.CR cs.AI cs.LG 62%

ThinkTrap: Denial-of-Service Attacks against Black-box LLM Services via Infinite Thinking

ThinkTrap: 通过无限思考对黑盒LLM服务发起拒绝服务攻击

Yunzhe Li, Jianan Wang, Hongzi Zhu, James Lin, Shan Chang, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ThinkTrap是一种针对黑盒LLM服务的新型拒绝服务攻击方法,通过优化输入空间诱导无限生成,以最小token开销降低服务吞吐量甚至导致服务失败。

Comments This version includes the final camera-ready manuscript accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06726 2025-12-09 cs.CV cs.AI cs.CL 62%

The Role of Entropy in Visual Grounding: Analysis and Optimization

熵在视觉定位中的作用:分析与优化

Shuo Li, Jiajun Sun, Zhihao Zhang, Xiaoran Fan, Senjie Jin, Hui Li, Yuming Yang, Junjie Ye, Lixing Shen, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hikvision Research Institute(海康威视研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11473 2025-12-09 cs.AI cs.LG stat.ML 62%

Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety

思维链可监控性:AI安全的新且脆弱的机会

Tomek Korbak, Mikita Balesni, Elizabeth Barnes, Yoshua Bengio, Joe Benton, Joseph Bloom, Mark Chen, Alan Cooney, Allan Dafoe, Anca Dragan, Scott Emmons, Owain Evans, David Farhi, Ryan Greenblatt, Dan Hendrycks, Marius Hobbhahn, Evan Hubinger, Geoffrey Irving, Erik Jenner, Daniel Kokotajlo, Victoria Krakovna, Shane Legg, David Lindner, David Luan, Aleksander Mądry, Julian Michael, Neel Nanda, Dave Orr, Jakub Pachocki, Ethan Perez, Mary Phuong, Fabien Roger, Joshua Saxe, Buck Shlegeris, Martín Soto, Eric Steinberger, Jasmine Wang, Wojciech Zaremba, Bowen Baker, Rohin Shah, Vlad Mikulik

机构 * UK AI Security Institute(英国人工智能安全研究所) Apollo Research(阿波罗研究) METR University of Montreal(蒙特利尔大学) Mila Anthropic OpenAI(开放人工智能研究所) Google DeepMind(谷歌DeepMind) Truthful AI UC Berkeley(伯克利大学) Center for AI Safety(人工智能安全中心) AI Futures Project(人工智能未来项目) Amazon(亚马逊) Scale AI Magic Meta Redwood Research(红木研究)

专题命中 其他推理 :CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了通过监控AI思维链来提升安全性的潜力,指出其脆弱性并呼吁进一步研究和投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21615 2025-12-09 cs.CL cs.AI cs.IR 62%

Refine Medical Diagnosis Using Generation Augmented Retrieval and Clinical Practice Guidelines

通过生成增强检索和临床实践指南提升医学诊断

Wenhao Li, Hongkuan Zhang, Hongwei Zhang, Zhengxu Li, Zengjie Dong, Yafan Chen, Niranjan Bidargaddi, Hong Liu

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出GARMLE-G框架,通过生成增强检索和临床指南整合,提升医学诊断的准确性和临床实用性。

Journal ref Journal of Biomedical and Health Informatics (JBHI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11192 2025-12-09 cs.CL cs.AI 62%

I Learn Better If You Speak My Language: Understanding the Superior Performance of Fine-Tuning Large Language Models with LLM-Generated Responses

我如果能用我的语言说话会学得更好:理解通过微调大型语言模型与LLM生成响应的优越性能

Xuan Ren, Biao Wu, Lingqiao Liu

机构 * University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM生成响应在微调大型语言模型时的优越性能,发现LLM对自身生成响应的熟悉性是提升学习效果的关键因素。

Comments The paper has been accepted to EMNLP 2024 (Main Conference) there is a follow up paper: Efficiently Selecting Response Generation Strategies for Synthetic Data Construction by Self-Aligned Perplexity Note: This is a revised version of arXiv:2402.11192 (v1, submitted 17 Feb 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14861 2025-12-09 cs.AI 57%

LabOS: The AI-XR Co-Scientist That Sees and Works With Humans

LabOS:能够看见并与人类协作的AI-XR共科学家

Le Cong, David Smerkous, Xiaotong Wang, Di Yin, Zaixi Zhang, Ruofan Jin, Yinkai Wang, Michal Gerasimiuk, Ravi K. Dinesh, Alex Smerkous, Lihan Shi, Joy Zheng, Ian Lam, Xuekun Wu, Shilong Liu, Peishan Li, Yi Zhu, Ning Zhao, Meenal Parakh, Simran Serrao, Imran A. Mohammad, Chao-Yeh Chen, Xiufeng Xie, Tiffany Chen, David Weinstein, Greg Barbone, Belgin Caglar, John B. Sunwoo, Fuxin Li, Jia Deng, Joseph C. Wu, Sanfeng Wu, Mengdi Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 LabOS是一种通过多模态感知和增强现实实现人机协作的AI系统,能实时协助科学家进行实验,推动实验室向智能协作环境发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06874 2025-12-09 cs.CL 57%

An Analysis of Large Language Models for Simulating User Responses in Surveys

大型语言模型在模拟调查用户响应中的分析

Ziyun Yu, Yiru Zhou, Chen Zhao, Hongyi Wen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心) New York University(纽约大学)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文分析了大型语言模型在模拟调查用户响应中的表现,提出CLAIMSIM方法以提高响应多样性,但发现模型在处理不同人口特征时存在固有偏见和推理限制。

Comments Accepted to IJCNLP-AACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06464 2025-12-09 cs.CL 57%

Modeling Contextual Passage Utility for Multihop Question Answering

基于多跳问答的上下文段落效用建模

Akriti Jain, Aparna Garimella

机构 * Adobe Research, India(Adobe研究印度)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于上下文依赖的轻量级方法,用于建模多跳问答中段落的效用,以提高重排和问答性能。

Comments Accepted at IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06018 2025-12-09 cs.CY cs.AI 57%

Uncovering Students' Inquiry Patterns in GenAI-Supported Clinical Practice: An Integration of Epistemic Network Analysis and Sequential Pattern Mining

揭示在生成式人工智能支持下的临床实践中的学生探究模式:一种整合认知网络分析和序列模式挖掘的方法

Jiameng Wei, Dinh Dang, Kaixun Yang, Emily Stokes, Amna Mazeh, Angelina Lim, David Wei Dai, Joel Moore, Yizhou Fan, Danijela Gasevic, Dragan Gasevic, Guanliang Chen

机构 * Monash University(墨尔本大学) University College London(伦敦大学学院) Peking University(北京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过整合认知网络分析和序列模式挖掘,揭示学生在GenAI支持下的临床实践中探究模式,发现高绩效者更注重临床相关信息识别,而低绩效者则停留在常规问题验证循环中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12480 2025-12-09 cs.SE cs.AI cs.ET 57%

LLM-Powered Quantum Code Transpilation

基于大语言模型的量子代码编译

Nazanin Siavash, Armin Moin

机构 * Department of Computer Science University of Colorado Colorado Springs (UCCS) United States

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究利用大语言模型实现灵活的量子代码转换,解决跨平台开发中的互操作性问题。

Comments IEEE International Conference on Quantum Computing and Engineering (QCE) 2025 - Extended Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16929 2025-12-09 cs.CV cs.AI 57%

TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment

TEMPLE:通过渐进式预SFT对齐激励视频大语言模型的时序理解

Shicheng Li, Lei Li, Kun Ouyang, Shuhuai Ren, Yuanxin Liu, Yuanxing Zhang, Fuzheng Zhang, Lingpeng Kong, Qi Liu, Xu Sun

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 TEMPLE通过渐进式预SFT对齐策略提升视频大语言模型的时序理解能力,利用直接偏好优化和课程学习增强模型对时间信息的感知。

Comments Accepted to AAAI 2026. Code available at https://github.com/lscpku/TEMPLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07177 2025-12-09 cs.RO 50%

Using Vision-Language Models as Proxies for Social Intelligence in Human-Robot Interaction

利用视觉-语言模型作为社交智能代理在人机交互中的应用

Fanjun Bu, Melina Tsai, Audrey Tjokro, Tapomayukh Bhattacharjee, Jorge Ortiz, Wendy Ju

机构 * Cornell University, Cornell Tech(康奈尔大学,康奈尔科技) Cornell University(康奈尔大学) Rutgers University(罗格斯大学) Cornell Tech, Jacobs Technion Cornell Institute(康奈尔科技,雅各布斯技术学院康奈尔研究所)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出利用视觉-语言模型作为代理,通过轻量级感知检测器触发,实现机器人在人机交互中的社交响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06405 2025-12-09 cs.IR 50%

TOOL4POI: A Tool-Augmented LLM Framework for Next POI Recommendation

TOOL4POI: 一种增强工具的LLM框架用于下一步POI推荐

Dongsheng Wang, Shen Gao, Chengrui Huang, Yuxi Huang, Ruixiang Feng, Shuo Shang

专题命中 其他推理 :reasoning(abstract)

AI总结 Tool4POI通过外部检索和推理提升POI推荐性能,无需微调即可兼容现成LLM,实现对OOH场景的显著改进。

Comments A critical technical error was discovered during our internal review, leading to unreliable experimental results. The issue cannot be resolved, and the paper has also been formally withdrawn from AAAI 2026. We therefore request withdrawal of the arXiv version to maintain scientific accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06577 2025-12-09 cs.IR 50%

Prompt Tuning as User Inherent Profile Inference Machine

提示调优作为用户固有属性推断机器

Yusheng Lu, Zhaocheng Du, Xiangyang Li, Pengyue Jia, Yejing Wang, Weiwen Liu, Yichao Wang, Huifeng Guo, Ruiming Tang, Zhenhua Dong, Yongrui Duan, Xiangyu Zhao

专题命中 其他推理 :reasoning(abstract)

AI总结 UserIP-Tuning通过提示调优推断用户档案,结合因果关系和EM算法减少噪声,提升推荐系统效率与效果。

Comments This paper has been accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01371 2025-12-09 cs.CV 50%

CLIP-UP: CLIP-Based Unanswerable Problem Detection for Visual Question Answering

CLIP-UP: 基于CLIP的视觉问答中不可回答问题检测

Ben Vardi, Oron Nir, Ariel Shamir

专题命中 其他推理 :reasoning(abstract)

AI总结 CLIP-UP通过基于CLIP的相似性度量,为视觉问答模型提供检测不可回答问题的能力,提升模型在不可回答问题上的识别性能。

Comments Revised version. Improvements include support for open-ended VQA and an alternative injection method

详情

展开后加载摘要…

URL PDF HTML 收藏