arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-26 至 2025-11-26 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2511.20573 2025-11-26 cs.CV 50%

VQ-VA World: Towards High-Quality Visual Question-Visual Answering

VQ-VA世界:迈向高质量的视觉问题-视觉回答

Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi

专题命中 推理评测 :reasoning(abstract)

AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19477 2025-11-26 cs.SE 50%

Building Browser Agents: Architecture, Security, and Practical Solutions

构建浏览器代理:架构、安全与实用解决方案

Aram Vardanyan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出通过专用工具和编程约束构建安全浏览器代理,实现85%的成功率。

Comments 30 pages, 22 figures. Production architecture and benchmark evaluation of browser agents

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2505.23575 2025-11-26 cs.AI cs.LG 90%

CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring

CoT红手:链式推理监控的压力测试

Benjamin Arnav, Pablo Bernabeu-Pérez, Nathan Helm-Burger, Tim Kostolansky, Hannes Whittingham, Mary Phuong

机构 * LASR Labs(语言与语音研究实验室)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种混合协议,通过结合模型推理和行动评分,提升链式推理监控在检测有害行为方面的性能。

Comments To be published in the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19557 2025-11-26 cs.CV cs.AI cs.LG 86%

Think First, Assign Next (ThiFAN-VQA): A Two-stage Chain-of-Thought Framework for Post-Disaster Damage Assessment

先思后定(ThiFAN-VQA):一种用于灾后损害评估的两阶段链式思考框架

Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 ThiFAN-VQA通过两阶段推理框架提升灾后损害评估的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02025 2025-11-26 cs.SE 75%

SAFE: Harnessing LLM for Scenario-Driven ADS Testing from Multimodal Crash Data

SAFE: 借助LLM从多模态碰撞数据中驱动场景的ADS测试

Siwei Luo, Yang Zhang, Yao Deng, Linfeng Liang, Xi Zheng

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 SAFE通过多模态提取和LLM技术,提升从碰撞数据中重建真实场景和检测安全违规的能力,实现高准确率和高效生成。

Comments The paper has been accepted for publication in the proceedings of the IEEE/ACM 48th International Conference on Software Engineering to be held 12-18 April 2026 (ICSE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02143 2025-11-26 stat.AP cs.AI cs.DL cs.LG 62%

How to Find Fantastic AI Papers: Self-Rankings as a Powerful Predictor of Scientific Impact Beyond Peer Review

如何找到非凡的AI论文:自我排名作为预测科学影响的强大指标超越同行评审

Buxin Su, Natalie Collina, Garrett Wen, Didong Li, Kyunghyun Cho, Jianqing Fan, Bingxin Zhao, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) New York University(纽约大学) Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过研究作者自我排名发现其能有效预测AI领域高影响力论文,优于同行评审。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19719 2025-11-26 cs.CL 57%

Can LLMs Faithfully Explain Themselves in Low-Resource Languages? A Case Study on Emotion Detection in Persian

LLMs能否在低资源语言中忠实解释自己?一种波斯语情感检测的案例研究

Mobina Mehrazar, Mohammad Amin Yousefi, Parisa Abolfath Beygi, Behnam Bahrak

机构 * School of Electrical and Computer Engineering College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,德黑兰大学) Computer Science Department, University of British Columbia, Vancouver, Canada(计算机科学系,不列颠哥伦比亚大学) Tehran Institute for Advanced Studies, Khatam University, Tehran, Iran(德黑兰高级研究学院,卡坦大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究评估了LLMs在低资源语言波斯语情感分类中的解释忠实性,发现模型生成的解释与人类判断不一致,强调了改进解释方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08746 2025-11-26 cs.LG 57%

Interpretable Reward Model via Sparse Autoencoder

通过稀疏自编码器的可解释奖励模型

Shuyi Zhang, Wei Shi, Sihang Li, Jiayi Liao, Hengxing Cai, Xiang Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 SARM通过整合预训练稀疏自编码器,提升奖励模型的可解释性和对齐性能。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09738 2025-11-26 cs.LG 57%

Towards Multimodal Graph Large Language Model

迈向多模态图大规模语言模型

Xin Wang, Zeyang Zhang, Linxin Xiao, Haibo Chen, Chendi Ge, Wenwu Zhu

机构 * Department of Computer Science and Technology(计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出多模态图大规模语言模型(MG-LLM),旨在统一和泛化多模态图数据和任务,通过统一空间、多任务处理、上下文学习等五个核心特性,推动多模态图学习的发展。

Comments 4 figures, 2 tables

Journal ref Science China Information Sciences (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11177 2025-11-26 cs.CV 50%

Viper-F1: Fast and Fine-Grained Multimodal Understanding with Cross-Modal State-Space Modulation

Viper-F1:基于交叉模态状态空间调制的高效细粒度多模态理解

Quoc-Huy Trinh

专题命中 其他推理 :reasoning(abstract)

AI总结 Viper-F1通过引入高效液态状态空间动力学和令牌-网格相关模块,实现了高效细粒度多模态理解。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20773 2025-11-26 cs.IR 50%

Adaptive Candidate Retrieval with Dynamic Knowledge Graph Construction for Cold-Start Recommendation

基于动态知识图谱构建的自适应候选检索用于冷启动推荐

Wooseong Yang, Weizhi Zhang, Yuqing Liu, Yuwei Han, Yu Wang, Junhyun Lee, Philip S. Yu

专题命中 其他推理 :reasoning(abstract)

AI总结 ColdRAG通过动态构建知识图谱和LLM引导的多跳推理,提升冷启动推荐性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏