arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-06 至 2026-02-06 共收录 82 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 14 篇

2602.04944 2026-02-06 eess.IV cs.AI cs.LG 62%

Smart Diagnosis and Early Intervention in PCOS: A Deep Learning Approach to Women's Reproductive Health

PCOS的智能诊断与早期干预:一种深度学习方法用于女性生殖健康

Shayan Abrar, Samura Rahman, Ishrat Jahan Momo, Mahjabin Tasnim Samiha, B. M. Shahria Alam, Mohammad Tahmid Noor, Nishat Tasnim Niloy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度学习的PCOS卵巢超声图像分类系统,利用迁移学习和增强策略实现高准确率的自动诊断,提升医疗图像分析的透明度和实用性。

Comments 6 pages, 12 figures. This is the author's accepted manuscript of a paper accepted for publication in the Proceedings of the 16th International IEEE Conference on Computing, Communication and Networking Technologies (ICCCNT 2025). The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05857 2026-02-06 cs.AI 57%

BABE: Biology Arena BEnchmark

BABE:生物学竞技场基准

Junting Zhou, Jin Chen, Linfeng Hao, Denghui Cao, Zheyu Wang, Qiguang Chen, Chaoyou Fu, Jiaze Chen, Yuchen Wu, Ge Zhang, Mingxuan Wang, Wenhao Huang, Tong Yang

机构 * Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 BABE基准通过评估生物AI系统的实验推理能力,解决现有生物学基准未能评估实验结果与上下文知识整合能力的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05249 2026-02-06 cs.AI 57%

Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents

为在场评估具身智能体而自动产生认知任务

Xinyi He, Ying Yang, Chuanjian Fu, Sihan Guo, Songchun Zhu, Lifeng Fan, Zhenliang Zhang, Yujia Peng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TEA系统,通过动态在场任务生成方法评估具身智能体在未见环境中的能力,揭示模型在基本感知和3D交互方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05110 2026-02-06 cs.AI 57%

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

理解大语言模型评估者行为:一种结构化多评估者框架用于商户风险评估

Liang Wang, Junpeng Wang, Chin-chia Michael Yeh, Yan Zheng, Jiarui Sun, Xiran Fan, Xin Dai, Yujie Fan, Yiwei Cai

机构 * Visa Research(Visa研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结构化多评估者框架,用于评估LLM在商户风险评估中的推理质量,揭示了不同模型的自我评估偏见差异,并通过真实数据验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05891 2026-02-06 cs.SE 50%

When Elo Lies: Hidden Biases in Codeforces-Based Evaluation of Large Language Models

当Elo谎言:基于Codeforces的大型语言模型评估中的隐藏偏见

Shenyu Zheng, Ximing Dong, Xiaoshuang Liu, Gustavo Oliva, Chong Chun Yong, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文研究了基于Codeforces的Elo评分中隐藏的偏见因素,发现提交顺序、比赛难度选择和LLM运行稳定性显著影响评分结果,指出直接比较Elo分数缺乏可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11361 2026-02-06 cs.PL 50%

Opportunistically Parallel Lambda Calculus

机会性并行λ演算

Stephen Mell, Konstantinos Kallas, Steve Zdancewic, Osbert Bastani

专题命中 推理评测 :reasoning(abstract)

AI总结 Opal通过机会性并行λ演算提升脚本语言的执行效率,显著减少外部调用的等待时间,性能优于Python和Rust。

Journal ref Proc. ACM Program. Lang. 9, OOPSLA2, Article 365 (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 16 篇

2601.08641 2026-02-06 cs.AI q-fin.TR 89%

Resisting Manipulative Bots in Meme Coin Copy Trading: A Multi-Agent Approach with Chain-of-Thought Reasoning

抵制操纵机器人在表情包加密货币复制交易中的应用:一种基于多智能体的链式推理方法

Yichen Luo, Yebo Feng, Jiahua Xu, Yang Liu

机构 * UCL, Centre for Blockchain Technologies(伦敦大学区块链技术中心) The University of Hong Kong, FinTech Academy(香港大学金融科技学院) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种基于多智能体和链式推理的复制交易系统,以抵御操纵机器人,通过多模态大语言模型提升预测准确度和经济表现,实现加密货币投资的稳健收益。

Journal ref Proceedings of the ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10829 2026-02-06 cs.CV 85%

LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation

LayoutCoT: 解锁大型语言模型在布局生成中的深度推理潜力

Hengyu Shi, Junhao Su, Tianyang Han, Junfeng Luo, Jialin Gao

机构 * Meituan(美团)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 LayoutCoT通过结合RAG和CoT技术,利用LLMs的推理能力实现无需训练的高质量布局生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21618 2026-02-06 cs.AI cs.CL cs.IR cs.LG 82%

DeepAgent: A General Reasoning Agent with Scalable Toolsets

DeepAgent: 一种具有可扩展工具集的通用推理代理

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Guanting Dong, Jiajie Jin, Yinuo Wang, Hao Wang, Yutao Zhu, Ji-Rong Wen, Yuan Lu, Zhicheng Dou

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DeepAgent通过自主记忆折叠机制和ToolPO强化学习策略,实现高效通用工具使用和长周期交互,优于现有基线方法。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05544 2026-02-06 cs.AI 79%

Reasoning-guided Collaborative Filtering with Language Models for Explainable Recommendation

基于语言模型的推理引导协同过滤用于可解释推荐

Fahad Anwaar, Adil Mehmood Khan, Muhammad Khalid, Usman Zia, Kezhi Wang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 RGCF-XRec通过融合推理引导的协同过滤知识与语言模型,实现可解释的序列推荐,提升了推荐性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04349 2026-02-06 cs.CL cs.AI 79%

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

GTPO和GRPO-S:基于策略熵的token和序列级奖励塑造

Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

机构 * Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTPO和GRPO-S两种算法,通过引入熵权机制实现token和序列级的细粒度奖励塑造,提升大型语言模型在长链推理任务中的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24187 2026-02-06 eess.AS 78%

Reasoning Beyond Majority Vote: An Explainable SpeechLM Framework for Speech Emotion Recognition

超越多数投票的推理:一种可解释的语音语言模型框架用于语音情感识别

Bo-Hao Su, Hui-Ying Shih, Jinchuan Tian, Jiatong Shi, Chi-Chun Lee, Carlos Busso, Shinji Watanabe

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出了一种可解释的语音语言模型框架,通过生成推理任务提升语音情感识别的可解释性,同时保持预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04451 2026-02-06 cs.IR 75%

SDR-CIR: Semantic Debias Retrieval Framework for Training-Free Zero-Shot Composed Image Retrieval

SDR-CIR:一种基于链式推理的语义去偏检索框架用于无训练零样本复合图像检索

Yi Sun, Jinyu Xu, Qing Xie, Jiachen Li, Yanchun Ma, Yongjian Liu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 SDR-CIR通过语义去偏排名方法提升无训练零样本复合图像检索性能。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02276 2026-02-06 cs.LG cs.AI cs.CL q-bio.QM 67%

CellForge: Agentic Design of Virtual Cell Models

CellForge: 虚拟细胞模型的代理设计

Xiangru Tang, Zhuoyun Yu, Jiapeng Chen, Yan Cui, Daniel Shao, Weixu Wang, Fang Wu, Yuchen Zhuang, Wenqi Shi, Zhi Huang, Arman Cohan, Xihong Lin, Fabian Theis, Smita Krishnaswamy, Mark Gerstein

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CellForge通过多代理协作自主设计虚拟细胞模型,生成高竞争力的计算方法,推动计算生物学的自主科学方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05848 2026-02-06 cs.NE cs.AI cs.CL 62%

DARWIN: Dynamic Agentically Rewriting Self-Improving Network

DARWIN: 动态代理式自我改进网络

Henry Jiang

机构 * College of Computing, Georgia Institute of Technology(计算学院、佐治亚理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DARWIN通过进化算法和动态代理机制实现GPT模型的自我改进,实验显示其在FLOPS利用率和困惑度上均有显著提升。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20741 2026-02-06 cs.HC cs.AI cs.CY cs.LG 62%

In defence of post-hoc explanations in medical AI

为医疗AI中的事后解释辩护

Joshua Hatherley, Lauritz Munch, Jens Christian Bjerring

机构 * Center for the Philosophy of AI(哲学人工智能中心) University of Copenhagen(哥本哈根大学) Department of Philosophy and History of Ideas(哲学与思想史系) Aarhus University(奥胡斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文为医疗AI中的事后解释辩护,指出其虽无法完全复制黑盒推理过程,但能提升用户理解、提高临床团队准确性并辅助医生决策。

Journal ref 2026. Hastings Center Report 56(1): 40-46

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05189 2026-02-06 cs.CL cs.HC cs.LG cs.SI 62%

Are Open-Weight LLMs Ready for Social Media Moderation? A Comparative Study on Bluesky

开放权重大语言模型是否准备好用于社交媒体审查?对Bluesky的比较研究

Hsuan-Yu Chou, Wajiha Naveed, Shuyan Zhou, Xiaowei Yang

机构 * Duke University(杜克大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文评估了开放权重LLMs在社交媒体审查中的表现,发现其在敏感性和特异性上与专有模型有较高重叠,并探讨了在不同审查场景下的应用考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05932 2026-02-06 cs.CL 57%

Polyglots or Multitudes? Multilingual LLM Answers to Value-laden Multiple-Choice Questions

多项语言还是多群体?多语言大语言模型对价值导向的选择题的回答

Léo Labat, Etienne Ollion, François Yvon

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) CREST, CNRS, Institut Polytechnique de Paris(CREST、国家科学研究中心、巴黎高等理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究多语言LLM在价值导向选择题中的回答一致性,发现语言影响回答,需进一步探讨偏好微调的作用。

Comments 17 pages, 5 figures (8 pages of references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05708 2026-02-06 cs.DB cs.CL 57%

Cost-Efficient RAG for Entity Matching with LLMs: A Blocking-based Exploration

基于阻塞机制的高效RAG实体匹配方法:一种成本高效的RAG架构

Chuangtao Ma, Zeyu Zhang, Arijit Khan, Sebastian Schelter, Paul Groth

机构 * Aalborg University(奥尔堡大学) University of Amsterdam(阿姆斯特丹大学) Bowling Green State University, USA(布林茅尔州立大学) Aalborg University, Denmark(奥尔堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 CE-RAG4EM通过阻塞机制降低计算开销,实现高效实体匹配,提升运行效率并优化性能与开销的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04773 2026-02-06 cs.CL cs.CY cs.SI 57%

Invisible Walls in Cities: Designing LLM Agent to Predict Urban Segregation Experience with Social Media Content

城市中的隐形墙壁:设计LLM代理以通过社交媒体内容预测城市隔离体验

Bingbing Fan, Lin Chen, Songwei Li, Jian Yuan, Fengli Xu, Pan Hui, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学) Hong Kong University of Science(科学大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于LLM的代理,通过社交媒体内容预测城市隔离体验,利用代码本整合多通道特征,提升预测准确性并促进社会包容性。

Comments 11 pages, 6 figures. This paper has been accepted at The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05176 2026-02-06 cs.CL 57%

Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems

Among Us: 在模型协作系统中衡量并减轻恶意贡献

Ziyuan Yang, Wenxuan Ding, Shangbin Feng, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) New York University(纽约大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对模型协作系统中的恶意贡献问题,通过实验评估恶意模型的影响,并提出外部监督策略以缓解其影响。

Comments 19 pages, 15 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04914 2026-02-06 cond-mat.mtrl-sci 50%

From Literature to Lab: Closed-Loop Advancement of Perovskite Solar Cells via Domain Knowledge Guided LLM

从文献到实验室:通过领域知识引导的LLM实现钙钛矿太阳能电池的闭环进步

Penglei Sun, Shuyan Chen, Xiang Liu, Longhan Zhang, Huajie You, Chang Yan, Yongqi Zhang, Xiaowen Chu, Tong-yi Zhang

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出通过领域知识引导的LLM框架,实现钙钛矿太阳能电池的闭环进步,自主设计出高效配方并接近世界纪录。

详情

展开后加载摘要…

URL PDF HTML 收藏