arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-25 至 2025-12-25 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 11 篇

2511.14368 2025-12-25 cs.CV cs.CL cs.LG 62%

O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model

O3SLM:开放权重、开放数据和开放词汇草图-语言模型

Rishi Gupta, Mukilan Karuppasamy, Shyam Marjit, Aditay Tripathi, Anirban Chakraborty

机构 * IISc(印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 O3SLM通过构建大规模图像-草图-指令三元组数据集和训练模型,实现了对草图理解和推理的突破性进展。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21238 2025-12-25 cs.SE cs.CR cs.LG 57%

Assessing the Software Security Comprehension of Large Language Models

评估大语言模型的软件安全理解能力

Mohammed Latif Siddiq, Natalie Sekerak, Antonio Karam, Maria Leal, Arvin Islam-Gomes, Joanna C. S. Santos

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究评估了五种大语言模型在软件安全方面的认知能力,发现其在低阶任务表现良好,但在高阶任务如推理和系统设计上存在显著不足,并识别出51种常见误解模式。

Comments Submitted to Empirical Software Engineering (EMSE) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21127 2025-12-25 cs.AI 57%

A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care

对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估

Oliver Normand, Esther Borsi, Mitch Fruin, Lauren E Walker, Jamie Heagerty, Chris C. Holmes, Anthony J Avery, Iain E Buchan, Harry Coppock

机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) Downing Street(唐宁街10号) Department of Statistics, University of Oxford(统计系,牛津大学) Ellison Institute of Technology(埃利森技术研究所) Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) The UK AI Security Institute(英国人工智能安全研究所) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21337 2025-12-25 cs.CV 50%

Beyond Memorization: A Multi-Modal Ordinal Regression Benchmark to Expose Popularity Bias in Vision-Language Models

超越记忆:一个多模态序回归基准以揭示视觉-语言模型中的流行偏差

Li-Zhong Szu-Tu, Ting-Lin Wu, Chia-Jui Chang, He Syu, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出一个多模态序回归基准,揭示视觉-语言模型在流行度上的偏差,通过YearGuessr数据集验证模型在记忆化与未识别对象上的表现差异。

Comments Project page: https://sytwu.github.io/BeyondMemo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20938 2025-12-25 cs.HC 50%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 推理评测 :reasoning(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 50%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20735 2025-12-25 cs.CV 50%

VL4Gaze: Unleashing Vision-Language Models for Gaze Following

VL4Gaze:释放视觉-语言模型用于追随目光

Shijing Wang, Chaoqun Cui, Yaping Huang, Hyung Jin Chang, Yihua Cheng

机构 * Beijing Jiaotong University(北京交通大学) MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院) University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 VL4Gaze通过四个互补任务统一目光理解为VQA问题,系统评估VLMs在目光解读上的表现,揭示了针对性多任务监督对提升VLMs目光理解能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 4 篇

2512.20848 2025-12-25 cs.CL cs.AI cs.LG 82%

Nemotron 3 Nano: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Nano:开放、高效专家混合混合Mamba-Transformer模型用于代理推理

NVIDIA, :, Aaron Blakeman, Aaron Grattafiori, Aarti Basant, Abhibha Gupta, Abhinav Khattar, Adi Renduchintala, Aditya Vavre, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Aleksandr Shaposhnikov, Alex Kondratenko, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alisa Liu, Amelia Barton, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Amy Shen, Anahita Bhiwandiwalla, Andrew Tao, Ann Guan, Anubhav Mandarwal, Arham Mehta, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asma Kuriparambil Thekkumpate, Ayush Dattagupta, Banghua Zhu, Bardiya Sadeghi, Barnaby Simkin, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bita Darvish Rouhani, Boris Ginsburg, Brandon Norick, Brandon Soubasis, Branislav Kisacanin, Brian Yu, Bryan Catanzaro, Carlo del Mundo, Chantal Hwang, Charles Wang, Cheng-Ping Hsieh, Chenghao Zhang, Chenhan Yu, Chetan Mungekar, Chintan Patel, Chris Alexiuk, Christopher Parisien, Collin Neale, Damon Mosk-Aoyama, Dan Su, Dane Corneil, Daniel Afrimi, Daniel Rohrer, Daniel Serebrenik, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, Deepak Narayanan, Dhruv Nathawani, Dima Rekesh, Dina Yared, Divyanshu Kakwani, Dong Ahn, Duncan Riach, Dusan Stosic, Edgar Minasyan, Edward Lin, Eileen Long, Eileen Peters Long, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Tramel, Erick Galinkin, Erik Pounds, Evan Briones, Evelina Bakhturina, Faisal Ladhak, Fay Wang, Fei Jia, Felipe Soares, Feng Chen, Ferenc Galko, Frankie Siino, Gal Hubara Agam, Ganesh Ajjanagadde, Gantavya Bhatt, Gargi Prasad, George Armstrong, Gerald Shen, Gorkem Batmaz, Grigor Nalbandyan, Haifeng Qian, Harsh Sharma, Hayley Ross, Helen Ngo, Herman Sahota, Hexin Wang, Himanshu Soni, Hiren Upadhyay, Huizi Mao, Huy C Nguyen, Huy Q Nguyen, Iain Cunningham, Ido Shahaf, Igor Gitman, Ilya Loshchilov, Ivan Moshkov, Izzy Putterman, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jian Zhang, Jiaqi Zeng, Jie Lou, Jimmy Zhang, Jining Huang, Joey Conway, Joey Guman, John Kamalu, Johnny Greco, Jonathan Cohen, Joseph Jennings, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kai Xu, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khushi Bhardwaj, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Lawrence McAfee, Laya Sleiman, Leon Derczynski, Li Ding, Lucas Liebenwein, Luis Vega, Maanu Grover, Maarten Van Segbroeck, Maer Rodrigues de Melo, Makesh Narsimhan Sreedhar, Manoj Kilaru, Maor Ashkenazi, Marc Romeijn, Mark Cai, Markus Kliegl, Maryam Moosaei, Matvei Novikov, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Meredith Price, Michael Boone, Michael Evans, Miguel Martinez, Mike Chrzanowski, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Natalie Hereth, Nave Assaf, Negar Habibi, Neta Zmora, Netanel Haber, Nicola Sessions, Nidhi Bhatia, Nikhil Jukar, Nikki Pope, Nikolai Ludwig, Nima Tajbakhsh, Nirmal Juluru, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Ouye Xie, Parth Chadha, Pasha Shamis, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pinky Xu, Piotr Januszewski, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Qing Miao, Rabeeh Karimi Mahabadi, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Rich Harang, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Ritika Borkar, Ritu Gala, Riyad Islam, Roger Waleffe, Rohit Watve, Roi Koren, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Timbrook, Sadegh Mahdavi, Sahil Modi, Samuel Kriman, Sanjay Kariyappa, Sanjeev Satheesh, Saori Kaji, Satish Pasumarthi, Sean Narentharen, Sean Narenthiran, Seonmyeong Bak, Sergey Kashirsky, Seth Poulos, Shahar Mor, Shanmugam Ramasamy, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Shelby Thomas, Shiqing Fan, Shreya Gopal, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Siddharth Singh, Simeng Sun, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Stefania Alborghetti, Stephen Ge, Sugam Dipak Devare, Sumeet Kumar Barua, Suseella Panguluri, Suyog Gupta, Sweta Priyadarshi, Syeda Nahida Akter, Tan Bui, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tijmen Blankevoort, Tom Balough, Tomer Asida, Tomer Bar Natan, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Vahid Noroozi, Venkat Srinivasan, Venmugil Elango, Vijay Korthikanti, Vitaly Kurin, Vitaly Lavrukhin, Wanli Jiang, Wasi Uddin Ahmad, Wei Du, Wei Ping, Wenfei Zhou, Will Jennings, William Zhang, Wojciech Prazuch, Xiaowei Ren, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Yoshi Subara, Yoshi Suhara, Yubo Gao, Zach Moshe, Zhen Dong, Zihan Liu, Zijia Chen, Zijie Yan

机构 * NVIDIA

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nemotron 3 Nano是一种高效混合Mamba-Transformer模型,通过预训练和微调在代理推理任务中实现更高准确性和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21280 2025-12-25 cs.CL cs.AI 81%

SMART SLM: Structured Memory and Reasoning Transformer, A Small Language Model for Accurate Document Assistance

SMART SLM:结构记忆与推理变换器,一种用于准确文档辅助的小语言模型

Divij Dudeja, Mayukha Pal

机构 * ABB Ability Innovation Center(ABB能力创新中心) Indian Institute of Information Technology(印度信息科技学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SMART SLM通过结构化记忆与推理变换器,提升工程文档处理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00617 2025-12-25 cs.CL cs.AI 62%

ART: Adaptive Response Tuning Framework -- A Multi-Agent Tournament-Based Approach to LLM Response Optimization

ART:自适应响应调节框架——基于多智能体竞赛的LLM响应优化方法

Omer Jauhar Khan

机构 * Department of Computer Science(计算机科学系) National University of Computer and Emerging Sciences (FAST-NUCES)(计算机与新兴科学国立大学(FAST-NUCES))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ART通过多智能体竞赛机制优化LLM响应,提升准确性和一致性,实现8.4%的质量提升和R²超过0.96的收敛效果。

Comments 14 pages, 11 figures, 5 tables. IEEE conference-style paper with appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21333 2025-12-25 cs.CV 50%

Fast SAM2 with Text-Driven Token Pruning

快速SAM2与文本驱动的标记剪枝

Avilasha Mandal, Chaoning Zhang, Fachrina Dewi Puspitasari, Xudong Wang, Jiaquan Zhang, Caiyan Qin, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Computer Science and Engineering, Indian Institute of Technology, Delhi(印度理工学院德里分校计算机科学与工程系) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出文本驱动的标记剪枝方法,提升SAM2视频分割效率,实现推理速度提升42.50%和内存使用降低37.41%。

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏