arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2511.00846 2025-12-29 cs.CV cs.AI 57%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10436 2025-12-29 cs.CL 57%

RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment

RefactorCoderQA: 评估LLMs在云和边缘部署中多领域编程问题解决方案的基准测试

Shadikur Rahman, Aroosa Hameed, Gautam Srivastava, Syed Muhammad Danish

机构 * York University and Algoma University(约克大学和阿尔戈马大学) Algoma University(阿尔戈马大学) Department of Systems and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学) Department of Math and Computer Science, Brandon University(数学与计算机科学系,布兰登大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RefactorCoderQA通过云-边缘协作架构和RefactorCoder-MoE模型,在多领域编程任务中提升LLMs的性能,准确率达76.84%。

Comments 12 pages, 5 figures, Submitted to IEEE Transactions on Services Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21625 2025-12-29 cs.CL 57%

Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards

重新思考强化学习中的样本极性与可验证奖励

Xinyu Tang, Yuliang Zhan, Zhixun Li, Wayne Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出A3PO方法,通过自适应非对称令牌级别优势塑造,提升强化学习中样本极性对推理能力的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21373 2025-12-29 cs.SE cs.AI cs.PL 57%

AInsteinBench: Benchmarking Coding Agents on Scientific Repositories

AInsteinBench:在科学仓库中评估编码代理的基准测试

Titouan Duston, Shuo Xin, Yang Sun, Daoguang Zan, Aoyan Li, Shulin Xin, Kai Shen, Yixiao Chen, Qiming Sun, Ge Zhang, Jiashuo Liu, Huan Zhou, Jingkai Liu, Zhichen Pu, Yuanheng Wang, Bo-Xuan Ge, Xin Tong, Fei Ye, Zhi-Chao Zhao, Wen-Biao Han, Zhoujian Cao, Yueran Zhao, Weiluo Ren, Qingshen Long, Yuxiao Liu, Anni Huang, Yidi Du, Yuanyuan Rong, Jiahao Peng

机构 * Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AInsteinBench通过评估大型语言模型在科学计算开发中的能力,提供了一个基于真实科研软件生态系统的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21238 2025-12-25 cs.SE cs.CR cs.LG 57%

Assessing the Software Security Comprehension of Large Language Models

评估大语言模型的软件安全理解能力

Mohammed Latif Siddiq, Natalie Sekerak, Antonio Karam, Maria Leal, Arvin Islam-Gomes, Joanna C. S. Santos

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究评估了五种大语言模型在软件安全方面的认知能力,发现其在低阶任务表现良好,但在高阶任务如推理和系统设计上存在显著不足,并识别出51种常见误解模式。

Comments Submitted to Empirical Software Engineering (EMSE) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21127 2025-12-25 cs.AI 57%

A Real-World Evaluation of LLM Medication Safety Reviews in NHS Primary Care

对NHS初级医疗中基于LLM的药物安全审查系统的真实世界评估

Oliver Normand, Esther Borsi, Mitch Fruin, Lauren E Walker, Jamie Heagerty, Chris C. Holmes, Anthony J Avery, Iain E Buchan, Harry Coppock

机构 * i.AI, Department for Science, Innovation, and Technology(i.AI,科学、创新与技术部门) Centre for Experimental Therapeutics, University of Liverpool(实验治疗中心,利物浦大学) Civic Health Innovation Labs, University of Liverpool(公民健康创新实验室,利物浦大学) Downing Street(唐宁街10号) Department of Statistics, University of Oxford(统计系,牛津大学) Ellison Institute of Technology(埃利森技术研究所) Centre for Academic Primary Care, University of Nottingham(学术初级护理中心,诺丁汉大学) The UK AI Security Institute(英国人工智能安全研究所) Department of Computing, Imperial College London(计算系,伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估了基于LLM的药物安全审查系统在真实临床数据中的表现,揭示了其在不同复杂性下的失败模式,强调了上下文推理的重要性及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19992 2025-12-24 cs.AI cs.CY 57%

S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test

S$^3$IT:一种用于空间情境社交智能测试的基准

Zhe Sun, Xueyuan Yang, Yujie Lu, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19537 2025-12-23 cs.CL 57%

Event Extraction in Large Language Model

大规模语言模型中的事件提取

Bobo Li, Xudong Han, Jiang Liu, Yuzhe Ding, Liqiang Jing, Zhaoqi Zhang, Jinheng Li, Xinya Du, Fei Li, Meishan Zhang, Min Zhang, Aixin Sun, Philip S. Yu, Hao Fei

机构 * National University of Singapore(新加坡国立大学) University of Sussex(苏塞克斯大学) Wuhan University(武汉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了大规模语言模型中事件提取的系统组件,提出通过事件方案、结构和存储提升事件处理的可靠性与智能体准备性。

Comments 38 pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19350 2025-12-23 cs.AI 57%

PENDULUM: A Benchmark for Assessing Sycophancy in Multimodal Large Language Models

PENDULUM: 一个用于评估多模态大语言模型顺从性的基准

A. B. M. Ashikur Rahman, Saeed Anwar, Muhammad Usman, Irfan Ahmad, Ajmal Mian

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PENDULUM基准通过2000个视觉问答对评估多模态大语言模型的顺从性,揭示模型在顺从性和幻觉行为上的显著差异,提出新度量标准以提升模型的事实一致性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18658 2025-12-23 cs.CL 57%

Does It Tie Out? Towards Autonomous Legal Agents in Venture Capital

是否会平局?迈向风险投资领域的自主法律代理

Pierre Colombo, Malik Boudiaf, Allyn Sweet, Michael Desa, Hongxi Wang, Kevin Candra, Syméon del Marmol

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种世界模型架构,旨在实现风险投资领域资本表核对的自动化,为法律智能提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17145 2025-12-23 cs.AI cs.IT math.IT 57%

Solomonoff-Inspired Hypothesis Ranking with LLMs for Prediction Under Uncertainty

受索洛蒙效应启发的基于大语言模型的假设排名用于预测中的不确定性

Josh Barber, Rourke Young, Cameron Coombe, Will Browne

机构 * Queensland University of Technology (QUT)(昆士兰理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的索洛蒙启发方法,通过简洁性和预测适应性加权假设,以提高在不确定性下的预测可靠性。

Comments 10 pages, ACRA 2025, Submitted, Accepted and Presented

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08398 2025-12-23 cs.IR cs.CL 57%

Ontology-Based Knowledge Graph Framework for Industrial Standard Documents via Hierarchical and Propositional Structuring

基于本体的知识图谱框架:通过层次化和命题化结构构建工业标准文档

Jiin Park, Hyuna Jeon, Yoonseo Lee, Jisu Hong, Misuk Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于本体的知识图谱框架,通过层次化和命题化结构构建工业标准文档,提升问答性能和领域知识表示能力。

Comments The authors have identified significant technical errors in the paper that invalidate the current findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13524 2025-12-23 cs.AI cs.HC 57%

FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI

FreeAskWorld: 一种面向人类的交互式闭环模拟器用于具身人工智能

Yuhang Peng, Yizhou Pan, Xinning He, Jihaoyu Yang, Xinyu Yin, Han Wang, Xiaoji Zheng, Chao Gao, Jiangtao Gong

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 FreeAskWorld通过整合大语言模型和交互式闭环模拟,提升具身人工智能在复杂社会行为和自然交互中的表现。

Comments 9 pages, 4 figures

Journal ref AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14972 2025-12-23 cs.CL 57%

Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies

多模态文化安全:评估框架与对齐策略

Haoyi Qiu, Kung-Hsiang Huang, Ruichen Zheng, Jiao Sun, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17677 2025-12-22 cs.CL 57%

Toward Ethical AI Through Bayesian Uncertainty in Neural Question Answering

通过贝叶斯不确定性实现伦理AI:神经问答中的贝叶斯推理

Riccardo Di Sipio

机构 * Dayforce

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过贝叶斯不确定性方法改进神经问答系统的可解释性和伦理性,对比拉普拉斯近似与MAP估计以提升不确定性校准能力。

Comments 14 pages, 8 figures,

Journal ref AI Ethics 6, 38 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17319 2025-12-22 cs.CV cs.AI cs.MM 57%

A Benchmark for Ultra-High-Resolution Remote Sensing MLLMs

超高分辨率遥感多模态大语言模型基准

Yunkai Dang, Meiyi Zhu, Donghao Wang, Yizhuo Zhang, Jiacheng Yang, Qi Fan, Yuekun Yang, Wenbin Li, Feng Miao, Yang Gao

机构 * School of Artificial Intelligence Science and Technology, Nanjing University(人工智能科学与技术学院,南京大学) School of Physics, Nanjing University(物理学院,南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RSHR-Bench,一个超高分辨率遥感多模态大语言模型基准,通过高分辨率图像和多样化任务评估视觉理解与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 57%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16750 2025-12-19 cs.HC cs.AI 57%

Plausibility as Failure: How LLMs and Humans Co-Construct Epistemic Error

可能性作为失败:大语言模型与人类如何共同构建知识错误

Claudia Vale Oliveira, Nelson Zagalo, Filipe Silva, Anabela Brandao, Syeda Faryal Hussain Khurrum, Joaquim Santos

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型与人类在知识错误中的共同构建过程,发现人类判断受模型生成可能性和解释快捷方式影响,导致错误被误判为可信。

Comments 19 pages, 2 tables, 77 references, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19509 2025-12-19 cs.CL eess.AS 57%

Which Evaluation for Which Model? A Taxonomy for Speech Model Assessment

哪种模型用哪种评估?语音模型评估的分类

Maureen de Seyssel, Eeshan Gunesh Dhekane

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出语音模型评估的分类体系,通过三个正交轴定义评估方面、模型能力及任务要求,帮助选择和优化评估方法。

Comments 57 pages (26 main, 25 appendix, 6 references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16030 2025-12-19 cs.AI 57%

Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets

大型语言模型知道它们不知道什么吗?Kalshibench:通过预测市场评估知识校准的新基准

Lukas Nel

机构 * Lotus AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现大型语言模型普遍存在过度自信问题,表明知识校准需要专门发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 57%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17361 2025-12-19 cs.LG cs.CR 57%

Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias

相信我,我知道这个函数:利用偏见进行LLM静态分析的劫持

Shir Bernstein, David Beste, Daniel Ayzenshteyn, Lea Schonherr, Yisroel Mirsky

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用LLM的抽象偏见进行代码分析的攻击方法,通过注入熟悉模式攻击来劫持LLM的控制流,揭示了LLM在静态分析中的安全漏洞。

Journal ref The Network and Distributed System Security Symposium (NDSS). 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09670 2025-12-19 cs.AI 57%

MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement

MEML-GRPO:异构多专家互学习用于强化学习可验证奖励的进步

Weitao Jia, Jinghui Lu, Haiyang Yu, Siqi Wang, Guozhi Tang, An-Lan Wang, Weijie Yin, Dingkang Yang, Yuxiang Nie, Bin Shan, Hao Feng, Irene Li, Kun Yang, Han Wang, Jingqun Tang, Teng Fu, Changhong Jin, Chao Feng, Xiaohui Lv, Can Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MEML-GRPO通过异构多专家互学习机制,提升RLVR在复杂任务中的推理能力,实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15699 2025-12-18 cs.LG cs.SE 57%

FrontierCS: Evolving Challenges for Evolving Intelligence

FrontierCS: 蒸馏智能面临的挑战

Qiuyang Mang, Wenhao Chai, Zhifei Li, Huanzhi Mao, Shang Zhou, Alexander Du, Hanchen Li, Shu Liu, Edwin Chen, Yichuan Wang, Xieting Chu, Zerui Cheng, Yuan Xu, Tian Xia, Zirui Wang, Tianneng Shi, Jianzhu Yao, Yilong Zhao, Qizheng Zhang, Charlie Ruan, Zeyu Shen, Kaiyuan Liu, Runyuan He, Dong Xing, Zerui Li, Zirong Zeng, Yige Jiang, Lufeng Cheng, Ziyi Zhao, Youran Sun, Wesley Zheng, Meiyuwang Zhang, Ruyi Ji, Xuechang Tu, Zihan Zheng, Zexing Chen, Kangyang Zhou, Zhaozi Wang, Jingbang Chen, Aleksandra Korolova, Peter Henderson, Pramod Viswanath, Vijay Ganesh, Saining Xie, Zhuang Liu, Dawn Song, Sewon Min, Ion Stoica, Joseph E. Gonzalez, Jingbo Shang, Alvin Cheung

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) UCSD(加州大学圣迭戈分校) X-camp Academy(X-camp学院) Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Nanyang Technological University(南洋理工大学) University of Toronto(多伦多大学) UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) New York University(纽约大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 FrontierCS是一个针对未知最优解的计算机科学开放性问题基准测试,旨在评估模型在算法和研究任务中的推理能力,发现现有模型在复杂问题上仍需提升。

Comments Code with instruction: https://github.com/FrontierCS/Frontier-CS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 57%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15033 2025-12-18 cs.AI 57%

Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation

超越准确性:大型语言模型在国际象棋评估中的几何稳定性分析

Xidan Song, Weiqi Wang, Ruifeng Cao, Qingya Hu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出几何稳定性框架,用于评估大型语言模型在国际象棋评估中的几何推理能力,揭示了模型在几何变换下的稳定性差异及性能悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14797 2025-12-18 eess.IV cs.AI cs.CV 57%

Artificial Intelligence for the Assessment of Peritoneal Carcinosis during Diagnostic Laparoscopy for Advanced Ovarian Cancer

人工智能在诊断腹腔镜手术中评估腹膜癌性病变的应用

Riccardo Oliva, Farahdiba Zarin, Alice Zampolini Faustini, Armine Vardazaryan, Andrea Rosati, Vinkle Srivastav, Nunzia Del Villano, Jacques Marescaux, Giovanni Scambia, Pietro Mascagni, Nicolas Padoy, Anna Fagotti

机构 * IRCAD, Research Institute against Digestive Cancer, Strasbourg, France(IRCAD消化道癌症研究机构,法国斯特拉斯堡) University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国) Bioimage Analysis Center, Fondazione Policlinico Universitario A. Gemelli IRCCS, Rome, Italy(生物图像分析中心,意大利罗马)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度学习的AI模型,用于自动评估诊断腹腔镜手术视频中的腹膜癌性病变,提高FS评分的可重复性和临床决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 57%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08743 2025-12-17 cs.AI cs.MA 57%

Single-Agent Scaling Fails Multi-Agent Intelligence: Towards Foundation Models with Native Multi-Agent Intelligence

单智能体扩展无法实现多智能体智能:迈向具有原生多智能体智能的基础模型

Shuyue Hu, Haoyang Yan, Yiqun Zhang, Yang Chen, Dongzhan Zhou, Lei Bai

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文指出单智能体扩展无法实现多智能体智能,提出构建具有原生多智能体智能的基础模型的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11162 2025-12-17 cs.CV cs.LG 57%

VIBE: Can a VLM Read the Room?

VIBE:视觉语言模型能否读懂房间?

Tania Chakraborty, Eylon Caplan, Dan Goldwasser

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。

Comments Findings of EMNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏