arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2606.02522 2026-06-02 cs.CV cs.AI 57%

Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events

Moment-Video: 诊断视频多模态大语言模型在瞬时视觉事件上的时间保真度

Xiaolin Liu, Yilun Zhu, Xiangyu Zhao, Xuehui Wang, Yan Li, Xin Li, Haoyu Cao, Xing Sun, Shaofeng Zhang, Xu Yang, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Southeast University(东南大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出 Moment-Video 基准,通过瞬时视觉事件理解任务诊断视频 MLLMs 的时间保真度,发现最佳模型准确率仅 39.6%,多数开源模型低于 25%。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02458 2026-06-02 cs.AI 57%

Beyond One-shot: AI Agents for Learning in Field Experiments

超越一次性:用于现场实验学习的AI智能体

Junjie Luo, Ritu Agarwal, Gordon Gao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究通过工具增强的智能体AI自动从实验数据中学习并生成新干预措施,在医疗处方消息现场实验中证明其优于人类+聊天机器人方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL 57%

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02282 2026-06-02 cs.AI 57%

POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

POIROT: 在多智能体系统中审讯智能体以进行故障检测

Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal, J. M. Valverde-García, Annemarie F. Laudanski, Álvaro Gutiérrez, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出POIROT协议,利用多智能体系统自身的智能体作为诊断层进行故障检测,在复杂问题、多智能体和复合故障条件下优于单LLM评估基线。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02214 2026-06-02 cs.CL 57%

Do Gender Cues Affect LLM Value Trade-offs? Evidence from a Controlled Decision Benchmark

性别线索是否影响LLM价值权衡?来自受控决策基准的证据

Yangyang Liu, Dong Yu, Pengyuan Liu

机构 * Beijing Language and Culture University(北京语言大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过构建受控基准RVDB,研究性别线索是否导致大语言模型在价值决策中产生系统性翻转,并发现性别效应集中在价值边界模糊和决策严重性高的情境下,且模型自我归因常掩盖性别影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02041 2026-06-02 cs.CL 57%

SentGuard: Sentence-Level Streaming Guardrails for Large Language Models

SentGuard:面向大型语言模型的句子级流式护栏

Jiaqi Yu, Xin Wang, Yixu Wang, Jie Li, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SentGuard,一种与生成并行运行的句子级流式护栏,通过轻量级等待缓冲区将流式令牌分组为句子块并仅释放已验证块,以在低延迟下实现高精度不安全内容检测。

Comments 16 pages, 5 figures, submitted to ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01995 2026-06-02 cs.CL 57%

CARTE: A Benchmark for Mapping Language Model Knowledge Across France

CARTE:法国语言模型知识映射基准

Sarah Almeida Carneiro, Christos Xypolopoulos, Xiao Fei, Yang Zhang, Michalis Vazirgiannis

机构 * École Polytechnique, Institut Polytechnique de Paris(巴黎政治学院) National Technical University of Athens(雅典国家技术大学) Mohamed bin Zayed University of Artificial Intelligence(姆阿扎德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出CARTE基准,通过2431道多选题评估大语言模型在法国13个大区14个主题领域的细粒度区域知识,并引入CARTE-LV子集聚焦语言变异,实验发现模型在区域和规模上存在性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01975 2026-06-02 cs.AI cs.SE 57%

Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks

基于LLM的算法开发:以张量网络收缩顺序优化中LLM使用为例

Fabian Hoppe, Melven Röhrig-Zöllner, Philipp Knechtges

机构 * German Aerospace Center (DLR), Institute of Software Technology, department High-Performance Computing(德国航空航天中心(DLR)软件技术研究所高性能计算部门)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 通过OpenEvolve对张量网络收缩顺序优化的案例研究,探讨了基于LLM的算法开发,重点分析了LLM选择、评估指标和测试实例等设计因素,强调了验证引导的进化编码代理的潜力以及人类科学家在评估、验证和解释方面的重要性与挑战。

Comments Submitted to the proceedings of the deRSE26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01600 2026-06-02 cs.CV cs.CL cs.RO 57%

RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation

RoboTrustBench:机器人操作视频世界模型的可信度基准测试

Huiqiong Li, Jiayu Wang, Zhiting Mei, Anirudha Majumdar, Jingjing Chen, Bin Zhu

机构 * Singapore Management University(新加坡国立管理学院) Fudan University(复旦大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。

Comments Project: https://huiqiongli.github.io/RoboTrustBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01552 2026-06-02 cs.AI 57%

RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

RoleCDE:角色扮演代理中的角色-对齐权衡的基准测试与缓解

Huayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对角色扮演代理在角色特定价值与对齐约束冲突时的决策问题,提出首个基准RoleCDE,通过认知困境场景评估角色-场景基础、价值冲突解决和决策倾向,发现“角色价值解耦”现象,并基于RoleCDE的微调有效缓解该问题。

Comments 23pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01301 2026-06-02 cs.CL 57%

Med-HEAL: Analyzing and Mitigating Hallucinations in Medical LLMs with Hallucination-Aware In-Context Learning

Med-HEAL:通过幻觉感知的上下文学习分析与缓解医学大语言模型中的幻觉

Yiming Liao, Zeno Franco, Jose Eduardo Lizarraga Mazaba, Keke Chen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县) Medical College of Wisconsin(威斯康星医学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出Med-HEAL框架,利用临床数据构建幻觉数据集,并通过自我批评和检索增强上下文学习策略缓解医学大语言模型中的幻觉,实验表明自我批评策略可提升多数模型准确率。

Comments 12 pages, 5 figures. Preprint full version of an accepted ACM-BCB 2026 short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01240 2026-06-02 cs.CL 57%

Efficient RAG with Intent-Aware Retrieval and Semantics-Preserving Chunking

基于意图感知检索与语义保持分块的高效RAG

Fachrina Dewi Puspitasari, Chaoning Zhang, Jiaquan Zhang, Zhicheng Wang, Hafiz Shakeel Ahmad Awan, Rizwan Qureshi, Jewon Lee, Tae-Ho Kim, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Massachusetts General Hospital, Harvard University(哈佛大学马萨诸塞州总医院) Nota AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出InSemRAG框架,通过意图感知检索器和语义保持分块模块,结合迭代检索-检查机制,解决传统RAG的信息不足问题,在多跳和证据敏感任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00987 2026-06-02 cs.CV cs.AI 57%

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

多时相指代分割的开源基准与基线

Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) School of Artificial Intelligence, Optics and Electronics (iOPEN)(人工智能、光学与电子学院) Northwestern Polytechnical University(西北工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出多时相指代分割任务,通过自动化数据构建管道CRAFT-Agent生成首个基准MTRefSeg-21K,并设计两阶段训练的变化感知LVLM框架MTRefSeg-R1,实现优于现有基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00596 2026-06-02 cs.CL 57%

Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities

面向负责任且基于认识论的多语言大语言模型在计算社会科学与人文学科中的应用

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文重新概念化多语言推理大语言模型为解释学工具,提出一个基于理论框架来评估其在社会科学与人文学科研究中的文化对齐、跨语言稳定性和推理忠实性。

Journal ref Proceedings of LLMs4SSH Workshop at LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00515 2026-06-02 cs.RO cs.AI cs.SY eess.SY 57%

PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation

PaCo-VLA: 用于富接触视觉-语言-动作操控的被动屏蔽柔顺先验

Haofan Cao, Zhaoyang Li, Zhichao You, Liang Guo, Tianrui Li

机构 * Southwest Jiaotong University(西南交通大学) University of Leeds(莱斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出PaCo-VLA框架,通过被动屏蔽将VLA模型输出转化为任务级柔顺建议,并利用能量罐和边界检查防止无效预测绕过底层接触物理,实现安全精确的富接触操控。

Comments Under review, code will be available soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00497 2026-06-02 cs.CR cs.CL 57%

"I Strongly Suspect This Website Is a Scam": Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents

“我强烈怀疑这个网站是骗局”:自主网络代理中无防御的PII泄露与检测基准测试

Soham Roy, Sarthakbrata Halder, Arya Bharaty, Vaibhav Bhaskar, Yash Sinha, Dhruv Kumar, Srikant Panda, Murari Mandal

机构 * KIIT Bhubaneshwar(KIIT布巴内什瓦尔) BITS Pilani(比特斯理工学院) Lam Research(拉姆研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过构建包含91个攻击者控制环境和10个良性孪生基线的基准Scammer4U,评估前沿自主网络代理在社交工程攻击下的PII泄露风险,发现关键PII泄露率高达54-93%,并揭示了代理检测到攻击但仍有35.9%概率提交PII的检测-行动差距。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00284 2026-06-02 cs.CL 57%

Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models

参数对齐减轻多语言专家语言模型中的灾难性遗忘

Sanchit Ahuja, Terra Blevins

机构 * Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对多语言持续预训练中的灾难性遗忘问题,提出五种层感知参数对齐策略(硬冻结、软正则化、事后权重恢复和模型合并),在32种训练语言和保留语言上评估,证明参数对齐能有效减少遗忘且语言获取成本低。

Comments 25 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00101 2026-06-02 cs.CV cs.AI 57%

CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

CoCoVideo: 基于商业模型的高质量对比基准用于AI生成视频检测

Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng

机构 * School of Informatics, Xiamen University(厦门大学信息学院) China Academy of Information and Communications Technology(中国信息通信技术研究院) AI Transcend Pte. Ltd.(AI Transcend有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对现有数据集依赖低质量开源模型且商业样本带水印的问题,提出包含13个商业生成器的CoCoVideo-26K对比数据集,并设计结合对比学习与置信门控多模态大语言模型的CoCoDetect检测框架,实现高保真AI生成视频的鲁棒检测。

Comments Accepected by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00051 2026-06-02 cs.CY cs.AI 57%

Business Utility of Large Language Models as Exploratory Data Analysis Agents

大型语言模型作为探索性数据分析代理的商业实用性

Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski, Szymon Betlewski, Cezary Depta, Szymon Janowski, Jarosław Kochanowicz, Jan Kanty Milczek

机构 * deepsense.ai SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) Google(谷歌)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00044 2026-06-02 cs.CY cs.AI 57%

Algorithmic Authority and the Clinical Standard of Care

算法权威与临床护理标准

Aizierjiang Aiersilan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨人工智能在临床医学中引发的算法概率推理与医生经验直觉之间的张力,提出将AI系统视为事实上的医疗监管,并主张通过辩证的护理标准将AI-医生联合体作为单一诊断责任实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21125 2026-06-02 cs.LG 57%

Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation

群体相对策略优化中的优势崩塌:诊断与缓解

Xixiang He, Qiyao Sun, Ao Cheng, Xingming Li, Xuanyu Ji, Hailun Lu, Runke Huang, Qingyong Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对GRPO在可验证奖励强化学习中的优势崩塌问题,提出诊断指标ACR和轻量级扩展方法AVSPO,通过注入虚拟奖励样本减少梯度消失,提升模型推理能力。

Comments Accepted at the International Conference on Machine Learning (ICML 2026). Project page: https://QingyongHu.github.io/AVSPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15229 2026-06-02 cs.SE cs.AI 57%

PBT-Bench: Benchmarking AI Agents on Property-Based Testing

PBT-Bench:基于属性测试的AI智能体基准

Lucas Jing, Xinqi Wang, Liao Zhang, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Beneficial AI Foundation(有益人工智能基金会)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出PBT-Bench基准,包含100个基于属性测试的问题,用于评估AI智能体从文档中推导语义不变量并生成输入策略的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27223 2026-06-02 cs.CV cs.AI 57%

EuraGovExam: A Multilingual Multimodal Benchmark from Real-World Civil Service Exams

EuraGovExam:来自现实世界公务员考试的多语言多模态基准

Jaeseong Kim, Chaehwan Lim, Sang Hyun Gil, Suan Lee

机构 * School of Computer Science / Data Intelligence Lab(计算机科学学院/数据智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出一个包含8000多道真实公务员考试题目的多语言多模态基准EuraGovExam,要求模型直接从图像中进行布局感知的跨语言推理,当前最先进的视觉语言模型准确率仅达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07083 2026-06-02 cs.SE cs.AI 57%

Rethinking Scientific Modeling: Toward Physically Consistent and Simulation-Executable Programmatic Generation

重新思考科学建模:迈向物理一致且可模拟执行的程序化生成

Yongqing Jiang, Jianze Wang, Zhiqi Shen, Zhenghong Lin, Jiayuan Wang, Yijian Yang, Kaoshan Dai, Haoran Luo

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学) Fuzhou University(福州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对大型语言模型在工程建模中生成代码的物理不一致问题,提出结合领域知识构建、约束对齐和验证驱动的框架,并引入CivilInstruct数据集和MBEval基准,通过两阶段微调提升模型生成的可执行性和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01800 2026-06-02 cs.AI 57%

REBot: From RAG to CatRAG with Semantic Enrichment and Graph Routing

REBot: 从RAG到CatRAG——语义增强与图路由

Thanh Ma, Tri-Tam La, Lam-Thu Le Huu, Minh-Nghi Nguyen, Khanh-Van Pham Luu

机构 * CTU(越南科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出REBot,一种基于CatRAG混合检索推理框架的LLM增强咨询聊天机器人,通过语义增强的分层类别知识图谱和图路由实现学术法规建议,在分类和问答任务上达到98.89%的F1分数。

Comments Published in Communications in Computer and Information Science (CCIS), Springer, 2025. DOI: 10.1007/978-981-95-4960-3_35

Journal ref Communications in Computer and Information Science (CCIS), Springer, 2025, pp. 435-447

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11083 2026-06-02 cs.CL 57%

RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates

RedDebate:通过多智能体红队辩论实现更安全的响应

Ali Asad, Stephen Obadinma, Radin Shayanfar, Xiaodan Zhu

机构 * Department of Electrical Computer Engineering \& Ingenuity Labs Research Institute, Queen's University, Kingston, Canada

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出RedDebate框架,利用多智能体辩论和长期记忆模块,通过全自动红队测试减少大语言模型的不安全输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24621 2026-06-02 cs.CL 57%

Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities

大型语言模型在密码分析和侧信道漏洞方面的基准测试

Utsav Maskey, Chencheng Zhu, Usman Naseem

机构 * Macquarie University(麦考瑞大学) University of New South Wales(新南威尔士大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本研究通过零样本和少样本设置及思维链提示,评估大型语言模型在多种加密算法生成的密文上的解密成功率,揭示其在侧信道场景中的能力与局限,并讨论欠泛化相关攻击的风险。

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31478 2026-06-01 cs.SE cs.CL cs.SY eess.SY 57%

Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation

知识边界探测与需求引导干预:面向基于LLM的电力系统代码生成

Hui Wu, Xiaoyang Wang, Zhong Fan

机构 * Department of Engineering, University of Exeter(工程系,埃克塞特大学) Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM在电力系统代码生成中因API知识边界错误导致失败的问题,提出PowerCodeBench基准、L0-L3文档驱动探测和边界感知干预方法,显著提升模型准确率。

Comments 43 pages, 12 figures, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30459 2026-06-01 cs.CL 57%

Can LLM Teams Play What? Where? When?

LLM 团队能玩“什么?哪里?何时?”吗?

Anastasia Kotelnikova, Viktor Byzov, Maria Dolzhenkova, Evgeny Kotelnikov

机构 * Vyatka State University(维yatka国立大学) European University at St. Petersburg(圣彼得堡欧洲大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究基于团队的交互策略(投票、静默团队、健谈团队)能否提升大语言模型在“什么?哪里?何时?”问答游戏中的表现,实验表明团队策略优于单模型基线,准确率最高提升20个百分点,最佳团队达到44.23%,接近人类水平。

Comments Accepted for Dialogue-2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30394 2026-06-01 cs.SE cs.AI 57%

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

CodeGolf Bench:评估大型语言模型简洁代码生成能力的多语言基准

Vedant Padwal

机构 * Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CodeGolf Bench基准,基于代码高尔夫竞赛,在60种编程语言中评估LLM生成简洁高效代码的能力,实验表明推理模型显著优于非推理模型。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏