arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2605.29400 2026-05-29 cs.AI cs.CL cs.HC 62%

Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark

面向屏幕条件动作预测的架构敏感监督微调:PiSAR基准

Rahul Bissa, Abhishek Vyas, Yash Jain

机构 * AprioriLabs(Apriori实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过PiSAR基准评估监督微调模型与前沿零样本模型在屏幕锚定行为预测上的性能,发现微调Qwen3-VL-8B-Instruct显著优于前沿基线,而Gemma-4-26B-A4B-IT微调效果不佳,揭示模型与微调方法不匹配问题。

Comments 14 pages, 7 figures, 2 tables. PiSAR corpus and fine-tuned weights are proprietary to AprioriLabs; methodology and recipe released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29027 2026-05-29 cs.AI cs.CL cs.HC 62%

Mind Your Tone: Does Tone Alter LLM Performance?

注意你的语气:语气会改变LLM的性能吗?

Om Dobariya, Akhil Kumar

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提示语气变化如何影响大语言模型在客观选择题上的准确性,发现语气效应系统但高度依赖模型,并提出了解释语气如何调节内部推理模式的路由框架。

Comments 10 pages, 6 tables, 1 figure. Accepted as a full paper at the Thirty-second Americas Conference on Information Systems (AMCIS 2026), Reno. Follow-up to arXiv:2510.04950

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06063 2026-05-29 cs.AI cs.IT cs.LG math.IT 62%

TelecomTS: A Multi-Modal Observability Dataset for Time Series and Language Analysis

TelecomTS:面向时间序列与语言分析的多模态可观测性数据集

Austin Feng, Andreas Varvarigos, Ioannis Panitsas, Daniela Fernandez, Jinbiao Wei, Yuwei Guo, Jialin Chen, Ali Maatouk, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TelecomTS,一个来自5G电信网络的大规模多模态可观测性数据集,通过保留绝对尺度信息的异质协变量和多样化下游任务(异常检测、根因分析、多模态问答),揭示了现有模型在处理可观测性数据的高噪声、突变特性时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 62%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28163 2026-05-28 cs.CL cs.AI 62%

DEPART: DEcomposing PARiTy across Multilingual LLMs

DEPART: 跨多语言大模型的性能差异分解

Manan Uppadhyay, Prashant Kodali, Pranjal Chitale, Reshma Ramaprasad, Himanshu Beniwal, Sunayana Sitaram

机构 * Microsoft Research India(微软印度研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出DEPART框架,通过贝叶斯分层模型分解多语言大模型性能差异,发现语言特征解释79%-92%的方差,且模型内部表示与英语的相似性是主要预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27567 2026-05-28 cs.AI cs.CL 62%

Why LLMs Fail at Causal Discovery and How Interventional Agents Escape

为什么LLM在因果发现中失败以及干预代理如何逃脱

Amartya Roy, Sonali Parbhoo

机构 * SIRE, IIT Delhi(IIT德里智能研究机构) Robert Bosch GmbH(罗伯特·博世有限公司) Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文证明大型语言模型在因果发现中存在根本性失败,并提出一种基于干预代理的因果贝叶斯优化方法(A-CBO),通过外部贝叶斯循环在无需模型微调的情况下实现可证明的收敛。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13583 2026-05-28 cs.CL cs.AI 62%

BenGER Platform: A Collaborative Web Platform for End-to-End Benchmarking of German Legal Tasks

BenGER平台:面向德国法律任务端到端基准测试的协作式Web平台

Sebastian Nagl, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出BenGER开源Web平台,集成任务创建、协作标注、可配置LLM运行及多维度评估,支持多组织项目与租户隔离,实现法律推理基准测试的端到端透明与可复现。

Comments Preprint - Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 62%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26731 2026-05-27 cs.AI cs.CL 62%

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

不是能力问题:LLM 智能体层级间的驾驭敏感性非单调

Yong-eun Cho

机构 * KailosLab(凯罗斯实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过 432 次实验,发现 LLM 智能体的驾驭敏感性随模型层级非单调变化,且依赖模型类型(聊天 vs. 推理),推翻了“更高能力模型需要更少结构指导”的假设。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22774 2026-05-27 cs.CY cs.AI cs.CV cs.LG 62%

When VLMs 'Fix' Students: Identifying and Penalizing Over-Correction in the Evaluation of Multi-line Handwritten Math OCR

当VLM“修正”学生:多行手写数学OCR评估中的过度修正识别与惩罚

Jin Seong, Wencke Liermann, Minho Kim, Jong-hun Shin, Soojong Lim

机构 * Electronics and Telecommunications Research Institute(电子通信研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对多行手写数学OCR评估中VLM过度修正问题,提出基于LLM的语义评估指标PINK,有效惩罚过度修正,在FERMAT数据集上优于BLEU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18751 2026-05-27 cs.LG cs.AI stat.ME stat.ML 62%

Beyond Coefficients: Forecast-Necessity Testing for Interpretable Causal Discovery in Nonlinear Time-Series Models

超越系数:非线性时间序列模型中可解释因果发现的预测必要性检验

Valentina Kuskova, Dmitry Zaytsev, Michael Coppedge

机构 * Lucy Family Institute for Data & Society(数据与社会联合研究所) University of Notre Dame(诺特大学) Department of Political Science(政治学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对非线性时间序列模型中因果分数被误读为回归系数的问题,提出基于边消融和预测比较的预测必要性检验框架,以评估因果关系的实际必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14640 2026-05-27 cs.CL cs.AI 62%

Fact4ac at the Financial Misinformation Detection Challenge Task: Reference-Free Financial Misinformation Detection via Fine-Tuning and Few-Shot Prompting of Large Language Models

Fact4ac在金融虚假信息检测挑战赛中的方法:通过微调和少样本提示的大语言模型实现无参考金融虚假信息检测

Cuong Hoang, Le-Minh Nguyen

机构 * KaiNKaiho

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合零样本/少样本提示和LoRA参数高效微调的大语言模型框架,用于无外部证据的金融虚假信息检测,在公开和私有测试集上分别达到95.4%和96.3%的准确率,获得竞赛第一名。

Journal ref Proceedings of the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD 2026), 20th International AAAI Conference on Web and Social Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12564 2026-05-27 cs.CL cs.AI 62%

Sell Me This Stock: Unsafe Recommendation Drift in LLM Agents

卖给我这支股票:LLM智能体中的不安全推荐漂移

Zekun Wu, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM智能体在多轮金融推荐中因工具输出被操纵而产生风险不匹配推荐的问题,通过实验揭示评估盲区并分析机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21882 2026-05-27 cs.LG cs.AI 62%

Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards

立场:具有可验证奖励的强化学习的隐藏成本与测量缺口

Fang Wu, Aaron Tu, Weihao Xuan, Heli Qi, Xu Huang, Qingcheng Zeng, Shayan Talaei, Yijia Xiao, Peng Xia, Xiangru Tang, Yuchen Zhuang, Yinxi Li, Bing Hu, Hanqun Cao, Wenqi Shi, Rui Yang, Nan Liu, Huaxiu Yao, Ge Liu, Li Erran Li, Amin Saberi, Naoto Yokoya, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Georgia Tech(佐治亚理工学院) Northwestern University(西北大学) UCLA(加州大学洛杉矶分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学) Independent Researcher(独立研究者) CUHK(香港中文大学) UT Southwestern Medical Center(西南医学中心) National University of Singapore(新加坡国立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon AWS AI(亚马逊AWS人工智能)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文指出,具有可验证奖励的强化学习(RLVR)在提升大语言模型性能时,常因预算不匹配、尝试膨胀和基准数据污染等混淆因素导致收益被高估,并提出了预算匹配饱和曲线、校准跟踪、法官鲁棒性测试和污染筛查等最低标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26001 2026-05-26 cs.CL cs.AI cs.CY 62%

AI-Assisted Systematization for Evaluating GenAI Systems

AI辅助的系统化方法用于评估生成式AI系统

Dhruv Agarwal, Emily Sheng, Chad Atalla, Jean Garcia-Gathright, Hussein Mozannar, Hannah Washington, Alexandra Chouldechova, Solon Barocas, Hanna Wallach

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对生成式AI评估中概念模糊的问题,提出AI辅助系统化方法,通过概念规范和验证工作表生成可衡量的概念规范,并评估其内容效度和信息可恢复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25891 2026-05-26 cs.CL cs.AI 62%

Causal Tongue-Tie: LLMs Can Encode Causal Direction, But Their Yes/No Outputs Fail to Express

因果舌结:LLMs 能编码因果方向,但其是/否输出无法表达

Ziyi Ding, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在因果问题上存在内部编码与输出不匹配的现象,通过线性探针可从隐藏状态恢复证据支持的答案(准确率约0.97),但口头是/否回答却退化为常识答案(准确率约0.5),揭示了约+0.5的差距,称为“因果舌结”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25864 2026-05-26 cs.LG cs.CL 62%

When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards

当自我信念误导:面向可验证奖励的强化学习的主动标签获取

Li Wang, Xiaodong Lu, Xiaohan Wang, Yikun Ban, Jiajun Chai, Wei Lin, Tianhao Peng, Guojun Yin

机构 * Meituan(美团) Beihang University(北京航空航天大学) Nanyang Technological University(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出RLAVR框架,通过主动获取少量真实标签并与伪标签结合,利用CAG指标和CARE策略稳定训练并提升有限标注预算下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17937 2026-05-26 cs.CL cs.AI 62%

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

BacktestBench:面向自动化量化策略回测的大语言模型基准测试

Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

机构 * Beijing Normal University(北京师范大学) Elmleaf Ltd.(Elmleaf公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出首个大规模自动化量化回测基准BacktestBench,包含18,246个问答对,并设计多智能体基线AutoBacktest,通过协调摘要器、检索器和编码器实现自然语言策略到可重复回测的转换。

Comments This paper has been accepted by KDD 2026 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17234 2026-05-26 cs.AI cs.LG 62%

All Leaks Count, Some Count More: Interpretable Temporal Contamination Detection and Mitigation in LLM Backtesting

所有泄漏都重要,有些泄漏更重要:LLM回测中可解释的时间污染检测与缓解

Zeyu Zhang, Ryan Chen, Bradly C. Stadie

机构 * Department of Statistics and Data Science, Northwestern University(统计与数据科学系,西北大学) Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于Shapley值的声明级评估框架Shapley-DCLR和推理时架构TimeSPEC,用于检测和缓解LLM回测中的时间污染问题。

Comments 8 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24703 2026-05-26 cs.CL cs.AI 62%

TS-Skill: A Benchmark for Evaluating Analytical Skills in Time-Series Question Answering

TS-Skill: 用于评估时间序列问答中分析技能的基准

Liying Han, Kang Yang, Oliver Wang, Jason Wu, Pengrui Quan, Gaofeng Dong, Ozan Baris Mulayim, Sizhe Ma, Yuyang Yuan, Dezhi Hong, Mario Berges, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Samsung Research America(三星美国研究院) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出TS-Skill基准,通过三种可组合的分析技能(时间尺度选择、时间定位和跨区间整合)来诊断时间序列问答中模型的信号级能力,并开发SKEvol框架自动构建基准,实验揭示不同技能上的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24699 2026-05-26 cs.AI cs.LG 62%

MDIA: A Multi-Agent Diagnostic Intelligence Pipeline on HealthBench Professional

MDIA:HealthBench Professional上的多智能体诊断智能流水线

Roberto Cruz, David Rey-Blanco

机构 * TietAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MDIA多智能体诊断系统,通过7节点专业路由临床推理图架构,在非微调LLM上实现HealthBench Professional基准性能提升3.72个百分点,归因于系统架构设计而非提示工程。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06870 2026-05-26 cs.LG cs.AI 62%

QASA: Quality-Aware Semantic Augmentation for Robust Multimodal Sentiment Analysis

QASA: 面向鲁棒多模态情感分析的质量感知语义增强

Jiazhang Liang, Jianheng Dai, Miaosen Luo, Menghua Jiang, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出QASA框架,利用扩散模型生成视觉和听觉增强样本,并通过解耦质量感知评分模块分配训练权重,以解决高质量数据稀缺问题,提升多模态情感分析的鲁棒性和泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15407 2026-05-26 cs.AI cs.CV cs.LG 62%

IPR-1: Interactive Physical Reasoner

IPR-1:交互式物理推理器

Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li

机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。

Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25339 2026-05-26 cs.CV cs.AI cs.LG eess.IV 62%

VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes

VisualOverload: 在真正密集场景中探测VLM的视觉理解

Paul Gavrikov, Wei Lin, M. Jehanzeb Mirza, Soumya Jahagirdar, Muhammad Huzaifa, Sivan Doveh, Serena Yeung-Levy, James Glass, Hilde Kuehne

机构 * Independent Researcher(独立研究者) JKU Linz(林茨JKU) MIT CSAIL Tübingen AI Center(图宾根人工智能中心) Stanford(斯坦福) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出VisualOverload基准,通过密集场景中的简单视觉任务测试VLM,发现最佳模型仅达69.5%准确率,揭示计数、OCR和逻辑一致性等关键缺陷。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24171 2026-05-26 cs.LG cs.AI 62%

PromptAudit: Auditing Prompt Sensitivity in LLM-Based Vulnerability Detection

PromptAudit: 审计基于LLM的漏洞检测中的提示敏感性

Steffen J. Camarato, Yahya Hmaiti, Mandana Ghadamian, David Mohaisen

机构 * University of Central Florida(佛罗里达大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptAudit框架,通过固定数据集、解码和解析仅变化提示策略,评估五种提示策略在五个开源模型上对1000个CVE(6074个代码样本,16种编程语言)的漏洞检测性能,发现标准思维链提示整体性能最佳,而提示敏感性是系统的一级属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19846 2026-05-26 cs.CV cs.AI cs.CL 62%

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18444 2026-05-26 cs.LG cs.AI 62%

Discounted Beta-Bernoulli Reward Estimation for Sample-Efficient Reinforcement Learning with Verifiable Rewards

折扣Beta-Bernoulli奖励估计用于基于可验证奖励的样本高效强化学习

Haechan Kim, Soohyun Ryu, Gyouk Chu, Doohyuk Jang, Eunho Yang

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对基于可验证奖励的强化学习样本效率低的问题,提出折扣Beta-Bernoulli奖励估计方法,利用历史奖励统计量降低估计方差并避免方差崩溃,在多个推理基准上显著提升性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22993 2026-05-25 cs.CL cs.AI 62%

A Proactive Multi-Agent Dialogue Framework for Assessing Social Language Disorder Traits in Autism

一种主动式多智能体对话框架用于评估自闭症中的社交语言障碍特征

Chuanbo Hu, Minglei Yin, Bin Liu, Wenqi Li, Lynn K. Paul, Shuo Wang, Xin Li

机构 * Department of Computer Science(计算机科学系) University at Albany(阿尔巴尼大学) Department of Management Information System(管理信息系统系) West Virginia University(西弗吉尼亚大学) Department of Radiology(放射学系) Washington University in St. Louis(圣路易斯华盛顿大学) Humanities and Social Sciences(人文学与社会科学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出TPA(思考、计划、询问)主动式多智能体对话框架,通过临床策略驱动的提问选择,在ADOS-2评估中实现82.1%的社交语言障碍特征覆盖率,比临床医生自动回放高16.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12316 2026-05-25 cs.AI cs.CL cs.CY cs.GT cs.MA 62%

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

GT-HarmBench:通过博弈论视角评估AI安全风险

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Berea College(贝雷学院) University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出GT-HarmBench基准,包含1535个高风险场景,基于博弈论结构(如囚徒困境、猎鹿博弈、斗鸡博弈)评估前沿AI模型在多智能体环境中的安全风险,发现模型在38%的高风险案例中未能选择对社会有益的行为,并验证了博弈论干预可提升18%的社会有益结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22939 2026-05-25 cs.CL cs.LG 62%

Learnability-Informed Fine-Tuning of Diffusion Language Models

扩散语言模型的可学习性感知微调

Shubham Parashar, Atharv Chagi, Jacob Helwig, Lakshmi Jotsna, Sushil Vemuri, James Caverlee, Dileep Kalathil, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A\&M University, College Station, TX, USA(计算机科学与工程系,德克萨斯A&M大学,College Station, TX, USA) Department of Electrical and Computer Engineering, Texas A\&M University, College Station, TX, USA(电气与计算机工程系,德克萨斯A&M大学,College Station, TX, USA)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对扩散语言模型(DLM)推理能力提升问题,提出基于可学习性感知的微调算法LIFT,通过在不同扩散时间步对齐训练与信息可用性,在六个推理基准上超越现有SFT基线,在AIME'24和AIME'25上实现高达3倍的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏