arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1039 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1039 篇

2606.26698 2026-06-26 cs.CL cs.AI 新提交 62%

Beyond Logical Forms: LLM-Extracted Patterns for Fallacy Classification

超越逻辑形式:LLM提取的谬误分类模式

Eleni Papadopulos, Firoj Alam, Giovanni Da San Martino

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 62%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26294 2026-06-26 cs.LG cs.AI cs.MA cs.NE 新提交 62%

The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

红皇后哥德尔机:共同进化的智能体及其评估者

Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。

Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20632 2026-06-26 cs.CL cs.AI cs.CY 新提交 62%

Post-Training Recipe, More Than Model Family, Shapes Multi-Agent LLM Conversational Behavior

后训练配方,而非模型家族,塑造多智能体LLM对话行为

Luyang Zhang, Jialu Wang, Fei Xue, Yi-Yun Chu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过大规模语料库和因子实验发现,后训练配方(如推理蒸馏)对多LLM对话行为(如回避性回答)的影响超过模型家族,表明模型家族不能完全代表对话多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 62%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25935 2026-06-25 cs.CL cs.AI 新提交 62%

Overview of HIPE-2026: Person-Place Relation Extraction from Multilingual Historical Texts

HIPE-2026 概述:从多语言历史文本中提取人物-地点关系

Juri Opitz, Maud Ehrmann, Corina Raclé, Andrianos Michail, Matteo Romanello, Simon Clematide

机构 * University of Zurich(苏黎世大学) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Swiss Federal Institute of Technology Zurich (ETHZ)(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出HIPE-2026评测任务,针对多语言历史文档中的人物-地点关系(at和isAt)进行提取,采用三方面评估框架,比较了多种方法在准确性、效率和跨域泛化上的表现。

Comments Condensed Overview of CLEF-HIPE-2026 Shared Task Results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24589 2026-06-24 cs.AI cs.CL 新提交 62%

AdversaBench: Automated LLM Red-Teaming with Multi-Judge Confirmation and Cross-Model Transferability

AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试

Khanak Khandelwal

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。

Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24033 2026-06-24 cs.LG cs.CL 新提交 62%

RoPE-Aware Bit Allocation for KV-Cache Quantization

RoPE感知的KV缓存量化比特分配

Fengfeng Liang, Yuechen Zhang, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) MiMo, Xiaomi Corporation(小米集团 MiMo)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对RoPE下键缓存量化中不同频率块对误差敏感度不同的问题,提出Block-GTQ比特分配器,通过能量评分和贪心分配提升量化精度,在长上下文任务中显著恢复性能。

Comments Preprint. Code available at https://github.com/JIA-Lab-research/blockgtq

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22977 2026-06-23 cs.CL cs.AI 新提交 62%

StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs

StatABench:评估大语言模型统计分析能力的数据集与框架

Youxin Zhu, Yixuan Ding, Peng Lai, Longyue Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22189 2026-06-23 cs.LG cs.AI 新提交 62%

L20-Edu-135M: An Auditable Single-GPU Study of Data-Efficient Small Language Modeling

L20-Edu-135M: 一个可审计的单GPU数据高效小语言模型研究

Yin Li

机构 * University of Birmingham(伯明翰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究在单块NVIDIA L20 GPU上训练134.5M参数的语言模型,使用约13B tokens,通过数据筛选、去重、SFT和RLVR等方法,在零样本任务上达到SmolLM-135M 87.1%的性能,但仅使用其2.17%的tokens。

Comments 13 pages, 8 tables. Model available at https://huggingface.co/AliceYin/l20-edu-135m

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21937 2026-06-23 cs.CY cs.AI cs.CL 新提交 62%

Latent Confidence Alignment for LLM Self-Assessment

潜在置信对齐用于大语言模型自我评估

Ting-Yu Chen, Tingting Yu, Pei-Cing Huang, Chan Hsu, Ming-Yen Lin, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) Kaohsiung Medical University Hospital(高雄医学大学附设医院) Kaohsiung Medical University(高雄医学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出基于Rasch模型的潜在置信对齐误差(LCAE)来评估LLM自我评估与潜在错误概率的一致性,并引入项目难度作为外部信号,实验表明该方法在不影响模型能力的情况下提升自我评估质量。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 62%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21197 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Sergio Lanza, Jae Hee Lee, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。

Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21194 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models

MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试

Han Jang, Junhyeok Lee, Songsoo Kim, Chae Young Lim, Hyeonjin Goh, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔大学) Seoul National University Hospital(首尔大学医院) Seoul National University College of Medicine(首尔大学医学院) Sungkyunkwan University School of Medicine(成均馆大学医学院)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。

Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21082 2026-06-23 cs.CL cs.AI cs.CR 新提交 62%

Scalable Hierarchical Attention Transformers for Multi-Turn Jailbreak Detection in Long Conversations

可扩展的层次注意力Transformer用于长对话中的多轮越狱检测

Chenhui Hu, Muhammed Salih, Sudipto Guha, Subramanian Srinivasan

机构 * Zscaler, Inc.(Zscaler公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出一种层次化检测器,通过紧凑的轮次表示和轻量级对话模块捕捉跨轮推理,在14,038条对话上F1达0.9394,超越Claude Opus 4.7,误报率减半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20629 2026-06-23 cs.MA cs.AI cs.LG 新提交 62%

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

专业化角色,混合部署:推动LLM代理团队的成本-精度前沿

Yinsicheng Jiang, Liang Cheng, Yeqi Huang, Yufan Zhao, Zhan Lu, Li Dong, Wenda Li, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19821 2026-06-19 cs.AI cs.LG 新提交 62%

TelcoAgent: A Scalable 5G Multi-KPM Forecasting With 3GPP-Grounded Explainability

TelcoAgent: 一种可扩展的5G多KPM预测与3GPP基础可解释性

Geon Kim, Dara Ron, Sukhdeep Singh, Suyog Moogi, Pranshav Gajjar, V V N K Someswara Rao Koduri, Een Kee Hong, Vijay K. Shah

机构 * NextG Wireless Lab, North Carolina State University(北卡罗来纳州立大学下一代无线实验室) Kyung Hee University(庆熙大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出TelcoAgent框架,利用基础模型实现多KPM的零样本预测,通过3GPP知识图谱和可解释性管道提供可操作诊断。

Comments 6 pages, 6 figures. Submitted to IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19788 2026-06-19 cs.AI cs.CL 新提交 62%

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

CombEval:评估大语言模型中组合计数的框架

Yuxu Zhou, Ondřej Kuželka, Yuyi Wang, Yuanhong Wang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Czech Technical University in Prague(捷克布拉格理工大学) CRRC Zhuzhou Institute(中车株洲研究所) Tengen Intelligence Institute(天元智能研究院) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CombEval动态基准,通过类型化Cofola规范生成组合计数问题,评估11个大语言模型在直接和代码增强设置下的表现,发现模型在有序对象、不可区分元素、相对位置约束和嵌套对象依赖上存在脆弱性。

Comments under review. Code: https://github.com/YuxuZhou-CN/combination-problem-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19349 2026-06-19 cs.CL cs.AI 新提交 62%

Where to Place the Query? Unveiling and Mitigating Positional Bias in In-Context Learning for Diffusion LLMs via Decoding Dynamics

查询应置于何处?通过解码动力学揭示并缓解扩散大语言模型中上下文学习的位置偏差

Zhengheng Li, Panrui Li, Xuyang Liu, Puzhi Xia

机构 * Southeast University(东南大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了扩散大语言模型中查询位置对生成质量的影响,发现其与示例语义质量同等重要,并提出基于平均置信度的无训练自适应路由策略Auto-ICL以优化查询放置。

Comments 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19245 2026-06-19 cs.AI cs.LG 新提交 62%

TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

TxBench-PP:分析AI代理在小分子临床前药理学中的表现

Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出TxBench-PP基准,用于评估AI代理从真实实验数据中恢复临床前药理学结论的能力,测试显示最强配置Claude Opus 4.8 / Pi仅通过59.3%的端点尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18307 2026-06-18 cs.LG cs.AI 新提交 62%

DRIFT: Refining Instruction Data via On-Policy Data Attribution

DRIFT: 通过在线策略数据归因优化指令数据

Zefan Wang, Lincheng Li, Tianyu Yu, Yuan Yao

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18273 2026-06-18 cs.CL cs.AI cs.SD eess.AS 新提交 62%

Continuous Audio Thinking for Large Audio Language Models

面向大型音频语言模型的连续音频思考

Gyojin Han, Dong-Jae Lee, Changho Choi, Jongsuk Kim, Junmo Kim

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出连续音频思考(CoAT)框架,通过专家蒸馏在连续潜在空间中组织声学信息,使音频语言模型在生成响应前利用丰富声学特征,无需额外自回归解码成本,在多个音频任务上提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 62%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16307 2026-06-16 cs.AI cs.CL 新提交 62%

State-Grounded Multi-Agent Synthetic Data Generation for Tool-Augmented LLMs

面向工具增强型大语言模型的基于状态的多智能体合成数据生成

Rahul Khedar, Eshita, Sneha Teja Sree Reddy Thondapu, Mayank Malhotra, Arup Das, Jitesh Chandra, Yun-Shiuan Chuang, Chaitanya Kulkarni, Arun Menon, Linsey Pang, Avinash Karn, Mouli V, Prakhar Mehrotra

机构 * PayPal AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出StateGen平台,通过四角色LLM循环和状态管理器生成多轮、工具接地的高质量训练对话,消除工具调用幻觉,支持层次化多智能体设置。

Comments 9 pages, 5 figures, 6 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15455 2026-06-16 cs.LG cs.AI 新提交 62%

Understanding Diversity Collapse in RLVR via the Lens of Overtraining

通过过度训练的视角理解RLVR中的多样性崩溃

Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An

机构 * Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) Southeast University(东南大学) Microsoft(微软) Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) Chongqing University(重庆大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过过度训练的视角形式化RLVR中的多样性崩溃,发现标准训练中大部分更新是过度训练,并提出贝叶斯边界门控(BBG)方法,通过估计每个问题对推理边界的边际贡献来优化,提升多个基准上的Pass@k。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15314 2026-06-16 cs.LG cs.AI stat.ML 新提交 62%

LLMs on Tabular Data with Limited Semantics: Evidence from Industrial Car Retrofit Prediction

有限语义表格数据上的LLM:来自工业汽车改造预测的证据

Aina Vila Pons, Ioannis Tzachristas, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学) BMW Group(宝马集团)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在工业表格数据中,LLM(嵌入、直接分类、混合堆叠)与经典树集成方法的对比,发现LLM在语义受限时效果有限,但嵌入和混合方法仍有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14141 2026-06-15 cs.SD cs.AI cs.CL 新提交 62%

Spatio-Temporal Audio Language Modeling for Dynamic Sound Sources

动态声源的时空音频语言建模

Oh Hyun-Bin, Kazuki Shimada, Yuhta Takida, Kim Sung-Bin, Toshimitsu Uesaka, Takashi Shibuya, Kyeongyoon Lee, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼AI) Sony Group Corporation(索尼集团) Sungkyunkwan University(成均馆大学) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ST-AudioLM模型,通过时空音频编码器联合学习事件语义与源轨迹,在ST-AudioQA基准上提升动态声源问答的语义-定位权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12736 2026-06-12 cs.AI cs.LG 新提交 62%

Benchmarking AI Agents for Addressing Scientific Challenges Across Scales

跨尺度科学挑战的AI智能体基准测试

Tianyu Liu, Allen Xin Wang, Antonia Panescu, Lisa Xinyi Chen, Wenxin Long, Xinyu Wei, Yueqian Jing, Ziyao Zeng, Jihang Chen, Sihan Jiang, Ziqing Wang, Siyi Gu, Siyu Chen, Xinyang Hu, Haoran Shao, Leqi Xu, Wangjie Zheng, Zhiyuan Cao, Ada Fang, Botao Yu, Kunyang Sun, Rex Ying, Arman Cohan, Qingyu Chen, Lingzhou Xue, Kaize Ding, Yuanqi Du, Wengong Jin, Zhuoran Yang, Marinka Zitnik, James Zou, Hua Xu, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(布罗德研究所) The Pennsylvania State University(宾夕法尼亚州立大学) Northeastern University(东北大学) Northwestern University(西北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12595 2026-06-12 cs.LG cs.AI cs.CV 新提交 62%

Emerging Flexible Designs for Geospatial Multimodal Foundation Models

地理空间多模态基础模型的新兴灵活设计

Philipe Dias, Waqwoya Abebe, Abhishek Potnis, Aristeidis Tsaris, Dan Lu, Xiao Wang, Dalton Lunga

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12426 2026-06-12 cs.CY cs.CL cs.LG 新提交 62%

Two Wrongs, No Right: Auditing Social-Desirability Bias in LLM Annotators for Computational Social Science

两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差

Varun Kotte

机构 * Varun Kotte

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。

详情

展开后加载摘要…

URL PDF HTML 收藏