arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2605.30087 2026-05-29 cs.AI 57%

Selective QA over Conflicting Multi-Source Personal Memory: A Diagnostic Testbed and Method Comparison

冲突多源个人记忆上的选择性问答:诊断性测试平台与方法比较

Tiancheng Yang, Matthias Schonlau, Ilia Sucholutsky

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对多源冲突记忆的选择性问答问题,构建了包含34,560个实例的诊断基准,评估了多种方法,发现结构化融合方法在准确性和选择性上优于纯提示LLM。

Comments 55 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29893 2026-05-29 cs.AI 57%

Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories

冗余还是必要?检测智能体轨迹中冗余步骤的基准

Minyang Hu, Bo Yang, Zhinuo Zhou, Jiachen Liang, Guo Jiahao, Yiyang Yin, Xiongwei Han

机构 * Huawei Technologies(华为技术有限公司) Noah Arks’ Lab(Noah Arks实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM智能体轨迹中的冗余步骤检测问题,提出RedundancyBench基准,包含标注轨迹的数据集,并评估三种方法,发现最佳方法仅达到24.88%的检测分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29742 2026-05-29 cs.AI 57%

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

引用闭包检索与逐规则归因:面向真实世界法规合规问答

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对法规合规问答中多层级权威结构的引用追踪难题,提出基于操作知识图谱的基准RegOps-Bench和统一框架RefWalk,通过共享主题锚点遍历跨文档引用、多视角候选融合及逐规则归因,显著提升检索召回率和引用准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29591 2026-05-29 cs.AI 57%

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omni:通过离散扩散实现脑-视觉-语言建模的统一多任务框架

Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

机构 * NeuBCI Lab, State Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Future Technology, University of Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China Zhongguancun Academy, Beijing, China Peking University, Beijing, China

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Mind-Omni框架,利用离散扩散范式统一七种编码与解码任务,通过脑分词器将连续脑信号转化为离散令牌,实现多模态交互,并构建脑问答指令调优数据集,在多项任务上达到或超越专用模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21979 2026-05-29 cs.CV cs.AI 57%

Benchmarking and Mitigating Sycophancy in Medical Vision Language Models

医疗视觉语言模型中的谄媚行为基准测试与缓解

Juangui Xu, Zikun Guo, Jingwei Lv, Hongbin Lin, Shu Yang, Jun Wen, Di Wang, Lijie Hu

机构 * MBZUAI Saarland University(萨尔兰大学) HKUST(GZ)(香港科技大学(广州)) KAUST(卡塔尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对医疗视觉语言模型中的谄媚问题,提出分层医疗视觉问答基准和VIPER策略,通过过滤非证据社会线索减少谄媚,提升模型鲁棒性。

Comments 19figures, 61pages. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29555 2026-05-29 cs.CL 57%

From Blind Guess to Informed Judgment: Teaching LLMs to Evaluate Materials by Building Knowledge-Augmented Preference Signals

从盲目猜测到知情判断:通过构建知识增强的偏好信号教会LLM评估材料

Yeyong Yu, Wenya Hu, Xing Wu, Quan Qian

机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院) Center of Materials Informatics and Data Science, Materials Genome Institute, Shanghai University(上海大学材料信息与数据科学中心) Key Laboratory of Silicate Cultural Relics Conservation (Shanghai University), Ministry of Education, China(教育部硅酸盐文化 relics 保护重点实验室(上海大学)) Shanghai Institute for Advanced Communication and Data Science, Shanghai University(上海大学高级通信与数据科学研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出知识增强偏好信号框架MaterEval,通过成对偏好数据引导大语言模型从直觉判断转向基于证据的可靠评估,并引入快慢推理方案平衡吞吐量、成本和可靠性,在高熵合金评估中验证了有效性。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29476 2026-05-29 cs.CL 57%

Comparative Evaluation of Machine Translation Systems on Images with Text

含文本图像的机器翻译系统比较评估

Blai Puchol, Sergio Gómez González, Miguel Domingo, Francisco Casacuberta

机构 * ValgrAI - Valencian Graduate School and Research Network for Artificial Intelligence(ValgrAI - 瓦伦西亚人工智能研究生学院和研究网络)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究比较评估了三种机器翻译范式(模块化流水线、多模态大语言模型和端到端模型Translatotron-V)在含文本图像翻译任务上的性能,发现多模态大语言模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29462 2026-05-29 cs.CV cs.AI 57%

Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset

大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集

Qian Chen, Xianyin Zhang, Yanzhi Liu, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29446 2026-05-29 cs.AI 57%

CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials

CrystalXRD-Bench:面向多种晶体材料的XRD峰索引的视觉-语言模型基准测试

Chengliang Xu, Xiaogang Li, Peiyao Xiao, Beng Wang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CrystalXRD-Bench基准,通过250个样本评估视觉-语言模型从粉末XRD图谱中识别米勒指数(HKL)的能力,发现最佳模型Jaccard得分仅0.5888,任务远未解决。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29401 2026-05-29 cs.LG 57%

Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

重新思考多模态时间序列预测的后训练方法

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出PostTime后训练方法,结合监督微调和基于可验证奖励的强化学习,利用大语言模型根据多模态上下文修正数值时间序列基础模型的预测,显著提升多模态时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29059 2026-05-29 cs.SE cs.AI cs.CR 57%

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

SCDBench: 基于大语言模型的智能合约反编译基准

Kaihua Qin, Dawn Song, Arthur Gervais

机构 * University of Warwick(沃里克大学) UC Berkeley(伯克利大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对现有智能合约反编译评估缺乏统一基准的问题,提出SCDBench数据集与评估方法,通过四阶段累积评估(格式完整性、可编译性、ABI恢复、语义一致性)测试前沿LLM的反编译能力,发现语义一致性仍远未解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-05-29 cs.AI 57%

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05157 2026-05-29 cs.AI 57%

IntentScore: Intent-Conditioned Action Evaluation for Computer-Use Agents

IntentScore: 面向计算机使用智能体的意图条件动作评估

Rongqian Chen, Yu Li, Zeyu Fang, Sizhe Tang, Weidong Cao, Tian Lan

机构 * George Washington University(乔治·华盛顿大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出IntentScore,一种基于计划感知的奖励模型,通过对比对齐和边际排序学习评估动作质量,在OSWorld上提升任务成功率6.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23571 2026-05-29 cs.CR cs.AI 57%

Benchmarking LLM-Assisted Blue Teaming via Standardized Threat Hunting

通过标准化威胁狩猎评估LLM辅助蓝队

Yuqiao Meng, Luoxi Tang, Feiyang Yu, Xi Li, Guanhua Yan, Ping Yang, Zhaohan Xi

机构 * State University of New York at Binghamton(纽约州立大学布ingham顿分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CyberTeam基准,通过构建标准化工作流和模块化操作步骤,评估大语言模型在蓝队威胁狩猎中的有效性,并揭示标准化设计带来的改进与开放式推理的局限性。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28532 2026-05-28 cs.AI 57%

Do Agents Know What They Can't Do? Evaluating Feasibility Awareness in Tool-Using Agents

智能体知道它们不能做什么吗?评估使用工具的智能体的可行性意识

Liang Cheng, Mingsheng Cai, Jiuming Jiang, Luo Mai

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出FeasiGen自动构建不可行任务管道,通过屏蔽关键工具将可解任务转为不可解,评估发现多数模型缺乏可行性检测能力,错误继续率高达73.9%。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR 57%

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27922 2026-05-28 cs.AI 57%

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。

Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27832 2026-05-28 cs.CL 57%

Playing with Words, Improving with Rewards: Training Language Models for Creative Association

玩文字游戏,用奖励改进:训练语言模型进行创意联想

Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛市分校) Dartmouth College(达特茅斯学院) University of Amsterdam(阿姆斯特丹大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过强化学习与可验证奖励(RLVR)在Codenames游戏上训练LLM,探索了规模依赖的精确度-创造力权衡,发现8B模型在保持推理能力的同时提升创造力,而小模型则牺牲创造力换取推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27820 2026-05-28 cs.AI 57%

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出EgoBench,首个交互式自我中心多模态基准,通过1045个自我中心视频任务和用户-智能体-工具交互环境,联合评估视觉感知、工具增强多跳推理和动态交互能力,揭示当前最先进模型性能上限(平均准确率19.43%)。

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27710 2026-05-28 cs.AI 57%

DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation

DeepSciVerify: 通过LLM驱动的证据升级验证科学声明与引文对齐

Shaghayegh Sadeghi, Khashayar Khajavi, Rise Adhikari, Alexander Tessier

机构 * School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DeepSciVerify两阶段流水线,结合摘要推理与选择性升级到段落证据,在SCitance基准上以86.7 Micro-F1超越纯摘要基线4.5点,同时67%实例无需全文检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27706 2026-05-28 cs.CL cs.IR 57%

Chain-based Adaptive Reconfiguration Over Lattices for Hallucination Reduction

基于格点链式自适应重配置以减少幻觉

Joan Vendrell Gallart, Solmaz Kia, Russell Bent, Michael Grosskopf

机构 * Department of Mechanical and Aerospace University of California Irvine(机械与航空航天系加州大学伊文斯顿分校) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出CAROL框架,通过定义语义不确定性度量并在文本序列格点上构建串子模目标,将幻觉缓解转化为马尔可夫链接受-拒绝过程,实现测试时幻觉减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27591 2026-05-28 cs.LG 57%

Gradient Transformer: Learning to Generate Updates for LLMs

梯度变换器:学习为大语言模型生成更新

Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Department of Data Science, New Jersey Institute of Technology, Newark, NJ, USA(数据科学系,新泽西理工学院,新泽西州诺克斯维尔) Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所,HBKU,多哈)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出一种无数据知识蒸馏框架,利用梯度变换器将微调后小语言模型的更新向量转换为大语言模型的更新向量,实现无需私有数据即可更新大模型。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27440 2026-05-28 cs.IR cs.AI 57%

Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline

生产检索增强商业推荐中的释义脆弱性:低于重运行稳定性基线的可重复性

Will Jack, Noah Lehman, Keller Maloney, Sarah Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究发现AI助手对买家问题的细微措辞变化(如“最佳CRM” vs “顶级CRM”)产生显著不同的品牌推荐,其推荐集相似度(Jaccard)远低于相同提示的重运行基线,挑战了当前AEO/GEO实践的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27348 2026-05-28 cs.CV cs.AI 57%

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection

当眼睛背叛AI:社交注视一致性作为AI生成图像检测的语义线索

Jihyeon Kim, Sohee Kim, Soosan Lee, Souhwan Jung, James Matthew Rehg, Hyesong Choi

机构 * School of Computer Engineering(计算机工程学院) Hoseo University(Hoseo大学) School of Electronic Engineering(电子工程学院) Soongsil University(Soongsil大学) School of Computer Science(计算机科学学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出社交注视一致性作为高层语义线索,通过构建诊断数据集、块组合描述监督和跨架构验证,证明该线索能有效检测AI生成图像,并解释其跨生成器迁移的机制。

Comments 23 pages, 2 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02503 2026-05-28 cs.AI 57%

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis

DataClawBench: 面向探索性真实世界金融数据分析的智能体基准

Qiaohong Zhang, Weihao Ye, Jialong Chen, Yi Luo, BoYuan Li, Bowen Deng, Zibin Zheng, Jianhao Lin, Wei-Shi Zheng, Chuan Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Lingnan College, Sun Yat-sen University(中山大学岭南学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DataClawBench基准,通过金融智库场景评估智能体在无先验指导下的探索性数据分析能力,包含约206万条跨领域真实噪声数据及492个多步任务,实验发现探索行为与任务进展及正确性不呈正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04295 2026-05-28 cs.CL 57%

Adaptive Cost-Efficient Evaluation for Reliable Patent Claim Generation

面向可靠专利权利要求生成的适应性成本高效评估

Yongmin Yoo, Qiongkai Xu, Longbing Cao

机构 * Frontier AI Research Centre, Macquarie University School of Computing, FSE, Macquarie University(前沿人工智能研究中心,麦考瑞大学计算机学院,FSE,麦考瑞大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出两阶段框架ACE,利用专利错误类别结构进行不确定性感知路由,第一阶段编码器预测错误类型熵,超过阈值则交由第二阶段专家LLM执行模式约束的专利思维链协议,在降低78%成本的同时超越70B参数LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09258 2026-05-28 cs.LG 57%

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima

Nexus: 相同预训练损失,通过公共极小值实现更好的下游泛化

Huanran Chen, Huaqing Zhang, Xiao Li, Yinpeng Dong, Ke Shen, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Nexus优化器,通过最大化梯度相似性促使不同数据源的损失函数极小值靠近,在保持相同预训练损失的情况下显著提升下游泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21165 2026-05-28 cs.CL cs.CV 57%

Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects

多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Shubhashis Roy Dipta, Rubaya Tabassum, Ariful Ekraj Hridoy, Mehraj Mahmood, Mahbub E Sobhani, Md. Tarek Hasan, Swakkhar Shatabda

机构 * United International University(国际联合大学) BRAC University(布拉塔克大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。

Comments https://labib1610.github.io/BanglaVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02097 2026-05-28 cs.CL 57%

ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs

ClinConsensus:一个用于评估中文医疗大模型临床评分标准覆盖率的医师校准基准

Xiang Zheng, Han Li, Wenjie Luo, Weiqi Zhai, Yiyuan Li, Chuanmiao Yan, Xue Yang, Kailuan Wu, Ruyi Xu, Tianyun Lu, Tianyi Tang, Yubo Ma, Kexin Yang, Dayiheng Liu, Sen Yang, Lin Qu, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 为解决开放域医疗大模型评估缺乏医师校准的临床响应标准覆盖率问题,提出包含2500个专家病例的ClinConsensus基准,并引入医师锚定覆盖率评分(CACS)及双裁判框架,发现前沿模型存在19.2-21.9分的覆盖率差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18481 2026-05-28 q-fin.TR cs.AI 57%

AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models

AlphaForgeBench:用大型语言模型对端到端交易策略设计进行基准测试

Wentao Zhang, Mingxuan Zhao, Jincheng Gao, Jieshun You, Huaiyu Jia, Yilei Zhao, Bo An, Shuo Sun

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出AlphaForgeBench框架,将LLM从随机交易代理重新定义为量化研究员,通过生成可执行alpha因子和基于因子的交易策略,消除执行不稳定,实现可复现的金融推理评估。

详情

展开后加载摘要…

URL PDF HTML 收藏