arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2606.27828 2026-06-29 cs.CV 新提交 67%

Video-MME-Logical: A Controlled Diagnostic Benchmark for Video Temporal-Logical Reasoning

Video-MME-Logical: 面向视频时序逻辑推理的受控诊断基准

Hohin Kwan, Hongyu Li, Ray Zhang, Manyuan Zhang, Xianghao Kong, Anyi Rao, Jiahao Xie, Si Liu

机构 * HKUST(香港科技大学) Colab, Beihang University(北京航空航天大学合作实验室) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 为隔离评估多模态大模型在视频中的时序逻辑推理能力,提出包含五种时序逻辑操作和25个细粒度任务类别的受控基准,通过控制时间跨度和推理复杂度进行难度可控评估,并支持中间状态诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26176 2026-06-29 cs.AR 新提交 67%

Toward Mitigating Process-Induced Performance Degradation in 3.5D Heterogeneous Packages via Pre-Silicon Firmware Co-Optimization

通过预硅固件协同优化减轻3.5D异构封装中工艺引起的性能退化

Chi Fei Chung

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一种物理感知的预测性固件调度层XRM-SSD V24/V7.0,通过热-电协同仿真和负载密度驱动的热提示,实现3.5D封装中电压轨预置,显著降低热漂移和泄漏电流,释放20-30%计算能力并减少65-68% EDA保护带。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 67%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 评测与基准 :post-training(abstract);prompting(abstract)

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27264 2026-06-26 cs.CV 新提交 67%

CORTEX: A Structured Reasoning Benchmark for Trustworthy 3D Chest CT MLLMs

CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准

Hashmat Shadab Malik, Anees Ur Rehman Hashmi, Numan Saeed, Muzammal Naseer, Salman Khan, Christoph Lippert

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Hasso Plattner Institute(哈索·普拉特纳研究所) Khalifa University(哈利法大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27146 2026-06-26 cs.RO 新提交 67%

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

PhysReflect-VLA:面向可靠视觉-语言-动作策略的物理可行性与自反思调节

Jiayu Yang, Tao Yang, Weijun Li, Xiang Chang, Fei Chao, Changjing Shang, Qiang Shen

机构 * Xiamen University(厦门大学) Aberystwyth University(阿伯里斯特威斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出PhysReflect-VLA框架,通过物理可行性评估和结构化自反思增强VLA策略,在闭环控制中实现稳定多阶段操作,平均成功率提升5.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26602 2026-06-26 cs.CV 新提交 67%

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

DiCoBench: 通过差异性和共性视觉线索进行多图像细粒度感知的基准测试

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出DiCoBench,一个包含765个样本的高分辨率多图像基准,通过差异性和共性视觉线索评估多模态大模型的细粒度感知能力,发现顶尖模型与人类准确率(98.3%)差距显著。

Comments Accepted by ECCV 2026. Project page with code: https://github.com/PKU-ICST-MIPL/DICO_Bench_ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26533 2026-06-26 cs.RO 新提交 67%

OSC2Runner: OpenSCENARIO 2.x Compliant High-Fidelity AV Simulation in CARLA

OSC2Runner: 在CARLA中实现符合OpenSCENARIO 2.x的高保真自动驾驶仿真

Thoshitha Gamage, Lasanthi Gamage

机构 * Southern Illinois University Edwardsville(南伊利诺伊大学爱德华兹维尔分校) Webster University(韦伯斯特大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出OSC2Runner框架,通过多遍转译器架构将OpenSCENARIO v2.x DSL原生映射到CARLA,实现确定性行为树执行,解决现有仿真中的时空漂移和延迟问题。

Comments Accepted at 26th IEEE International Conference on Software Quality, Reliability, and Security (QRS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26524 2026-06-26 cs.CR 新提交 67%

VIGIL: Runtime Enforcement of Behavioral Specifications in AI Agent Skills

VIGIL:AI代理技能中行为规范的运行时执行

Ying Li, Yanju Chen, Hongbo Wen, Bosi Zhang, Hanzhi Liu, Peiran Wang, Yu Feng, Yuan Tian

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出VIGIL框架,通过符号策略语言将自然语言规范转化为SMT约束,实现代理系统跨技能行为策略的运行时监控,检测违规召回率>95%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25837 2026-06-25 cs.DL 新提交 67%

Towards an Interactive Evidence-RAG Peer-Review Workspace for the Journal of Digital History

面向《数字历史期刊》的交互式证据RAG同行评审工作空间

Elisabeth Guerard, Mehrdad Almasi, Marion Salaun, Frederic Clavert, Mirjam Pfeiffer

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出一个交互式证据RAG工作空间,用于《数字历史期刊》的AI辅助同行评审编辑评估,通过链接评论、证据、检索痕迹和可重复性检查提高模型建议的可检查性,初步评估显示严格准确率70.0%,有用输出率90.0%。

Comments Preliminary version of a full paper. 9 pages, 1 figure, 5 tables. Associated with an accepted presentation at AI through History, History through AI, C2DH, University of Luxembourg, 15-16 June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25763 2026-06-25 cs.CV 新提交 67%

ShutterMuse: Capture-Time Photography Guidance with MLLMs

ShutterMuse: 基于多模态大语言模型的拍摄时刻摄影指导

Jiayu Li, Yixiao Fang, Tianyu Hu, Wei Cheng, Ping Huang, Zheheng Fan, Gang Yu, Xingjun Ma

机构 * Fudan University(复旦大学) StepFun

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CaptureGuide-Bench基准测试,评估MLLM在摄影师构图与主体姿态推荐方面的能力,并构建ShutterMuse统一模型,通过监督与强化微调实现最佳综合性能。

Comments Project Page:https://lijayutnt.github.io/ShutterMuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25634 2026-06-25 cs.CV 新提交 67%

SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity

SSMNBench: 通过单视图充分性与多视图必要性诊断基于图像的跨视角人-物理解

Tianchen Guo, Chen Liu, Ling Chen, Xin Yu

机构 * The University of Queensland(昆士兰大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of Technology Sydney(悉尼科技大学) Follow Me AI Pty LTD(Follow Me AI有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SSMNBench基准,通过单视图充分性(SVS)和多视图必要性(MVN)任务分类,诊断MLLM在跨视角人-物理解中的视觉干扰退化和跨视角融合失败问题。

Comments European Conference on Computer Vision (ECCV). 32 pages, 10 figures. The code is available at: $ \href{https://github.com/gtc-gh/SSMNBench}{\text{SSMNBench}} $

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25334 2026-06-25 cs.MA 新提交 67%

Bridging the Post-discharge Gap: A Traceable Multi-agent Framework for Safe and Continuous Care

弥合出院后鸿沟:用于安全持续护理的可追溯多智能体框架

Runwei Guan, Yi Zhou, Heyi Lin, Jinjing Zhu, Mingyuan Hou, Yang Yang, Fang Yuan, Xiaohong Lin, Shaofeng Liang, Xuming Hu, Tao Li, Tianbin Zhao, Yutao Yue, Zhiyuan Wang, Hui Xiong

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Healink框架,通过记忆增强的多智能体架构和约束检索生成,实现基于处方的可追溯出院后随访,在回顾性和盲评中优于医生基线。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25279 2026-06-25 cs.CV 新提交 67%

MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI

MRI2Rep:3D肝脏MRI的自回归结构化报告生成

Xinran Li, Junlin Yang, Annabella Shewarega, Zongwei Zhou, Julius Chapiro, James S. Duncan, Lawrence H. Staib

机构 * Department of Biomedical Engineering(生物医学工程系) Department of Radiology & Biomedical Imaging(放射学与生物医学影像系) Department of Electrical Engineering(电气工程系) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出MRI2Rep自回归框架,通过报告到标签规范化模块将自由文本转换为结构化诊断序列,实现3D肝脏MRI的端到端结构化报告生成,在真实数据集上优于基线方法。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 67%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24883 2026-06-24 cs.CV 新提交 67%

BenchX: Benchmarking AI Models for Cancer Detection and Localization with Demographic and Protocol Biases

BenchX: 基于人口统计和协议偏差的癌症检测与定位AI模型基准测试

Qi Chen, Wenxuan Li, Pedro R. A. S. Bassi, Xinze Zhou, Jakob Wasserthal, Ibrahim Ethem Hamamci, Sezgin Er, Ashwin Kumar, Yiwen Ye, Yuhan Wang, Yuyin Zhou, Akshay S. Chaudhari, Curtis Langlotz, Kang Wang, Yang Yang, Alan L. Yuille, Zongwei Zhou

机构 * Johns Hopkins University(约翰霍普金斯大学) German Cancer Research Center(德国癌症研究中心) University Hospital Basel(巴塞尔大学医院) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院AI中心) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Stanford University(斯坦福大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Nanyang Technological University(南洋理工大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, San Francisco(加州大学旧金山分校) Johns Hopkins Medicine(约翰霍普金斯医学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出BenchX基准,通过85,355次CT扫描系统评估12个肿瘤检测AI模型在肿瘤大小、位置、患者亚组和成像协议上的表现,揭示模型在罕见亚组中性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24446 2026-06-24 cs.SE 新提交 67%

Agentic Generation of AST Transformation Rules for Fixing Breaking Updates

用于修复破坏性更新的AST转换规则的智能体生成

Frank Reyes, Benoit Baudry, Martin Monperrus

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出BigBag框架,通过智能体生成可复用的API级AST转换规则,修复依赖更新导致的编译错误,在BUMP基准上实现78.6%的修复率和跨项目33.3%的修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24058 2026-06-24 cs.CV 新提交 67%

VisChronos: Revolutionizing Image Captioning Through Real-Life Events

VisChronos: 通过真实事件革新图像描述生成

Phuc-Tan Nguyen, Hieu Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出VisChronos框架,利用大语言模型和密集描述模型从单张图像识别并描述真实事件,构建EventCap数据集,提升描述生成的上下文相关性和事件聚焦能力。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21735 2026-06-23 eess.AS cs.SD 新提交 67%

Bridging the Age Gap: Towards Detecting Neural Audio Codec Synthesized Elderly Speech Deepfake

弥合年龄差距:面向检测神经音频编解码器合成的老年语音深度伪造

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Chi-Chun Lee

机构 * BIIC Lab, NTHU, Taiwan(国立台湾大学BIIC实验室) UPES, India(印度UPES大学) VBSPU, India(印度VBSPU大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出老年语音编解码伪造检测(ECFD)任务,发布中英文ECF数据集,发现现有检测器泛化差,利用多模态基础模型融合(BONSAI框架)实现1.66%平均等错误率,建立新基准。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23081 2026-06-23 cs.DB 新提交 67%

SemCEB: A Cardinality Estimation Benchmark for Semantic Operators

SemCEB:面向语义操作符的基数估计基准

Andreas Zimmerer, Claudius Kühn, Yang Li, Mihail Stoian, Renata Borovica-Gajic, Andreas Kipf

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SemCEB基准,用于评估语义过滤和连接操作符的基数估计方法,基于真实多模态数据,评估采样和语义直方图方法的准确性、成本、延迟和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22699 2026-06-23 cs.CV cs.MM 新提交 67%

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

无需发送视频即可识谎:隐私保护的多模态欺骗检测

Nikita Sharma, Pranav Sara, Karan Singla

机构 * University of California, San Diego(加州大学圣迭戈分校) Case Western Reserve University, Ohio(凯斯西储大学) WhissleAI, USA(WhissleAI(美国))

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22274 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa

从语音到文本语料库:评估基于ASR的低资源Fongbe和豪萨语数据采集

Mahounan Pericles Adjovi, Victor Olufemi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) North-West University(北开普大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究利用ASR管道为低资源非洲语言Fongbe(声调语言)和豪萨语(非声调语言)扩展文本语料,通过微调MMS-300M和Whisper-Small模型,在Fongbe上实现9.48%的词错误率(相对降低78%),并评估转录质量,发现豪萨语接近可用而Fongbe需后处理。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21309 2026-06-23 cs.CV 新提交 67%

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

WildBox: 非洲稀树草原野生动物航拍单目3D检测数据集与基准

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, Devis Tuia, Fabio Remondino, Benjamin Risse

机构 * D Optical Metrology Unit, Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会3D光学计量部) Computer Vision and Machine Learning Systems group, Institute for Geoinformatics, University of Muenster(明斯特大学地理信息学研究所计算机视觉与机器学习系统组) School of Civil, Aerospace and Design Engineering, University of Bristol(布里斯托大学土木、航空航天与设计工程学院) Department of Biology, University of Southern Denmark(南丹麦大学生物学系) The Ohio State University(俄亥俄州立大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所集体行为系) University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物学系) Environmental Computational Science and Earth Observation Laboratory, EPFL(瑞士联邦理工学院环境计算科学与地球观测实验室)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 提出WildBox数据集,含23.7万3D框标注,评估两种开放词汇单目3D架构,发现零样本3D检测失败,微调后恢复性能,深度估计是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20770 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

Beyond 'One Language, One Script': Quantifying Orthographic Bias in Multilingual VLMs with PuMVR

超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。

Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18671 2026-06-18 cs.HC 新提交 67%

HANSEL: Extracting Breadcrumbs from Web Agent Trajectories for Interactive Verification

HANSEL: 从Web智能体轨迹中提取面包屑用于交互式验证

Yujin Zhang, Daye Nam

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出HANSEL系统,从AI智能体轨迹中提取可交互验证的证据,减少用户审查负担,在基准测试中达到83.7%精确率和88.9%召回率,用户研究显示显著降低任务完成时间和感知努力。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06926 2026-06-18 cs.CV cs.MM 新提交 67%

SVHighlights: Towards Extremely Long Sport Video Highlight Detection

SVHighlights: 迈向极长体育视频精彩片段检测

Donggyu Lee, Youngbin Ki, Jeonghun Kang, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology(釜山国立科学研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有方法无法处理超长视频精彩片段检测的问题,提出首个基准SVHighlights(包含320个平均时长2小时的体育视频)以及无训练的分段方法TF-SELECTOR,通过大语言模型融合多模态信息预测片段级显著性分数,在多个指标上超越现有基线。

Comments Accepted to KDD 2026 (Datasets and Benchmarks Track). Project Page: https://leedongkyu2019.github.io/SVHighlights/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18198 2026-06-17 cs.CR cs.CV 新提交 67%

Seeing Is Not Screening: Multimodal Hidden Instruction Attacks on Agent Skill Scanners

看见不等于筛查:针对智能体技能扫描仪的多模态隐藏指令攻击

Xiaojun Jia, Jie Liao, Simeng Qin, Ke Ma, Wenbo Guo, Yebo Feng, Aishan Liu, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) University of Chinese Academy of Sciences, China(中国科学院大学) Beihang University, China(北航大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对现有技能扫描仪忽视图像中恶意指令的盲点,提出SkillCamo多模态攻击将指令隐藏于图像,并设计ExecScan执行级扫描模块,通过意图提取、行为重建等检测隐藏指令,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17458 2026-06-17 cs.CE 新提交 67%

ICBCBench: An Industry Consortium Benchmark for Financial Deep Research

ICBCBench:面向金融深度研究的行业联盟基准

Weiya Li, Zhiwei Tang, Yizhou He, Chenghao Wang, Liang Feng, Xiao Sun, Dongrui Liu, Zichen Wen, Hu Wei, Jinghang Wang, Yi Luo, Li Guo, Linfeng Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对金融领域深度研究代理评估标准缺失的问题,提出ICBCBench基准,采用客观任务与主观报告评估双轨范式,揭示当前模型在复杂推理、事实依据和报告质量上的显著差距。

Comments 33 pages, 14 figures. Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17449 2026-06-17 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 67%

MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation

MODE-RAG: 基于流形异常诊断和能量的检索增强生成评估

Zehang Wei, Jiaxin Dai, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MODE-RAG多智能体系统,利用变分自由能和内部注意力状态动态门控干预,结合蒙特卡洛树搜索和logit扰动减少多模态检索增强生成中的幻觉和逻辑捏造。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10728 2026-06-17 cs.SE 新提交 67%

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

DeNovoSWE:扩展长时域环境以从零生成完整仓库

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 67%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏