arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2606.10778 2026-06-10 cs.CV 新提交 50%

From Patches to Patients: A study of the tile-to-slide performance transferability in Digital Pathology

从斑块到患者:数字病理学中斑块到全切片性能可迁移性的研究

Sofiène Boutaj, Leo Fillioux, Maria Vakalopoulou, Stergios Christodoulidis, Pierre Marza

机构 * Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎-萨克雷大学、中央理工-高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、IHU PRISM、癌症数据科学单元) Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎-萨克雷大学、中央理工-高等电力学院、MICS实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究斑块级线性探测能否作为全切片级性能的可靠代理,通过19个基础模型在42个切片级和16个斑块级任务上的基准测试,发现斑块与切片性能高度相关,斑块级基准测试可有效筛选候选模型。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10465 2026-06-10 cs.SE 新提交 50%

MASTOR: A Multi-Agent Approach to Semantic Test Oracle Generation for RESTful APIs

MASTOR: 一种面向RESTful API的语义测试预言生成多智能体方法

Sida Deng, Rubing Huang, Zhenzhen Yang, Man Zhang, Xuan Xie, Rongcun Wang

专题命中 评测与基准 :prompting(abstract)

AI总结 提出MASTOR多智能体方法,通过分析源码上下文生成语义测试预言,包括状态字段预言和行为一致性预言,在13个开源项目上达到75.4%平均变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10211 2026-06-10 cs.SE 新提交 50%

TestMap: Evidence Infrastructure for Foundation-Model-Assisted Test Generation

TestMap:基础模型辅助测试生成的证据基础设施

Hunter Leary, Luke Hanuska, Chris Brown

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。

Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10142 2026-06-10 cs.CV 新提交 50%

DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估

Nanshan Jia, Zhenyu Zhao, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) Roblox Corporation(Roblox公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。

Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09615 2026-06-09 cs.RO cs.CV 新提交 50%

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience

DexPIE:基于真实世界经验的稳定灵巧策略改进

Ruizhe Liao, Wenrui Chen, Liangji Zeng, Haoran Lin, Fan Yang, Kailun Yang, Yaonan Wang

机构 * Hunan University(湖南大学)

专题命中 评测与基准 :post-training(abstract)

AI总结 提出DexPIE后训练框架,通过灵巧手适配干预系统、多阶段DAgger数据收集、相对动作空间异步推理和连续最优性指标条件化,在三个真实灵巧操作任务上成功率提升37%。

Comments Project website: https://siiuuuuuu.github.io/DexPIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09453 2026-06-09 cs.CV 新提交 50%

GD-MIL: Grade-Disentangled Multiple Instance Learning for Multimodal Biochemical Recurrence Prediction in Prostate Cancer

GD-MIL:用于前列腺癌多模态生化复发预测的等级解耦多实例学习

Dasari Naga Raju

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对前列腺癌生化复发预测,提出GD-MIL方法,通过梯度反转等级对抗训练实现H&E全切片图像特征与Gleason等级解耦,融合临床变量后C-index达0.704,显著优于临床基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09140 2026-06-09 cs.CV 新提交 50%

DiffSight-Former: Modeling Structural Differences and Temporal Dynamics for Glaucoma Progression Prediction

DiffSight-Former:建模结构差异和时间动态用于青光眼进展预测

Yi Huang, Lei Bi, Jinman Kim

机构 * The University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出DiffSight-Former框架,通过时间变异特征提取、多结构差异建模和时间感知Transformer,从序列眼底图像中预测青光眼进展,在SIGF和GRAPE数据集上取得高AUC和灵敏度。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08278 2026-06-09 cs.RO 新提交 50%

SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation

SIMPLE:基于仿真的人形机器人全身操作策略学习与评估

Songlin Wei, Zhenhao Ni, Jie Liu, Zhenyu Zhao, Junjie Ye, Hongyi Jing, Junkai Xia, Xiawei Liu, Michael Leong, Liang Heng, Di Huang, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(南加州大学物理超级智能实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出SIMPLE仿真平台,结合MuJoCo动力学与IsaacSim渲染,包含60个全身任务、50个室内场景和1000+物体资产,支持自动化轨迹生成和VR遥操作数据采集,并集成多种主流策略,实验证明仿真与真实世界性能强相关,可实现零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08170 2026-06-09 cs.RO 新提交 50%

Learning from Human Driving: A Human-in-the-Loop Online Behavior Cloning Framework for Autonomous Driving

从人类驾驶中学习:一种用于自动驾驶的人机协同在线行为克隆框架

Yuhong Shi, Jianyi Liu, Lihang Sun, Li Li, Xudong Dong

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出人机协同在线行为克隆框架HiL-OBC,通过人类干预初始化策略、贝叶斯潜在行为建模和在线更新,结合大模型感知与人类驾驶智能,在CARLA基准上显著提升驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07667 2026-06-09 physics.data-an nucl-ex physics.ins-det 新提交 50%

Design Principles for AI-Ready QCD Data with a Barrel Imaging Calorimeter Application

面向AI的QCD数据设计原则及其在桶形成像量热器中的应用

Zhiwan Xu, Sylvester Joosten, Minho Kim, Chun Yuen Tsang, Maria Zurek

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出面向AI的QCD数据设计框架,统一异构探测器数据结构,并在ePIC探测器桶形成像量热器模拟数据中验证,实现跨实验AI应用。

Comments 27 pages, 4 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07661 2026-06-09 cs.CV cs.DL 新提交 50%

PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing

PereStruct: 面向鲁棒历史文档解析的多模态语义组装

Maksim Shandybo, Ivan Bespalov, Daniil Yefimov, Marina Kosheleva, Alexander Loukianov

机构 * IGIC RAS(俄罗斯科学院信息传输问题研究所) Yandex Cloud National University of Science and Technology MISIS(莫斯科国立钢铁合金学院) Nekrasov Central Universal Scientific Library(涅克拉索夫中央综合科学图书馆)

专题命中 评测与基准 :language model(abstract)

AI总结 针对历史报纸复杂多栏布局的解析难题,提出结合微调YOLO与语义组装模块的多模态方法,在块到文章映射上F1达0.904,BLEU约0.96,显著优于通用视觉语言模型。

Comments Code and data available at https://github.com/makSShandybo/PereStruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07642 2026-06-09 cs.CV cs.CY 新提交 50%

Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View

视觉语言模型能否感知传感器所感?一种可扩展的专家引导设计用于从街景评估轮椅可达性

Dongdong Wang, Alina Hagen, Isabelle Gatmaitan, Hao Zhou, Yiwen Dong, Shabboo Valipoor, Vivian W. H. Wong, Lingyao Li

机构 * University of Florida(佛罗里达大学) University of South Florida(南佛罗里达大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出专家引导的检索增强框架,利用视觉语言模型从谷歌街景图像识别轮椅可达性障碍,通过GPS轮椅停留行为验证,表明VLM评分与移动摩擦部分一致,但细粒度障碍识别有限。

详情

展开后加载摘要…

URL PDF HTML 收藏