arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 197 篇

2606.00029 2026-06-02 cs.CL cs.AI 62%

TCAR-Gen: Temporal Graph Retrieval with Evidence Fusion for Knowledge-Grounded Generation

TCAR-Gen: 基于证据融合的时间图检索用于知识增强生成

Sidra Nasir, Muhammad Noman Zahid, Rizwan Ahmed Khan

机构 * Dipartimento di Informatica, Università di Verona(威尼斯大学计算机科学系) School of Advanced Studies, University of Camerino(坎皮诺大学高级研究学院) Department of Computer Science, School of Mathematics and Computer Science, Institute of Business Administration (IBA), Karachi, Pakistan(卡拉奇工商管理学院(IBA)数学与计算机科学学院计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TCAR-Gen框架,结合查询条件图神经网络、时间证据融合和树链推理,在历史犯罪叙事问答中实现时间推理和多源证据融合,优于现有RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00017 2026-06-02 cs.AI cs.CL cs.MA 62%

MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution

MindGames Arena 泛化赛道:具有延迟每步奖励归因的 In2AI 解决方案

Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov

机构 * iMak AI Lab(iMak人工智能实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出延迟每步奖励归因方法,结合资格门控、异步rollout生成和课程对手采样,实现多智能体环境中稳定高效的强化学习训练,并在NeurIPS 2025的MindGames Arena基准测试中取得领先。

Comments 18 pages, 2 figures, 9 tables. Technical report. First place in both Open and Efficient tracks of MindGames Arena Generalization Track at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00016 2026-06-02 cs.CL cs.AI 62%

AEyeDE: An Attention-Based Attribution Framework for AI-Generated Text Detection

AEyeDE:一种基于注意力的人工智能生成文本检测归因框架

Aria Nourbakhsh, Adelaide Danilov, Christoph Schommer, Salima Lamsiyah

机构 * University of Luxembourg(卢森堡大学) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出AEyeDE框架,利用代理Transformer模型的注意力归因矩阵,通过轻量级CNN区分人类与AI生成文本,在多种设置下优于文本基线,并揭示注意力图的局部结构差异。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26068 2026-06-02 cs.LG cs.AI 62%

Rethinking Weak Supervision in Anomaly Detection: A Comprehensive Benchmark

重新思考异常检测中的弱监督:一个综合基准

Xu Yao, Siyuan Zhou, Zhenbo Wu, Chaochuan Hou, Shuang Liang, Shiping Wang, Hailiang Huang, Songqiao Han, Minqi Jiang

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济交叉学科重点实验室)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出WSADBench,首个统一评估不完全、不精确和不准确三种弱监督异常检测场景的基准,通过系统变化标签数量、粒度和质量,揭示36种算法在4种模态上的性能边界,并发现弱监督场景间存在强相关性、专用WSAD算法仅在极端标签稀缺时占优等关键洞察。

Comments Accepted at KDD 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30188 2026-06-02 cs.LG cs.AI stat.ML 62%

CalArena: A Large-Scale Post-Hoc Calibration Benchmark

CalArena:大规模事后校准基准

Eugène Berta, David Holzmüller, Francis Bach, Michael I. Jordan

机构 * Inria - Ecole Normale Supérieure PSL Research University(法国国家科学研究中心-巴黎高等师范学院-巴黎-萨克雷大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出CalArena大规模标准化基准,涵盖近2000个实验,通过事后改进(PHI)原则比较多种校准方法,发现平滑校准函数优于分箱方法,专用多类方法在高维场景中至关重要。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03312 2026-06-02 cs.CL cs.AI cs.HC eess.AS q-bio.NC 62%

Escaping the BLEU Trap: A Signal-Grounded Framework with Decoupled Semantic Guidance for EEG-to-Text Decoding

逃离BLEU陷阱:一种基于信号锚定与解耦语义引导的脑电解码文本框架

Yuchen Wang, Haonan Wang, Yu Guo, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 针对脑电解码文本中语义偏差、信号忽略和BLEU陷阱问题,提出SemKey多阶段框架,通过解耦语义目标(情感、主题、长度、意外性)和主动检索解码机制,强制生成基于信号而非语言先验,并采用检索和分布度量(如Fréchet距离)建立评估协议,有效缓解幻觉并达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05613 2026-06-02 cs.CY cs.AI cs.LG 62%

Who Evaluates AI's Social Impacts? Mapping Coverage and Gaps in First and Third Party Evaluations

谁在评估人工智能的社会影响?第一方和第三方评估的覆盖范围与差距分析

Anka Reuel, Avijit Ghosh, Jenny Chim, Andrew Tran, Yanan Long, Jennifer Mickel, Usman Gohar, Srishti Yadav, Pawan Sasanka Ammanamanchi, Mowafak Allaham, Hossein A. Rahmani, Mubashara Akhtar, Felix Friedrich, Robert Scholz, Michael Alexander Riegler, Jan Batzner, Eliya Habba, Arushi Saxena, Anastassia Kornilova, Kevin Wei, Prajna Soni, Yohan Mathew, Kevin Klyman, Jeba Sania, Subramanyam Sahoo, Olivia Beyer Bruvik, Pouya Sadeghi, Sujata Goswami, Angelina Wang, Yacine Jernite, Zeerak Talat, Stella Biderman, Mykel Kochenderfer, Sanmi Koyejo, Irene Solaiman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 通过分析186份第一方发布报告和248份第三方评估来源,结合开发者访谈,揭示了第一方报告稀疏且流于表面,而第三方评估更广泛深入,但数据溯源、内容审核劳动等关键领域存在披露缺口,呼吁政策强制开发者透明化并加强独立评估生态。

Comments Accepted at the Forty-Third International Conference on Machine Learning (ICML), 2026, in Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02556 2026-06-02 cs.CL 57%

HERO'S JOURNEY: Testing Complex Rule Induction with Text Games

英雄之旅:用文本游戏测试复杂规则归纳

Anshun Asher Zheng, Kanishka Misra, David I. Beaver, Junyi Jessy Li

机构 * Department of Linguistics(语言学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出HERO'S JOURNEY基准,通过目标导向的文本游戏评估大型语言模型在属性与程序归纳任务中的规则推理能力,发现模型虽能进行规则归纳但能力有限且不均衡,程序执行成为瓶颈,而表面语义影响较小。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02384 2026-06-02 cs.LG 57%

TabPrep: Closing the Feature Engineering Gap in Tabular Benchmarks

TabPrep: 弥合表格基准测试中的特征工程差距

Andrej Tschalzev, Nick Erickson, Yuyang Wang, Huzefa Rangwala, Stefan Lüdtke, Heiner Stuckenschmidt, Christian Bartelt

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出TabPrep,一个轻量级预处理流程,通过针对三种特定数据模式设计的特征生成器,系统性地进行特征工程,显著提升多种模型在表格基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01279 2026-06-02 cs.AI 57%

ANDES: Agent Native Data Evolving Synthesis Tool for Autonomous Instruction Alignment

ANDES:用于自主指令对齐的智能体原生数据演化合成工具

Zhengyang Zhao, Shengjie Ye, Lu Ma, Hao Liang, Hengyi Feng, Wentao Zhang

机构 * Peking University(北京大学) Sichuan University, Chengdu(四川大学,成都)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出ANDES框架,通过自进化世界树路由和可操作诊断报告,将数据生成重构为即插即用的智能体技能,使基础较弱的智能体在严格计算约束下实现自动对齐,在PostTrainBench上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00987 2026-06-02 cs.CV cs.AI 57%

An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation

多时相指代分割的开源基准与基线

Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) China Telecom(中国电信) School of Artificial Intelligence, Optics and Electronics (iOPEN)(人工智能、光学与电子学院) Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出多时相指代分割任务,通过自动化数据构建管道CRAFT-Agent生成首个基准MTRefSeg-21K,并设计两阶段训练的变化感知LVLM框架MTRefSeg-R1,实现优于现有基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00775 2026-06-02 cs.CV cs.AI 57%

GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval

GIRL-DETR: 梯度隔离强化学习用于视频时刻检索

Shihang Zhang, Mingjin Kuai, Ye Wei, Zhen Zhang, Wei Ji

机构 * College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 针对视频时刻检索中连续代理损失与非可微指标不匹配导致的优化停滞问题,提出梯度隔离强化学习框架GIRL-DETR,通过冻结骨干网络并采用三阶段渐进强化学习策略直接优化tIoU指标,在轻量级模型中实现定位精度提升。

Comments 13 pages, 6 figures. Submitted to IEEE Transactions on Image Processing (TIP). Code is available at: https://github.com/Z-Shihang/GIRL-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00447 2026-06-02 cs.CV cs.AI 57%

GeoSAM-3D: Geodesic Prompt Propagation for Open-Vocabulary 3D Scene Segmentation from Monocular Video

GeoSAM-3D: 用于从单目视频进行开放词汇3D场景分割的测地线提示传播

Arun Sharma

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出GeoSAM-3D方法,利用冻结的视觉基础模型和单目3D高斯泼溅重建,通过可微分的图-测地线传播核在场景图上传播用户提示,实现从单目视频的开放词汇3D场景分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00404 2026-06-02 cs.CV cs.LG 57%

Rethinking Amortized Neural Representations for High-Resolution Terrain Elevation Data

重新思考高分辨率地形高程数据的摊销神经表示

Haoan Feng, Xin Xu, Leila De Floriani

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对地形高程数据,提出HUVR+SIREN超网络方法,通过替换坐标解码器为平滑可微版本,在统一基准上实现最佳高度和导数保真度,且支持后训练量化压缩。

Comments 12 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00090 2026-06-02 cs.RO cs.AI 57%

Silent Failures in Physical AI: A Literature Review of Runtime Action Authorization for Autonomous Systems

物理AI中的静默故障:自主系统运行时动作授权的文献综述

Barak Or

机构 * STATE16

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文综述了物理AI系统中黑箱模型发出看似合理但实际错误的物理动作导致的静默故障问题,提出了运行时防护栏的分类和评估要求。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00054 2026-06-02 cs.RO cs.AI cs.CV 57%

From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data

从人类视频到机器人操作:基于人类中心数据的可扩展视觉-语言-动作学习综述

Zhiyuan Feng, Qixiu Li, Huizhi Liang, Rushuai Yang, Yichao Shen, Zhiying Du, Zhaowei Zhang, Yu Deng, Li Zhao, Hao Zhao, Zongqing Lu, Oier Mees, Marc Pollefeys, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) HKUST(香港科技大学) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Microsoft Zurich Project(微软苏黎世实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 本文综述了如何将丰富的人类视频转化为视觉-语言-动作(VLA)模型的有效知识,分类了四种方法(潜在动作表示、预测世界模型、显式2D监督、显式3D重建),并指出了结构化非结构化视频、跨具身和视角的动作映射、以及评估协议设计三大挑战。

Comments Accepted to IJCAI 2026 Survey Track. Project page: https://aaronfengzy.github.io/HumanCentricToVLA-Survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12768 2026-06-02 stat.ML cs.LG 57%

ISOMORPH: A Supply Chain Digital Twin for Simulation, Dataset Generation, and Forecasting Benchmarks

ISOMORPH:用于仿真、数据集生成和预测基准的供应链数字孪生

Zhizhen Zhang, Hyemin Gu, Benjamin J. Zhang, Daniel Elenius, Michael Tyrrell, Theo J. Bourdais, Houman Owhadi, Markos A. Katsoulakis, Tuhin Sahai

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of North Carolina(北卡罗来纳大学) SRI International(SRI国际) California Institute of Technology(加州理工学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出ISOMORPH,首个公开的多级物流网络数字孪生,通过可配置参数和模块化拓扑生成具有牛鞭效应等动态特性的数据集,并评估基础模型的零样本预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07061 2026-06-02 cs.SD cs.AI cs.CV cs.MM 57%

Do Joint Audio-Video Generation Models Understand Physics?

联合音视频生成模型是否理解物理?

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu, Zexin Xu, Weiguo Pian, Shijian Deng, Feiyu Du, Chenming Ge, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。

Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14514 2026-06-02 cs.AI cs.CE 57%

Perspective on Bias in Biomedical AI: Preventing Downstream Healthcare Disparities

生物医学AI中的偏见视角:防止下游医疗保健差异

Michal Rosen-Zvi, Yoav Kan-Tor, Michael Danziger, Agata Ferretti, Javier Aula-Blasco, Julia Falcao, Ron Shamir, Mira Marcus-Kalish, Mordechai Muszkat

机构 * Weizmann Institute of Science(魏茨曼科学研究院) Hebrew University of Jerusalem(特拉维夫大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文通过分析2015-2024年4514篇组学出版物和大型数据集,揭示数据收集和研究中存在的严重人口偏见,并提出通过来源、开放性和评估透明度三个原则来预防下游医疗保健差异。

Comments This manuscript has been accepted for publication in the 2026 IEEE International Conference on Digital Health (ICDH). The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10579 2026-06-02 cs.RO cs.AI 57%

AffordGen: Generating Diverse Demonstrations for Generalizable Object Manipulation with Afford Correspondence

AffordGen: 通过可供性对应生成多样化演示以实现通用物体操作

Jiawei Zhang, Kaizhe Hu, Yingqian Huang, Yuanchen Ju, Zhengrong Xue, Huazhe Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Fudan University(复旦大学) UC Berkeley(伯克利大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出AffordGen框架,利用3D生成模型和视觉基础模型在大规模3D网格上的语义对应生成多样化操作轨迹,训练鲁棒的闭环视觉运动策略,实现零样本泛化到未见物体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27223 2026-06-02 cs.CV cs.AI 57%

EuraGovExam: A Multilingual Multimodal Benchmark from Real-World Civil Service Exams

EuraGovExam:来自现实世界公务员考试的多语言多模态基准

Jaeseong Kim, Chaehwan Lim, Sang Hyun Gil, Suan Lee

机构 * School of Computer Science / Data Intelligence Lab(计算机科学学院/数据智能实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出一个包含8000多道真实公务员考试题目的多语言多模态基准EuraGovExam,要求模型直接从图像中进行布局感知的跨语言推理,当前最先进的视觉语言模型准确率仅达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25640 2026-06-02 cs.DL cs.CL 57%

RenoBench: A Citation Parsing Benchmark

RenoBench: 引文解析基准

Parth Sarin, Juan Pablo Alperin, Adam Buttrick, Dione Mentis

机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Public Knowledge Project, Simon Fraser University(公共知识项目,西蒙弗雷泽大学) DataCite, Hannover, Germany(DataCite,德国汉诺威) California Digital Library, University of California Office of the President(加州数字图书馆,加州大学校长办公室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有引文解析评估方法不可泛化、基于合成数据或不可公开获取的问题,提出从四个出版生态系统收集的公开基准RenoBench,通过自动验证和特征采样构建多语言、多类型数据集,并评估多种解析系统,结果表明语言模型(尤其微调后)表现优异,为可重复标准化评估奠定基础。

Comments Presented as a conference paper at CiteX 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11560 2026-06-02 cs.IR cs.AI 57%

Characterizing Web Search in The Age of Generative AI

生成式AI时代下网络搜索的特征刻画

Elisabeth Kirsten, Jost Grosse Perdekamp, Qinyuan Wu, Mihir Upadhyay, Krishna P. Gummadi, Muhammad Bilal Zafar

机构 * UA Ruhr Research Center for Trustworthy Data Science and Security(乌尔姆-鲁尔可信数据科学与安全研究中心) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 通过系统比较传统搜索与多个生成式搜索系统,揭示了它们在知识来源、多样性、稳定性上的差异,并指出生成式搜索引入了现有评估范式未覆盖的新维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01132 2026-06-02 cs.CV 50%

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

HakushoBench:来自政府白皮书的日语图表VQA基准

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) NII(日本学术振兴会) NII LLMC(日本学术振兴会LLMC)

专题命中 评测与基准 :language model(abstract)

AI总结 利用政府白皮书构建日语图表VQA基准HakushoBench,包含2053张图像和人工标注问答对,评估视觉语言模型对图表的深度理解。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01050 2026-06-02 cs.CV 50%

TextFake: Benchmarking AI-Generated Image Detection on Text-Rich Images

TextFake: 对富含文本图像中AI生成图像检测的基准测试

Yuning Zhang, Changtao Miao, Mingyu Liao, Tingyu Liu, Xinghao Wang, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) Individual Researcher(独立研究者)

专题命中 评测与基准 :prompting(abstract)

AI总结 针对AI生成图像检测在富含文本图像上的空白,构建包含28种语言、2万图像的TextFake基准,评估14种检测器和3种VLM API,发现系统性能差距并诊断三种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00640 2026-06-02 cs.CV 50%

An Attribute-Based Measure of Video Complexity

基于属性的视频复杂度度量

Aditya Sarkar, Yi Li, Zihao Wang, Jiacheng Cheng, Sai Vidyaranya Nuthalapati, Aashu Singh, Shlok Kumar Mishra, David Jacobs, Nuno Vasconcelos

机构 * UMIACS-University of Maryland College Park(马里兰大学College Park分校UMIACS) University of California San Diego(加州大学圣地亚哥分校) Yale University(耶鲁大学) Meta AI

专题命中 评测与基准 :LLM(abstract)

AI总结 提出VideoABC框架,通过属性空间量化估计视频-问题对在视频大语言模型上的失败概率,实现非参数复杂度度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00601 2026-06-02 cs.PL cs.DC 50%

ScanWeaver: Compiler-Driven Parallelization of Affine Recurrences via Associative Scan Lowering

ScanWeaver:通过关联扫描降级实现仿射递归的编译器驱动并行化

Qiying Wu, Pavel Zolnikov

专题命中 评测与基准 :language model(abstract)

AI总结 提出ScanWeaver编译器框架,将基于递归的计算转换为关联扫描表示并降级为可执行GPU程序,以解决Mamba等选择性状态空间模型中的输入相关扫描递归的并行化问题。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00592 2026-06-02 cs.CV 50%

Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs

通过PRISM:原则感知、可解释和多尺度的视觉设计评估

Mona Gandhi, KJ Joseph, Srinivasan Parthasarathy, Sayan Nag

机构 * Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出PRISM基准和一种多尺度评估框架,通过原则扰动和分层分析实现可解释的设计质量评估。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00307 2026-06-02 cs.RO 50%

ScaRF-SLAM: Scale-Consistent Reconstruction with Feed-Forward Models and Classical Visual SLAM

ScaRF-SLAM: 基于前馈模型与经典视觉SLAM的尺度一致重建

Yuhao Zhang, Yifu Tao, Frank Dellaert, Maurice Fallon

机构 * Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算机学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出一种解耦框架,将经典特征SLAM用于鲁棒跟踪,几何基础模型仅用于建图,通过尺度优化和子图融合实现高质量一致密集重建,在建筑级数据集上重建精度提升10%-20%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17499 2026-06-02 eess.SY cs.SY eess.SP 50%

A Tutorial on Learning-Based Radio Map Construction: Data, Paradigms, and Physics-Awareness

基于学习的无线电地图构建教程:数据、范式和物理感知

Xiucheng Wang, Yuhao Pan, Nan Cheng, Çağkan Yapar, Ruijin Sun, Zhisheng Yin, Conghao Zhou, Wenchao Xu, Yuxiang Zhang, Jianhua Zhang, Shuguang Cui, Xuemin Shen

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文系统综述了基于学习的无线电地图构建方法,从数据、范式和物理感知三个维度展开,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏