arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 832 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 197 篇

2606.01434 2026-06-02 cs.CL 70%

DrugClaw and DrugAudit: A Primary-Source-Grounded Agent and Authority-Aware Benchmark for Drug-Information Question Answering

DrugClaw与DrugAudit:基于原始来源的智能体与权威感知基准用于药物信息问答

Qing Wang, Bo Li, Jialu Liang, Daling Shi, Bob Zhang, Qianqian Song

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学健康结局与生物医学信息学系,医学院) PAMI Research Group, Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院计算机与信息科学系PAMI研究组)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出多智能体检索增强系统DrugClaw,通过反射驱动状态机查询药物注册与药物警戒知识库,并构建含3772条权威感知基准DrugAudit,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00881 2026-06-02 cs.CL 70%

Chunking Methods on Retrieval-Augmented Generation - Effectiveness Evaluation Against Computational Cost and Limitations

检索增强生成中的分块方法——针对计算成本与局限性的有效性评估

Mateusz Śmigielski, Michał Rajkowski, Mateusz Zbrocki, Michał Bernacki-Janson, Karol Kunicki, Julianna Godziszewska, Maciej Piasecki, Konrad Wojtasik

机构 * Department of Artificial Intelligence, Faculty of Information and Communication Technology, Wrocław University of Science and Technology(人工智能系,信息与通信技术学院,沃斯克大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究首次系统评估多种分块方法在RAG系统中的有效性,揭示分块策略中常被忽视的关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00497 2026-06-02 cs.CR cs.CL 70%

"I Strongly Suspect This Website Is a Scam": Benchmarking PII Leakage and Detection without Defense in Autonomous Web Agents

“我强烈怀疑这个网站是骗局”:自主网络代理中无防御的PII泄露与检测基准测试

Soham Roy, Sarthakbrata Halder, Arya Bharaty, Vaibhav Bhaskar, Yash Sinha, Dhruv Kumar, Srikant Panda, Murari Mandal

机构 * KIIT Bhubaneshwar(KIIT布巴内什瓦尔) BITS Pilani(比特斯理工学院) Lam Research(拉姆研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过构建包含91个攻击者控制环境和10个良性孪生基线的基准Scammer4U,评估前沿自主网络代理在社交工程攻击下的PII泄露风险,发现关键PII泄露率高达54-93%,并揭示了代理检测到攻击但仍有35.9%概率提交PII的检测-行动差距。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00154 2026-06-02 cs.SE cs.AI 70%

Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages

多模态大语言模型在复杂交互网页代码生成上的基准测试

Fan Wu, Lishuai Dong, Cuiyun Gao, Yujia Chen, Yiming Huang, Yang Xiao, Qing Liao

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有基准忽略复杂交互行为的问题,提出WebIGBench基准,包含103个真实复杂网页和871个交互动作,并设计新评估流程,测试多模态大语言模型在交互式网页代码生成上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00101 2026-06-02 cs.CV cs.AI 70%

CoCoVideo: The High-Quality Commercial-Model-Based Contrastive Benchmark for AI-Generated Video Detection

CoCoVideo: 基于商业模型的高质量对比基准用于AI生成视频检测

Huidong Feng, Wentao Chen, Jie Chen, Xinqi Cai, Ruolong Ma, Yinglin Zheng, Yuxin Lin, Ming Zeng

机构 * School of Informatics, Xiamen University(厦门大学信息学院) China Academy of Information and Communications Technology(中国信息通信技术研究院) AI Transcend Pte. Ltd.(AI Transcend有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有数据集依赖低质量开源模型且商业样本带水印的问题,提出包含13个商业生成器的CoCoVideo-26K对比数据集,并设计结合对比学习与置信门控多模态大语言模型的CoCoDetect检测框架,实现高保真AI生成视频的鲁棒检测。

Comments Accepected by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00046 2026-06-02 cs.MM cs.AI cs.CV cs.CY 70%

When Jokes Cross the Line: Analyzing Regular Humor and Dark Humor in YouTube Shorts

当玩笑越界:分析YouTube Shorts中的常规幽默与黑色幽默

Sydney Johns, Sanjeev Parthasarathy, Shantnu Bhalla, Vaibhav Garg

机构 * Virginia Polytechnic Institute and State University(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过构建TwistedHumor数据集(1211个YouTube Shorts及33041条评论的手工标注),结合多视角分析(LLooM概念归纳、评论情感分析、大模型评估),揭示了短格式视频中常规幽默与黑色幽默在主题、观众反应和模型检测上的差异,强调了上下文感知审核的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30000 2026-06-02 cs.AI 70%

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation

Cookie-Bench: 面向网页生成的连续屏幕按键交互评估

Haoyue Yang, Zhangxiao Shen, Fan Ding, Hangting Lou, Yifeng Kou, Haoqing Yu, Jingyao Li, Zhengfan Wu, Siqi Bao, Jing Liu, Hua Wu

机构 * Baidu Inc.(百度公司) Beijing, China(中国北京)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种无参考、自主驱动且整体推理的网页生成评估框架Cookie-Bench,通过元认知监控分阶段收集证据并评分,与专家评分高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29107 2026-06-02 cs.CR cs.AI 70%

GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization

GEO-Bench: 生成式引擎优化中的排名操纵基准测试

Ojas Nimase, Zhe Chen, Gengpei Qi, Yue Zhao, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GEO-Bench基准,统一评估生成式引擎优化中的排名操纵攻击,比较黑盒提示攻击、白盒梯度攻击和白帽策略的有效性与隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24248 2026-06-02 cs.CR cs.AI cs.SE 70%

Attested Tool-Server Admission: A Security Extension to the Model Context Protocol

认证工具服务器准入:模型上下文协议的安全扩展

Alfredo Metere

机构 * Enclawed LLC(Enclawed公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对MCP协议缺乏信任机制的问题,提出mcp-attested扩展,通过离线签名的权限断言、默认拒绝的工具白名单和分级强制审计日志,实现安全服务器准入与工具边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15229 2026-06-02 cs.SE cs.AI 70%

PBT-Bench: Benchmarking AI Agents on Property-Based Testing

PBT-Bench:基于属性测试的AI智能体基准

Lucas Jing, Xinqi Wang, Liao Zhang, Simon S. Du

机构 * Tsinghua University(清华大学) University of Washington(华盛顿大学) Beneficial AI Foundation(有益人工智能基金会)

专题命中 评测与基准 :LLM(abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出PBT-Bench基准,包含100个基于属性测试的问题,用于评估AI智能体从文档中推导语义不变量并生成输入策略的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19344 2026-06-02 cs.CL 70%

Retrieval-Augmented Linguistic Calibration

检索增强的语言校准

Yi-Fan Yeh, Linwei Tao, Minjing Dong, Tao Huang, Jialin Yu, Philip Torr, Chang Xu

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学) University of Oxford, Department of Engineering Science(牛津大学工程科学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出检索增强的语言校准(RALC)框架,通过分布建模和检索增强改写,提升语言置信度表达的真实性和校准性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17738 2026-06-02 cs.CL 70%

When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content

当黄金标准未必标准:评估用户生成内容翻译的挑战

Lydia Nishimwe, Benoît Sagot, Rachel Bawden

机构 * Inria Paris(巴黎研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对用户生成内容(UGC)中非标准语言现象,提出十二种非标准现象和五种翻译行为的分类法,并论证翻译评估需考虑指南的标准化程度,呼吁开发可控的、指南感知的评估框架。

Comments 10 pages (23 with references and appendices). Accepted at EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23866 2026-06-02 cs.SE cs.CL 70%

SWE-rebench V2: Language-Agnostic SWE Task Collection at Scale

SWE-rebench V2: 大规模语言无关的SWE任务集合

Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Alexander Golubev

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出语言无关的自动化流水线SWE-rebench V2,用于大规模收集可执行的软件工程任务并构建RL训练环境,产出涵盖20种语言、3617个仓库的32079个任务数据集。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13937 2026-06-02 cs.LG cs.SE 70%

iML: Executable, Problem-Grounded, and Broadly Exploratory Code-Driven AutoML

iML: 可执行、问题驱动且广泛探索的代码驱动自动机器学习

Dat Le, Duc-Cuong Le, Anh-Son Nguyen, Tuan-Dung Bui, Thu-Trang Nguyen, Son Nguyen, Hieu Dinh Vo

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出iML多智能体框架,通过任务分析、数据剖析、结构化蓝图生成和模块化代码合成,实现可执行、问题驱动且广泛探索的代码驱动AutoML,在MLE-BENCH和iML-BENCH上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09696 2026-06-02 cs.CL 70%

Empathy Applicability Modeling for General Health Queries

通用健康查询的共情适用性建模

Shan Randhawa, Agha Ali Raza, Kentaro Toyama, Julie Hui, Mustafa Naseem

机构 * University of Michigan(密歇根大学) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出共情适用性框架(EAF),基于临床、语境和语言线索对患者查询的情感反应和解释适用性进行分类,以支持异步医疗中的共情沟通。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01639 2026-06-02 eess.AS 67%

RRP-Voice: A Longitudinal Dataset and Benchmark for Recurrent Respiratory Papillomatosis Detection

RRP-Voice:用于复发性呼吸道乳头状瘤病检测的纵向数据集与基准

Wenze Ren, Ke-Han Lu, Kai-Wei Chang, Tiantian Feng, Ching Fang, Zhi-Chi Liao, Dao Thi Hai Yen, Syu-Siang Wang, Yu Tsao, Chi-Te Wang, Shih-Hau Fang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对复发性呼吸道乳头状瘤病(RRP)数据稀缺问题,构建首个纵向语音数据集(26名患者,最长10年随访),并建立涵盖手工特征、端到端深度网络、自监督预训练模型和音频大语言模型的系统基准,验证了纵向信号反映喉镜疾病状态。

Comments Submitted to APSIPA ASC 2026 Special Tracks

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01228 2026-06-02 cs.CY cs.HC 67%

Institutional Trust and the Domestic AI Advantage: Evidence from DeepSeek and ChatGPT Users in China

制度信任与国内AI优势:来自中国DeepSeek和ChatGPT用户的证据

Jiashen Huang, Yu Jia, Xu Pan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究提出“制度棱镜”框架,基于认知-情感信任理论分析405名中国用户数据,发现制度信任正向影响对国内AI模型(DeepSeek)的情感信任并改善认知评价,而低制度信任下国内优势减弱。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00825 2026-06-02 cs.CV cs.ET cs.HC cs.MA 67%

SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory

SuperMemory-VQA:面向长期记忆的自我中心视觉问答基准

Samiul Alam, Shakhrul Iman Siam, Michael J. Proulx, James Fort, Richard Newcombe, Hyo Jin Kim, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) Meta Project(Meta项目)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出SuperMemory-VQA数据集,包含52.9小时AI眼镜录制的日常活动及4853个多选问答对,用于评估AI助手在长期记忆任务上的表现,发现现有系统可靠性不足。

Comments 34 pages, 21 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00167 2026-06-02 cs.SE cs.LO 67%

Specification-Driven Development Benchmark: Security Knowledge Transition

规范驱动开发基准:安全知识迁移

Oleg Grynets, Andrii Salyk, Vasyl Lyashkevych, Oleh Kaskun, Danyil Zhuravchak

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对AI辅助规范驱动开发中安全行为隐式化的问题,提出多层规范安全模型和安全知识迁移方法,通过结构化安全知识提升生成系统的安全性。

Comments 15 pages, 7 figures, 8 tables, 32 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00113 2026-06-02 cs.RO 67%

World Models for Robotic Manipulation: A Survey

机器人操作的世界模型:综述

Fangyuan Wang, Ziyuan Wang, Guorui Pei, Mengshi Zhang, Canxi Liang, Jun Hu, Zhongxuan Li, Jinsong Wu, Ning Han, Zeqing Zhang, Jiaming Qi, Hongmin Wu, Shiyao Zhang, Pai Zheng, Jia Pan, David Navarro-Alarcon, Sichao Liu, Peng Zhou

机构 * Department of Mechanical Engineering, The Hong Kong Polytechnic University(香港理工大学机械工程系) Department of Mechanical Engineering and Automation, Harbin Institute of Technology(哈尔滨工业大学机械工程与自动化系) School of Advanced Engineering, Great Bay University(大湾大学先进工程学院) College of Robotics Science and Engineering, Taiyuan University of Technology(太原科技大学机器人科学与工程学院) School of Data Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)数据科学学院) Department of Mechatronic Engineering, Guangdong Polytechnic Normal University(广东 polytechnic 正常大学机电工程系) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Mechanical and Electrical Engineering, Northeast Forestry University(东北林业大学机械与电气工程学院) Greater Bay Area National Center of Technology Innovation(粤港澳大湾区国家技术创新中心) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业与系统工程系)

专题命中 评测与基准 :pretraining(abstract);post-training(abstract)

AI总结 本文通过三个问题(预测什么未来表示、预测如何与动作连接、何时在机器人学习流程中使用预测)系统综述了机器人操作中的世界模型,将其定义为动作条件预测系统,并分类为五种表示族,提出了功能分类法,总结了基础设施角色、数据集和评估协议,揭示了从任务特定动力学预测器向预测基础设施的演变及开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27645 2026-06-02 cs.CV 67%

OpenDPR: Open-Vocabulary Change Detection via Vision-Centric Diffusion-Guided Prototype Retrieval for Remote Sensing Imagery

OpenDPR:面向遥感影像的基于视觉中心扩散引导原型检索的开放词汇变化检测

Qi Guo, Jue Wang, Yinhe Liu, Yanfei Zhong

机构 * Wuhan University(武汉大学) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 提出OpenDPR框架,通过扩散模型构建原型并检索视觉相似性,解决开放词汇变化检测中类别识别瓶颈,并设计S2C模块增强变化定位能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04094 2026-06-02 cs.CV 67%

VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding

VideoBrain: 学习自适应帧采样以理解长视频

Junbo Zou, Ziheng Huang, Shengjie Zhang, Liwen Zhang, Weining Shen

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract)

AI总结 提出VideoBrain框架,通过CLIP和均匀采样双智能体策略,使视觉语言模型自适应获取关键帧,在减少30-40%帧数的同时提升长视频理解准确率3.5%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01992 2026-06-02 cs.CV cs.AI cs.LG 62%

A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision

文本引导异常检测的结构化基准:当语言停止条件化决策时

Stefano Samele, Eugenio Lomurno, Teodora Jovanovic, Sanjay Shivakumar Manohar, Alberto Crivellaro, Matteo Matteucci

机构 * Politecnico di Milano, AIRLab(米兰理工学院,AIRLab) S&H – Software & Hardware(S&H – 软件与硬件)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结构化基准TGAD,通过三个场景逐步增加语言功能角色,评估多模态异常检测系统的文本引导能力,发现当前系统仅表面受语言条件化,标准基准高估了其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01901 2026-06-02 cs.CV cs.AI cs.CL 62%

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

图像重建游戏:通过迭代多模态对话建立共同基础

Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩大学语言学系计算语言学部) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出图像重建游戏基准,通过多轮迭代中视觉语言模型向图像生成器发出纠正指令,使累积的共同基础直接可视化为重建图像,发现描述器是重建质量的主导因素,而生成器决定迭代改进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01725 2026-06-02 cs.AI cs.LG 62%

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01393 2026-06-02 cs.CL cs.AI cs.CV 62%

Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing

Dr. DocBench:专家级与困难文档解析的综合基准

Minglai Yang, Xinyan Velocity Yu, Pengyuan Li, Xinyu Guo, Zhenting Qi, Konwoo Kim, Longtian Ye, Xiaolong Luo, Jinhe Bi, Henry Zhang, Haris Riaz, Xuan Zhang, Yunze Xiao, Bangya Liu, Tom Tang, Yunfei Zhao, Qunshu Lin, Zihan Wang, Minghao Liu, Michael Lingzhi Li, Yilun Du, Jesse Thomason, Rogerio Feris, Alex Pentland, Zexue He

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Harvard University(哈佛大学) IBM Research(IBM研究院) University of Arizona(亚利桑那大学) Duke University(杜克大学) UC Berkeley(加州大学伯克利分校) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Dr. DocBench基准,通过基于解析器失败的采样从多语言书籍语料库中选取挑战性文档,包含52个BISAC主题领域和65k高质量标注,用于评估专家级文档解析能力。

Comments 27 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01057 2026-06-02 cs.CV cs.AI cs.GR cs.LG 62%

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

3DCodeBench:通过代码进行智能体程序化3D建模的基准测试

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。

Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00548 2026-06-02 cs.CV cs.AI cs.LG 62%

CAFOSat: A Strongly Annotated Dataset for Infrastructure-Aware CAFO Mapping Using High-Resolution Imagery

CAFOSat:用于基于高分辨率影像的基础设施感知型CAFO制图的高质量标注数据集

Oishee Bintey Hoque, Nibir Chandra Mandal, Mandy L Wilson, Samarth Swarup, Madhav Marathe, Abhijin Adiga

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute, University of Virginia(弗吉尼亚大学生物复杂性研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对集中式动物饲养操作(CAFO)大规模制图困难,提出CAFOSat数据集,集成高分辨率NAIP影像与多源CAFO清单,通过人机协同标注、GradCAM定位和几何聚类优化弱定位记录,并引入合成增强管道,实现基础设施级标注和鲁棒分类。

Comments Accepted at CVPR Workshop-2026. First two authors has equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00267 2026-06-02 cs.CV cs.AI cs.LG cs.RO 62%

StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement

StressDream: 引导视频世界模型实现鲁棒的策略评估与改进

Junwon Seo, Sushant Veer, Ran Tian, Wenhao Ding, Apoorva Sharma, Karen Leung, Edward Schmerling, Marco Pavone, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA Research(NVIDIA研究) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。

Comments Project page: https://junwon.me/StressDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00080 2026-06-02 cs.CV cs.AI cs.LG cs.NE 62%

Planktonzilla: Multimodal dataset and models for understanding plankton ecosystems

Planktonzilla: 用于理解浮游生态系统的多模态数据集与模型

Alan Gerson Contreras Montanares, Luis Valenzuela, Luis Martí, Nayat Sanchez-Pi

机构 * Inria Chile Research Center(Inria智利研究中心)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 为解决浮游生物分类模型泛化性差的问题,提出统一数据集Planktonzilla-17M(含1740万张图像,涵盖602个分类类群),并对比监督学习与CLIP风格训练,发现基于分类谱系的监督学习优于CLIP,且现有生物基础模型在海洋成像领域表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏