arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2506.21076 2026-07-31 cs.CV 版本更新 50%

PoseMaster: A Unified 3D Native Framework for Stylized Pose Generation

PoseMaster: 一个统一的3D原生框架用于风格化姿态生成

Hongyu Yan, Kunming Luo, Weiyu Li, Kaiyi Zhang, Yixun Liang, Jingwei Huang, Chunchao Guo, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Hunyuan(腾讯文脉)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出PoseMaster框架,通过统一姿态风格化与3D生成,提升3D姿态风格化的精度和多样性,采用3D骨架直接指导生成,增强模型在姿态风格化中的表现。

Comments Accepted by CVPR 2026, Code: https://github.com/hanryyan/PoseMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21007 2026-07-31 cs.CV 版本更新 50%

MetaRank: Task-Aware Metric Selection for Model Transferability Estimation

MetaRank: 为模型可迁移性估计的任务感知度量选择

Yuhang Liu, Wenjie Zhao, Xin Wang, Yunhui Guo

机构 * Fudan University(复旦大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :language model(abstract)

AI总结 MetaRank通过元学习框架实现任务感知的MTE度量选择,提升模型迁移性估计的准确性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23704 2026-07-30 cs.RO cs.CV 版本更新 50%

LabRobFail: A Benchmark for Robotic Failure Analysis in Chemical Self-driving Laboratory

LabRobFail:化学自动驾驶实验室中机器人故障分析的基准

Haobo Wang, Baoli Sun, Anqi Zou, Dongsheng Huang, Zelin Lv, Ning Wang, Rui Li, Dongzhan Zhou, Weiyu Guo, Zhihui Wang, Wanli Ouyang

专题命中 评测与基准 :language model(abstract)

AI总结 针对化学自动驾驶实验室中机器人可靠性受化学实验特性限制、故障数据稀缺及评估协议缺乏等问题,引入LabRobFail框架,通过注入故障构建数据集,开发专门模型,提升故障检测等能力及下游任务成功率。

Comments Under review. Haobo Wang and Baoli Sun contributed equally. Code and data: https://github.com/Su-ISE-2001/SciRobo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21534 2026-07-29 cs.CY econ.GN q-fin.EC 版本更新 50%

Generative AI Availability, Grades, and Student Satisfaction at a Large University

大型大学中生成式人工智能的可用性、成绩与学生满意度

James M. Zumel Dumlao, Meng Wang, Zhonghan Xie, Junyao Hu, Ivan Bar, George Chaney, Henry Gold, Misha Teplitskiy

专题命中 评测与基准 :LLM(abstract)

AI总结 研究大型大学中GenAI对学生成绩和满意度的影响,通过教学大纲和行政数据,用差异中的差异设计及人工验证的大语言模型管道衡量课程GenAI易感性,发现GenAI对成绩和自我报告理解无显著差异影响,仅在特定假设下对兴趣有显著影响,缓解相关担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06020 2026-07-29 cs.CV 版本更新 50%

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition

ReSAGE-PAR:行人属性识别中生成式扩展的表征相似性评估

Pablo Ayuso-Albizu, Pablo Carballeira, Juan C. SanMiguel, Paula Moral

机构 * Universidad Autónoma de Madrid(阿隆托纳大学马德里分校)

专题命中 评测与基准 :prompting(abstract)

AI总结 针对行人属性识别数据稀缺问题,提出ReSAGE-PAR管道,通过扩散模型生成图像并利用贝叶斯分类器验证属性,实现可扩展的高保真数据集扩展,在标准骨干网络上提升高达8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16618 2026-07-29 cs.CV eess.IV q-bio.TO 版本更新 50%

SurgSLOT: Segment Anything in Surgical Videos via Semantic Long-term Tracking

通过语义长期跟踪实现手术视频的分割:SAM2S

Haofeng Liu, Ziyue Wang, Sudhanshu Mishra, Mingqi Gao, Guanyi Qin, Chang Han Low, Alex Y. W. Kong, Zhu Zhuo, Huazhu Fu, Joseph S. Ng, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SAM2S通过语义长期跟踪提升手术视频分割性能,实现更准确的零样本泛化和实时推理

Comments 19 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21050 2026-07-28 cs.CV 版本更新 50%

HyperImageNet: A Large-Scale High-Spatial Resolution Hyperspectral Imagery Classification Benchmark

HyperImageNet:一个用于细粒度高光谱土地覆盖理解的大规模基准

Chuguang Zeng, Jingtao Li, Yinhe Liu, Yanfei Zhong

专题命中 评测与基准 :foundation model(abstract)

AI总结 介绍用于细粒度高光谱土地覆盖理解的HyperImageNet基准,含原始图像等数据,支持语义和实例分割,建立开放环境基准评估方法和模型,实验证明其在相关研究中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19535 2026-07-28 cs.CV 版本更新 50%

Synthetic and Derived Training Images for Campus Waste Detection: A Multi-Seed Evaluation with YOLOv8n

用于校园垃圾检测的合成与派生训练图像:基于YOLOv8n的多种子评估

Ali Behbahani, Newsha Javanmardi, Shahriar Ahmed, Phouvadeth Vathana

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校)

专题命中 评测与基准 :pretraining(abstract)

AI总结 研究校园垃圾检测中合成与派生图像对YOLOv8n检测器的作用,通过多种子实验设置不同联合训练配置,对比不同图像来源及处理方式下的检测效果,发现各配置未超真实图像基线,测试集小难得出特定类别有力结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 50%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12351 2026-07-28 cs.CV 版本更新 50%

Fundus Image-based Glaucoma Screening via Retinal Knowledge-Oriented Dynamic Multi-Level Feature Integration

基于视网膜图像的青光眼筛查:面向视网膜知识的动态多级特征整合

Chi Liu, Yuzhuo Zhou, Sheng Shen, Zongyuan Ge, Fengshi Jing, Shiran Zhang, Yu Jiang, Anli Wang, Wenjian Liu, Feilong Yang, Tianqing Zhu, Xiaotong Han

机构 * State Key Laboratory of Ophthalmology, Zhongshan Ophthalmic Center, Sun Yat-sen University, Guangdong Provincial Key Laboratory of Ophthalmology and Vision Science, Guangdong Provincial Clinical Research Center for Ocular Diseases(眼科学国家重点实验室、中山眼科中心、中山大学、广东省眼科学重点实验室和视觉科学、广东省眼科临床研究中心) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Hainan International College, Minzu University of China(海南国际学院,中国民族大学) School of Information Technology, Faculty of Business and Hospitality, Torrens University Australia(澳大利亚托伦斯大学信息科技学院,商业与酒店管理学院) AIM for Health Lab, Faculty of IT, Monash University, Australia(健康AIM实验室,墨尔本大学IT学院,澳大利亚) Department of Ophthalmology, Guangzhou First People’s Hospital, the Second Affiliated Hospital of South China University of Technology(广州第一人民医院,华南理工大学第二附属医院) The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出基于视网膜知识的动态多级特征整合框架,通过动态窗口机制和知识增强卷积注意力模块提升青光眼筛查的鲁棒性,实验表明其在AIROGS数据集上达到98.5%的AUC和94.6%的准确率。

Comments 15 pages. Published in Knowledge-based System

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08521 2026-07-28 cs.CV cs.RO eess.IV 版本更新 50%

OccTrack360: 4D Panoptic Occupancy Tracking from Surround-View Fisheye Cameras

OccTrack360: 从环视鱼眼相机实现4D全景占用跟踪

Yongzhi Lin, Kai Luo, Yuanfan Zheng, Hao Shi, Mengfei Duan, Yang Liu, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光子学与仪器国家重点实验室,浙江大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 评测与基准 :SLM(abstract_cn)

AI总结 OccTrack360提出新的4D全景占用跟踪基准及FoSOcc框架,解决鱼眼成像中的球面投影和体素定位问题,提升占用跟踪性能。

Comments Accepted to IEEE/RSJ IROS 2026. The benchmark and source code will be made publicly available at https://github.com/YouthZest-Lin/OccTrack360

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 50%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 50%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18336 2026-07-24 cs.RO cs.CV 版本更新 50%

Enhancing Glass Surface Reconstruction via Depth Prior for Robot Navigation

通过深度先验增强玻璃表面重建以提升机器人导航

Jiamin Zheng, Jingwen Yu, Guangcheng Chen, Hong Zhang

机构 * Shenzhen Key Laboratory of Robotics and Computer Vision(机器人与计算机视觉深圳重点实验室) Southern University of Science and Technology(南方科技大学) CKS Robotics Institute(CKS机器人研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出一种无需训练的框架,利用深度基础模型作为结构先验,结合鲁棒的局部RANSAC对齐方法,融合原始传感器深度数据,从而避免错误的玻璃测量污染,恢复准确的度量尺度,并引入新的RGB-D数据集用于玻璃区域的几何真实值。

Comments 9 pages, 8 figures, Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20509 2026-07-24 cs.CV 版本更新 50%

Lessons and Open Questions from a Unified Study of Camera-Trap Species Recognition Over Time

从时间维度上统一研究相机陷阱物种识别的启示与开放问题

Sooyoung Jeon, Hongjie Tian, Lemeng Wang, Zheda Mai, Vidhi Bakshi, Jiacheng Hou, Ping Zhang, Arpita Chowdhury, Jianyang Gu, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文通过统一研究相机陷阱物种识别的时间变化,揭示了生态实践中维持可靠识别的挑战,提出了一种真实场景的基准测试,并发现生物基础模型在多个站点表现不佳,适应性困难,以及类不平衡和时间偏移是主要因素。

Comments The first three authors contribute equally. Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17820 2026-07-23 cs.CV 版本更新 50%

PRiSM: Prototype Regularization for Few-Shot VLMs

PRiSM:少样本视觉语言模型的原型正则化

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montreal(蒙特利尔高等商学院)

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08075 2026-07-23 cs.CV 版本更新 50%

UAV-OVVIS: Unmanned Aerial Vehicles Also Need Open-Vocabulary Video Instance Segmentation

无人机-开放词汇视频实例分割:无人机也需要开放词汇视频实例分割

Mingyu Dou, Shi Qiu, Ming Hu, Yifan Chen, Zhe Sun

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对无人机视频感知在开放场景中支持灵活查询和细粒度实例级动态理解不足的问题,提出无需训练的AeroTrack统一框架,构建AeroVIS评估基准,其实例化变体在无人机场景表现优异,还发布框架和基准以支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15403 2026-07-23 cs.CV 版本更新 50%

Pointing-Based Object Recognition

基于指目标识的对象识别

Lukáš Hajdúch, Viktor Kocur

机构 * Comenius University, Bratislava, Slovakia(科门纽斯大学,布拉迪斯拉发,斯洛伐克)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种识别人类指目标识的综合流程,结合物体检测、姿态估计和视觉语言模型等方法,通过单张图像重建3D空间信息提升目标识别精度。

Comments Submitted to InnovAIte conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28884 2026-07-22 eess.AS 版本更新 50%

GigaSpeechBench: A Real-World Multilingual Speech-to-Text Benchmark

GigaSpeechBench:一个真实世界的多语言语音到文本基准

Yujie Tu, Yifan Yang, Tianrui Wang, Yanqiao Zhu, Guodong Lin, Mingchen Shao, Haoran Wang, Junzhe Liu, Yuxiang Fu, Yizhou Peng, Changsong Liu, Peng Wang, Zhikang Niu, Yunchong Xiao, Haolong Zheng, Xiuwen Zheng, Xulin Fan, Wei-Qiang Zhang, Lei Xie, Longbiao Wang, Eng-Siong Chng, Jiajun Zhang, Kele Xu, Jianwei Yu, Binbin Zhang, Jiayu Du, Wupeng Wang, Zhigao Chen, Yuzhong Wu, Zhendong Peng, Bin Ma, Guoguo Chen, Xipeng Qiu, Mark Hasegawa-Johnson, Kai Yu, Zhifu Gao, Xiangang Li, Xie Chen

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GigaSpeechBench,一个包含680小时人工标注语音的多语言多维度ASR和AST基准,覆盖低资源语言、方言、口音、专业术语和年龄变化,揭示现有模型在挑战场景下的性能退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23670 2026-07-22 cs.CV 版本更新 50%

Zero-Shot DINOv3-Based Image Matching via Many-to-Many Association

在多对多关联中部署DINO

Haodong Jiang, Mingzhe Li, Junfeng Wu

专题命中 评测与基准 :prompting(abstract)

AI总结 为解决监督图像匹配模型在未见图像领域泛化能力有限的问题,本文探索了DINO特征的零样本部署。通过多对多匹配范式提升鲁棒性,并提出更高效的Harmonic Consensus Maximization机制,展示了其在相机姿态估计中的有效性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14830 2026-07-21 cs.SE 版本更新 50%

AI Prototyper: A Figma Plugin for Decomposition-Based GUI Prototyping with LLMs

AI原型制作器:一个用于基于分解的GUI原型制作的Figma插件

Tawatchai Salangsingha, Ashkan Sami, Md Zia Ullah, Iain McGregor

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对GUI原型制作耗时问题,提出AI Prototyper插件,通过分解和检索增强生成管道,结合特定技术栈与大语言模型,经人工参与编辑步骤,能多语言输入,在时间和质量维度上表现良好。

Comments Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 50%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 评测与基准 :LLM(abstract)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09249 2026-07-21 cs.CV 版本更新 50%

DECIS: Dual-Evidence Corrective Verification for Interpretable Strabismus Diagnostic Decision-Making

MAGIS:基于证据的多智能体推理用于可解释的斜视临床决策

Xikai Tang, Yifan Wang, Jiafan Zhuang, Li Luo, Jinming Guo, Xiaoling Xie, Jiacheng Liu, Peiwei Wei, Lihao Zhong, Xiaoli Kang, Jie Cen, Guangqiang Yin, Kunliang Qiu, Ce Zheng, Zhun Fan

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院) Joint Shantou International Eye Center of Shantou University and The Chinese University of Hong Kong(汕头大学·香港中文大学联合汕头国际眼科中心) School of Artificial Intelligence, Guangzhou City Polytechnic(广州城市职业学院人工智能学院) Medical College, Shantou University(汕头大学医学院) College of Engineering, Shantou University(汕头大学工学院) Department of Ophthalmology, Xinhua Hospital Affiliated to Shanghai Jiaotong University School of Medicine(上海交通大学医学院附属新华医院眼科) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出MAGIS框架,通过多智能体协作、双重证据约束上下文和基于证据的纠正验证机制,将斜视诊断从黑箱生成转变为结构化推理,在细粒度斜视基准上将加权F1分数从72.0%提升至91.3%,并显著提高诊断报告的临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02002 2026-07-21 cs.CV 版本更新 50%

Parameter-Efficient Adaptation of a Multi-Stream Vision-Language Framework for Blind Image Quality Assessment

面向盲图像质量评估的统计与视觉-语言特征的失真感知融合

Bishr Omer Adam, Xu Li

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出一种失真感知融合框架,通过乘法门控机制动态加权NSS统计特征与VLM嵌入,在三个基准上取得最优或竞争性能,并揭示NSS对不同失真的贡献差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20575 2026-07-21 cs.CV 版本更新 50%

An interactive enhanced driving dataset for autonomous driving

一种交互增强的自动驾驶数据集

Haojie Feng, Xinrui Zhang, Mengjie Tian, Peizhi Zhang, Zhuoren Li, Junpeng Huang, Xiurong Wang, Junfan Zhu, Jianzhou Wang, Dongxiao Yin, Lu Xiong

专题命中 评测与基准 :instruction tuning(abstract)

AI总结 本文提出交互增强驾驶数据集,通过生成合成视频实现多模态对齐,用于评估和优化自动驾驶模型的推理能力。

Comments Accepted for publication in Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14159 2026-07-20 cs.CV 版本更新 50%

MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs

MVI-Bench:评估大型视觉语言模型对误导性视觉输入鲁棒性的综合基准

Huiyi Chen, Jiawei Peng, Dehai Min, Changchang Sun, Kaijie Chen, Yan Yan, Xu Yang, Lu Cheng

机构 * Department of Computer Science, University of Illinois Chicago, Chicago, USA School of Computer Science \& Engineering, Southeast University, Nanjing, China Guohao School, Tongji University, Shanghai, China

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有鲁棒性基准忽视误导性视觉输入的问题,提出MVI-Bench基准,基于视觉基元的三级层次(视觉概念、视觉属性、视觉关系)构建6个类别1248个VQA实例,并引入MVI-Sensitivity指标进行细粒度评估,揭示18个LVLM的显著脆弱性。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13076 2026-07-17 q-bio.OT 版本更新 50%

momenTUM: A schema-driven platform for designing, deploying, and exploring ecological momentary assessment studies

momenTUM:一个用于设计、部署和探索生态瞬时评估研究的模式驱动平台

Nataliia Petliak, Blen Assefa, Constantin Goeldel, Marco Ma, Anna Biller, Lorna Caddick, Raahat Manrai, Daniel Smith, Duncan Swiffen, Manuel Spitschan

专题命中 评测与基准 :LLM(abstract)

AI总结 该研究针对生态瞬时评估研究中现有工作流程分散的问题,提出momenTUM开源平台,以结构化研究规范为核心,集成REDCap,实现多环节功能,支持复杂评估协议,减少技术开销,使EMA工作流程可重复、复用和扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09815 2026-07-17 cs.RO cs.CV 版本更新 50%

RASR: Range-Aware Scale Recovery for Metric UAV Navigation

RASR:用于度量无人机导航的距离感知尺度恢复

Hongtao Liang, Xinyu Shao, Chenxu Wang, Yiyao Wan, Jiahuan Ji, Fangwei Ye, Fuhui Zhou, Qihui Wu

机构 * College of Electronic and Information Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学电子信息工程学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Noah Ark Lab, Huawei(华为诺亚方舟实验室) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院) College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究在GNSS信号阻断时无人机精确最后一米导航问题,提出RASR方法,将尺度恢复核心与校准模块分离,核心压缩几何成描述符并全局校准,校准模块进行残差校正和对齐,在PairUAV评估中取得较好结果。

Comments 5 pages, 4 figures. Technical report for the UAVM 2026 PairUAV Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08016 2026-07-16 cs.CV cs.GR 版本更新 50%

LightCrafter: PBR-Conditioned Video Diffusion Refinement for Controllable and Consistent Relighting

LightCrafter:用于可控且一致的重光照的PBR条件视频扩散细化

Zixin Guo, Yehonathan Litman, Yifeng He, John Miller, Chuhan Chen, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) Bosch Research(博世研究)

专题命中 评测与基准 :post-training(abstract)

AI总结 研究视频重光照问题,提出LightCrafter混合管道,将其重表述为代理视频转换,利用PBR渲染并结合光度先验,在真实世界重光照基准上优于现有技术,还贡献合成基准及相关资源。

Comments Project page: https://www.zixinguo.me/lightcrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01060 2026-07-16 cs.RO 版本更新 50%

RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation

RoboWorld: 用于通用机器人策略评估的快速可靠神经模拟器

Byeongguk Jeon, Seonghyeon Ye, JaeHyeok Doo, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院) Config

专题命中 评测与基准 :language model(abstract)

AI总结 提出RoboWorld自动化评估流程,结合快速自回归视频世界模型和任务进度感知视觉语言模型评分,通过Step Forcing减少训练-测试不匹配,实现与真实世界评估高度一致。

Comments Project page: https://byeongguks.github.io/RoboWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏