arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2997 篇

2607.07689 2026-07-09 cs.MA 新提交 50%

Agent Delivery Engineering Predictive Reliability Framework

智能体交付工程预测可靠性框架

Dexing Liu

专题命中 评测与基准 :LLM(abstract)

AI总结 针对长期语言模型多智能体系统的可靠性风险,提出ADE预测可靠性框架,聚合异构信号为信任边际指标,用三重方法并行预测,经多轮验证和实验,能检测“虚假繁荣”,实现可靠性量化并提供前瞻性警告。

Comments 117pages,83figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06909 2026-07-09 cs.CV 新提交 50%

Seeing What Matters: Lesion-Aware High-Resolution Patch Discovery and Fusion for Chest X-ray Report Generation

看清关键所在:用于胸部X光报告生成的病灶感知高分辨率补丁发现与融合

Yingshu Li, Yunyi Liu, Zhenghao Chen, Tong Chen, Zailong Chen, Lingqiao Liu, Lei Wang, Luping Zhou

机构 * The University of Sydney(悉尼大学) The University of Newcastle(纽卡斯尔大学) University of Wollongong(卧龙岗大学) The University of Adelaide(阿德莱德大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对胸部X光报告生成中高分辨率感知难题,提出LePaX框架。该框架将高分辨率感知设为固定令牌预算下的空间分辨率分配问题,通过可学习空间分辨率分配和全局-区域融合两个组件,在不增令牌数时实现高分辨率CXR感知,提升了临床和语言指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06838 2026-07-09 cs.CV 新提交 50%

WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence

WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台

Xiangyu Han, Mengyu Yang, Jiaqi Li, Bowen Chang, Ziyu Chen, Hexu Zhao, Rahul Kumar Agrawal, Anthony Rodriguez, Fiona Hua, Marco Pavone, Chen Feng, Yiming Li

机构 * May Mobility(五月出行公司) New York University(纽约大学) NVIDIA(英伟达公司) Stanford University(斯坦福大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。

Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06552 2026-07-08 cs.CV 新提交 50%

MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation

MonoIR-RS:基于CLIP和VLM适配的红外遥感视觉语言学习

Jiaju Han, Ma Yaqi, Yahui Chai, Xuemeng Sun, Xin Li, Qike Zhang, Yingying Zhao, Xiang Chen, Luwei Yang, Chengyin Hu, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Guizhou University(贵州大学) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :instruction tuning(abstract)

AI总结 研究针对红外视觉语言理解未充分探索的问题,提出MonoIR-RS数据集及基准,结合多种方法构建并微调模型,提升红外遥感视觉语言学习性能,为红外与语言对齐提供可控测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06478 2026-07-08 cs.CV 新提交 50%

A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation

一种用于综合交通标志状况评估的VLM增强框架,集成白天视觉性能和夜间逆反射率评估

Linlin Zhang, Neema Jakisa Owor, Xiang Yu, Abby Watts, Yaw Adu-Gyamfi

机构 * Department of Civil and Environmental Engineering University of Missouri- Columbia(土木与环境工程系密苏里大学哥伦比亚分校)

专题命中 评测与基准 :language model(abstract)

AI总结 研究开发用于综合评估交通标志状况的新框架,利用微调视觉语言模型评估白天视觉性能,结合激光雷达校准的逆反射率评估夜间性能,集成到标志状况指数,提供经济有效的评估方法,LLaVA和Qwen表现优,还标记出需更换的标志。

Comments 21 pages, 7 figures, 5 tables. Preprint. An earlier version of this work was presented at the 105th Annual Meeting of the Transportation Research Board (TRB), January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06457 2026-07-08 cs.CV 新提交 50%

Andha-Dhun: A First Look at Audio Descriptions in Hindi

Andha-Dhun:对印地语音频描述的初步研究

Ritabrata Chakraborty, Divy Kala, Nisheeth Bhooshan Gupta, Ganji Sreeram, Pailla Balakrishna Reddy, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad(海得拉巴国际信息技术研究所计算机视觉与信息处理中心) Manipal University Jaipur(斋浦尔曼ipal大学) Jio Platforms Ltd.(Jio平台有限公司)

专题命中 评测与基准 :LLM(abstract)

AI总结 该研究针对印度尚无印地语音频描述工作的现状,引入Andha-Dhun数据集,探索直接从英语描述生成及翻译英语ADs两种方法来生成印地语ADs,并进行评估,发现简单翻译和机器翻译存在问题,强调要为印度BLV观众调整内容。

Comments Accepted to NCVPRIPG 2026, Download data at https://github.com/katha-ai/AndhaDhun-HindiAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交 50%

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

专题命中 评测与基准 :LLM(abstract)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05783 2026-07-08 cs.CV 新提交 50%

Benchmarking the Robustness of Autonomous Driving to Environmental Illusions: A Lane Perception Perspective

从车道感知角度评估自动驾驶对环境错觉的鲁棒性:基准测试

Tianyuan Zhang, Xianglong Liu, Aishan Liu, Lu Wang, Yitong Zhang, Peng Yue, Mingchuan Zhang, Siyuan Liang, Dacheng Tao

机构 * SKLCCSE, the School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院软件安全技术与工程北京市重点实验室) the School of Cyber Science and Technology, Sun Yat-sen University(中山大学网络空间科学与技术学院) Henan University of Science and Technology(河南科技大学) the School of Computing, National University of Singapore(新加坡国立大学计算学院) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :language model(abstract)

AI总结 研究自动驾驶对环境错觉的鲁棒性,聚焦传统车道检测和视觉语言模型系统。引入基准LanEvil++并评估,发现错觉严重影响性能,阴影干扰最大。提出多模态错觉防御方法MIDA,有效提升了模型在挑战性条件下的鲁棒性。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05318 2026-07-07 cs.MA cs.CR 新提交 50%

PiSAs: Benchmarking Contextual Integrity in Multi-User Agentic Systems

PiSAs:多用户智能体系统中情境完整性的基准测试

Shubham Gupta, Nazanin Mohammadi Sepahvand, Abhinav Kumar, Cem Subakan, Spandana Gella, Pierre-André Noël, Perouz Taslakian, Eugene Bagdasarian, Valentina Zantedeschi

专题命中 评测与基准 :LLM(abstract)

AI总结 研究多用户智能体系统新隐私风险,引入PiSAs基准,用双重情境完整性注释评估无意泄露,可跨组件和接口测量跨用户数据泄露,发现模型判断影响结果,强调隐私保护策略需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 50%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 50%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03942 2026-07-07 eess.SY cs.SY 新提交 50%

ThermoForce: A Physics-Structured Interventional World Model for Building HVAC Control

ThermoForce:用于构建暖通空调控制的物理结构干预世界模型

Yifan Wang

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究建筑暖通空调系统模型预测控制所需的热模型问题。提出ThermoForce,将时间序列基础模型冻结为被动自由响应,学习物理结构的强制响应算子,在相关干预中表现出色,嵌入MPC可降低热不适与能耗。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03941 2026-07-07 cs.RO 新提交 50%

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

WSA$_1$:用于可泛化机器人控制的以3D为中心的世界-空间-动作模型

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, Sen Wang, Zhaoshu Yu, Pengpeng Zeng, Xiaofeng Cao, Xuanhan Wang, Jingkuan Song, Heng Tao Shen

机构 * Tongji University(同济大学) Shanghai Innovation Institution(上海创新机构) Shanghai Magic(上海魔星) Koala Uran Project(考拉铀项目)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对当前机器人基础模型缺乏物理动力学推理等问题,提出以3D为中心的世界-空间-动作建模范式构建WSA$_1$模型,能学习3D世界感知视觉思维并建模约束,提升泛化能力且数据高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03614 2026-07-07 cs.CV 新提交 50%

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件

Yuening Cai, Junwei Zhou, Youran Qu, Yu-Wing Tai

机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)

专题命中 评测与基准 :language model(abstract)

AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。

Comments 36 pages. Project page: https://ideal3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03043 2026-07-07 cs.CV 新提交 50%

Natural Language Camera Movement Understanding

自然语言相机运动理解

Yuwen Tan, Joey Huang, Jin Huang, Haoxiang Li, Boqing Gong

机构 * Boston University(波士顿大学) Pixocial Technology(皮克索西尔科技公司)

专题命中 评测与基准 :language model(abstract)

AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02972 2026-07-07 cs.CY 新提交 50%

A Scalable Approach to Evaluating Moral Sensitivity in LLMs

一种评估大语言模型道德敏感性的可扩展方法

Daniel Kilov, Secil Yanik Guyot, Caroline Hendy, Sichao Li, Seth Lazar

专题命中 评测与基准 :LLM(abstract)

AI总结 研究如何评估大语言模型道德敏感性,提出新方法解决AI对齐研究中行为评估的问题,引入MORPH-1K基准测试并应用于八个模型,证明相关特征语义内容稳定。

Comments 9 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02606 2026-07-07 cs.SE 新提交 50%

ChainSWE: Benchmarking Coding Agents on Multi-Bug Software Maintenance

ChainSWE:在多漏洞软件维护中对编码代理进行基准测试

Qirui Jin, Lingching Tung, Kenan Li, Qiyang Shi, Yushi She, Huanzhong Jia, Harrison Zhao, Kejing Xia, Zhenbang Du, Yikai Zhang, Jiaxin Pei, Zhenyu Zhang, Zhen Qi, Yuyan Duan, Wenke Lee, Zijian Jin

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对语言模型代理在多漏洞软件维护中的评估问题,引入ChainSWE基准,通过收集Python项目问题链进行评估,发现链长度增加时性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02577 2026-07-07 cs.SE 新提交 50%

Benchmarking the Benchmarks: A Validity Audit of Tool-Calling Evaluation

对基准进行基准测试:工具调用评估的有效性审计

Vishvesh Bhat, Jay Vaghasiya, Muhammad Ahmed Mohsin, Asad Aali

专题命中 评测与基准 :LLM(abstract)

AI总结 对四个主要工具调用基准家族进行系统有效性和可重复性审计,发现诸多评估者与人类意见分歧,指出当前分数可能反映评估者问题而非智能体能力,还介绍相关分类、审计工件等及新基准和系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02096 2026-07-03 cs.CV 新提交 50%

LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension

LongEgoRefer: 长形式自我中心视频指代表达理解基准

Shunya Kato, Taiki Miyanishi, Shuhei Kurita, Mahiro Ukai, Nakamasa Inoue, Chenhui Chu

机构 * Woven by Toyota, Japan(丰田公司,日本) The University of Tokyo, Japan(东京大学,日本) National Institute of Informatics, Japan(日本信息机构国家研究所) Institute of Science Tokyo, Japan(东京科学研究所,日本) NII LLMC, Japan(日本信息机构LLMC) Kyoto University, Japan(京都大学,日本)

专题命中 评测与基准 :language model(abstract)

AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。

Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01900 2026-07-03 cs.CV 新提交 50%

FoundDP: Revisiting Weak Disparity Observability in Dual-Pixel Depth Estimation

FoundDP:重新审视双像素深度估计中的弱视差可观测性

Fengchen He, Hao Xu, Dayang Zhao, Tingwei Quan, Shaoqun Zeng

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出FoundDP框架,结合双像素深度与单目深度基础模型的全局结构先验,通过ViT特征对齐缓解散焦模糊导致的表示退化,在弱视差区域提升结构一致性与度量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01748 2026-07-03 cs.CV 新提交 50%

RTE-FM-Dehazer: Radiative Transfer Equation Inspired Flow Matching for Real-World Image Dehazing

RTE-FM-Dehazer: 辐射传输方程启发的流匹配用于真实图像去雾

Chenfeng Wei, Chun Wang, Boyang Zhao, Si Zuo, Shenhong Wang, Chenguang Yang

机构 * Mashang Consumer Finance Co. Ltd(马上消费金融股份有限公司) Tsinghua University(清华大学) Hunan University(湖南大学) University of Liverpool(利物浦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出基于辐射传输方程(RTE)的流匹配去雾方法RTE-FM-Dehazer,通过扩散-吸收正则化引导去雾轨迹,并构建包含5万对真实雾/清晰图像的P-HAZE数据集,在五个真实基准上取得领先结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24725 2026-07-03 physics.ins-det physics.comp-ph 新提交 50%

A Reproducible Benchmark and Evidence-Retrieval Software Framework for Silicon Detector R&D Literature

硅像素探测器研发的基于证据的检索基准与混合RAG框架

Tianqi Gao, Ruobing Jiang, Dawei Fu, Qiang Li, Matthew Kenzie

专题命中 评测与基准 :language model(abstract)

AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00752 2026-07-02 cs.CV 新提交 50%

GKDT: General Keypoint Detection Transformer

GKDT: 通用关键点检测Transformer

Changsheng Lu, Yuxin Chen, Haokun Gui, Rong Wang, Jie Yang, Harry Yang, Anton van den Hengel, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科技大学) Australian National University(澳大利亚国立大学) Tencent Inc.(腾讯公司) Adelaide University(阿德莱德大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出通用关键点检测模型GKDT,基于大规模统一数据集MegaKPT和DINOv3 Transformer,支持视觉/文本提示,在22个测试集上多数类别PCK@0.1超90%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24548 2026-07-02 cs.CV 新提交 50%

Are Text-to-Image Models Inductivist Turkeys? A Counterfactual Benchmark for Causal Reasoning

文本到图像模型是归纳主义的火鸡吗?一个用于因果推理的反事实基准

Jiayi Lei, Yuandong Pu, Xingyu Han, Rongpeng Zhu, Jing Xu, Jinyao Wang, Zijian Zhou, Bin Fu, Yuewen Cao, Yihao Liu, Hongsheng Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出反事实基准CF-World,通过三个递进层级测试T2I模型在违反现实先验规则下的图像生成能力,发现所有模型在反事实设置下性能急剧下降,原因是模型将世界知识与视觉外观编码为紧密耦合的模式。

Comments 10 pages, 7 figures. Project page: https://github.com/jylei16/CF-World.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31785 2026-07-01 cs.CV 新提交 50%

Self-Supervised Temporal Regularization for Landmark-Based Cardiac Segmentation with Automatic AHA Regional Mapping

基于地标的心脏分割的自监督时间正则化与自动AHA区域映射

David Montalvo-García, Nicolás Gaggion, María J. Ledesma-Carbayo, Enzo Ferrante

机构 * Biomedical Image Technologies, ETSI Telecomunicación, Universidad Politécnica de Madrid, Madrid, Spain(生物医学图像技术,电信工程学院,马德里理工大学,马德里,西班牙) Centro de Investigación Biomédica en Red de Bioingeniería, Biomateriales y Nanomedicina (CIBER-BBN), Instituto de Salud Carlos III, Madrid, Spain(生物工程、生物材料和纳米医学网络生物医学研究中心(CIBER-BBN),卡洛斯三世健康研究所,马德里,西班牙) APOLO Biotech, Ciudad Autónoma de Buenos Aires, Argentina(APOLO Biotech,布宜诺斯艾利斯自治市,阿根廷) Departamento de Computación, Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算系,布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷) Instituto de Ciencias de la Computación (ICC), CONICET-Universidad de Buenos Aires, Ciudad Autónoma de Buenos Aires, Argentina(计算机科学研究所(ICC),CONICET-布宜诺斯艾利斯大学,布宜诺斯艾利斯自治市,阿根廷)

专题命中 评测与基准 :post-training(abstract)

AI总结 提出自监督时间正则化方法,利用图像序列的时间一致性增强心脏分割和运动估计的连续性,并自动映射到AHA 17节段标准,在CAMUS数据集上验证了临床实用性。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31488 2026-07-01 cs.CV 新提交 50%

DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation

DrivingDepth: 稀疏提示的像素级尺度校正用于驾驶深度估计

Chi Huang, Wenhao Zhang, Hang Yin, YuAn Wang, Hao Li, Bosheng Wang, Xun Sun, Liang Wang

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对自动驾驶深度估计中几何与尺度的冲突,提出DrivingDepth方法,利用稀疏LiDAR作为几何提示,通过残差像素级尺度校正校准冻结的深度基础模型,在保持密集视觉几何的同时实现度量精度与几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 50%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31382 2026-07-01 cs.RO 新提交 50%

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 评测与基准 :language model(abstract)

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31249 2026-07-01 cs.CV 新提交 50%

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

重新思考特征工程与学习策略在少样本隐藏情感识别中的作用

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Beihang University(北京航空航天大学) The University of New South Wales(新南威尔士大学) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28202 2026-06-29 eess.SP 新提交 50%

An Enhanced Source-Free Unsupervised Domain Adaptation Framework for Cross-Dataset EEG Emotion Recognition via Predictive Coding and Test-Time Training

一种增强的无源无监督域适应框架:基于预测编码和测试时训练的跨数据集脑电情感识别

Md Niaz Imtiaz, Naimul Khan

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出一种无源无监督域适应框架,通过非对比预测编码自监督预训练和双阶段自适应优化(多损失自适应正则化与局部一致性学习),结合轻量测试时训练,解决跨数据集脑电情感识别中的域偏移和噪声伪标签问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏