arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12101 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2940 篇

2608.20317 2026-08-21 cs.IR 新提交 50%

Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search

将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库

Sahel Sharifymoghaddam, Lingwei Gu, Yijun Ge, Jimmy Lin

专题命中 评测与基准 :language model(abstract)

AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20107 2026-08-21 cs.CV 新提交 50%

BeyondMasks: Evaluating Causal and Physical Consistency in Video Object Removal

BeyondMasks:评估视频对象移除中的因果与物理一致性

Yigit Ekin, Enes Sanli, Aykut Erdem, Erkut Erdem, Aysegul Dundar

机构 * Bilkent University(毕尔肯大学) Koç University(科克大学) Hacettepe University(哈杰泰佩大学) KUIS AI Center(KUIS人工智能中心)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出BeyondMasks基准及CORE评估协议,针对现有视频对象移除评估仅关注局部掩码保真度的问题,填补了视觉合理性与因果正确性的差距。

Comments ECCV 2026 Project Page: https://yigitekin.github.io/BeyondMasks/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19380 2026-08-21 cs.CV 新提交 50%

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

CAViAR:用于真实场景细粒度事故推理的因果视频数据集

Sparsh Garg, Yi-Wen Chen, Vijay Kumar B G, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。

Comments Accepted to ECCV 2026 Workshop DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19272 2026-08-21 astro-ph.IM astro-ph.CO astro-ph.GA 新提交 50%

The Cross-Survey Decade: A Call to Action

跨巡天十年:行动号召

Gioia Rau, Robert Benjamin, Federica Bianco, Ranga-Ram Chary, Andy Connolly, Cecilia Garraffo, Suvi Gezari, Leanne P. Guy, Željko Ivezić, Stephanie Juneau, Vicky Kalogera, Mansi M. Kasliwal, François Lanusse, Zack Li, Rachel Mandelbaum, Peter Melchior, Stella Offner, Antonella Palmese, Jason Rhodes, Edward Schlafly, Kartik Sheth, Rachel Street, Michael Troxel, Tony Tyson, Beth Willman, Michael Wood-Vasey, Yuanyuan Zhang

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文呼吁构建跨巡天科学基础设施,围绕四大支柱推进,以实现三个旗舰巡天项目联合数据的科学价值,需多方协作且当下是行动的关键时机。

Comments 23 pages, 1 figure. Community perspective on cross-survey science infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18367 2026-08-20 eess.IV cs.CV 新提交 50%

Optic Disc Segmentation in Fundus Images: From Classical Image Processing and Deformable Models to Modern AI

眼底图像中的视盘分割:从经典图像处理与可变形模型到现代人工智能

Buket D. Barkana

专题命中 评测与基准 :foundation model(abstract)

AI总结 本综述梳理视盘分割技术从经典方法到现代AI方法的发展,总结核心原则,指出边界模糊等持续挑战,为该领域研究提供方法学参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18993 2026-08-20 cs.CV 新提交 50%

ForeSightGuide: An Anticipatory Framework toward Accurate and Low-Redundancy Guidance for the Visually Impaired

ForeSightGuide:面向视障人士的精准低冗余前瞻式导航框架

Zhiyuan Wang, Xu Li, Shikang Guo, Wei Meng, Quan Liu, Jie Zuo

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对视障人士出行的信息过载问题,提出前瞻式导航框架ForeSightGuide,结合语义理解与危险预测,在新数据集及公共基准上实现最优性能,冗余警报与漏险率表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18711 2026-08-20 cs.CV eess.SP 新提交 50%

EgoHRV: Continuous Heart Rate Variability Estimation from Egocentric Systems for Autonomic Response and Skill Assessment

EgoHRV:用于自主神经反应与技能评估的自我中心式系统的连续心率变异性估计

Berken Utku Demirel, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出EgoHRV方法,利用自我中心头戴设备的凝视摄像头结合3D骨干网络与低-高分解模块等,实现从凝视视频中连续估计HRV与HR,在HR/HRV估计中达最优准确率,集成后使EgoExo4D熟练度估计器准确率提升17.8%

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17883 2026-08-19 cs.CV 新提交 50%

Improving Complex Moiré Removal with Generative Supervision

利用生成式监督改进复杂莫尔条纹去除

Xinyang Gu, Zhilu Zhang, Honglei Xu, Yanting Mei, Yukang Ding, Wangmeng Zuo

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究针对现有数据集难以覆盖真实场景复杂莫尔条纹的问题,提出生成式监督数据引擎,构建WildMoiré数据集,在多模型上验证其可提升复杂莫尔条纹去除性能。

Comments 14 pages, 5 figures. Project page: https://xinygu-pavo.github.io/WildMoire/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17502 2026-08-19 cs.SI cs.CY 新提交 50%

The Brazilian Vaccination Debate on YouTube: Topics, Perspectives, and Engagement Dynamics

YouTube上的巴西疫苗接种辩论:主题、观点与参与动态

Matheus S. Azevedo, Geovana S. de Oliveira, Andrea Failla, Alexandre M. de Sousa, Fabricio Murai, Ana Paula C. da Silva, Carlos H. G. Ferreira

专题命中 评测与基准 :language model(abstract)

AI总结 本研究以127万条巴西YouTube评论为数据集,整合多维度计算分析,揭示了巴西疫苗接种辩论的主题分布、动态变化及观众对创作者框架的重构机制。

Comments Accepted at ASONAM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17165 2026-08-19 cs.CV eess.IV 新提交 50%

Rapid Debris-Volume Estimation from Post-Hurricane Aerial Imagery

飓风后航拍图像的快速 debris 体积估算

Kooshan Amini, Jamie Ellen Padgett, Guha Balakrishnan

机构 * Rice University(莱斯大学) Ken Kennedy Institute(肯·肯尼迪研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究提出 DebrisHeightNet 网络,利用飓风后单次航拍 RGB 图像,结合 CW-LMF 等技术实现残骸体积快速估算,精度优于传统参数化方法,部署便捷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16843 2026-08-18 cs.RO 新提交 50%

Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation

基于基础模型的具身智能体的安全性:攻击面、攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao

机构 * Wuhan University(武汉大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究以信任边界为核心,针对基于基础模型的具身智能体安全,划分了五个层级与十二个攻击面,分析了58种攻击、61种防御的现状,指出部分领域研究不足并提出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16789 2026-08-18 cs.CY 新提交 50%

"This Is So Claude!" Towards a Theory of the Recognition of AI Character Without Reidentification

这真像Claude!:走向无需重识别的AI特征识别理论

Michele Loi

专题命中 评测与基准 :language model(abstract)

AI总结 该研究区分AI身份研究的三类路径,提出Claude式分级判断的溯因推理,指出AI可识别特征的连续性对陪伴的重要性,不解决数值同一性问题。

Comments 13 pages. Submitted to Philosophical Studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15336 2026-08-18 cs.CV 新提交 50%

SAGE-OR: Semi-supervised Adaptive Scene Graph Generation for Operating Rooms

SAGE-OR:面向手术室的半监督自适应场景图生成

Brandon Leblanc, Charalambos Poullis

机构 * Concordia University(康考迪亚大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14721 2026-08-18 cs.CV 新提交 50%

AeroGround: A Comprehensive Benchmark for Aerial-Ground Collaborative Reasoning

AeroGround:用于空-地协同推理的综合基准

Shenghong Yi, Lin Zhang, Muzian Li, Jiakang Yuan, Haoyu Zhang, Peng Ye, Jiayuan Fan, Huafeng Qin, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Chongqing Technology and Business University(重庆工商大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13766 2026-08-17 cs.CV 新提交 50%

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究

Mahsa Khoshnoodi, Sarah Adel Bargal

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12649 2026-08-14 cs.CY 新提交 50%

Proactive Computing

主动式计算

Joonhee Lee

专题命中 评测与基准 :foundation model(abstract)

AI总结 本综述定义主动式计算范式,区分其与相关计算类型,梳理技术使能因素与挑战,指出关键研究挑战为确定系统代表用户行动的时机、方式与可行性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 50%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11592 2026-08-13 cs.RO 新提交 50%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11425 2026-08-13 cs.CV 新提交 50%

VLMs Win a Systematic Evaluation of Underwater Image Reconstruction

视觉语言模型(VLMs)在水下图像重建的系统评估中胜出

Sara Aghajanzadeh, Yingxue Wang, Ieva Bagdonaviciute, David Forsyth

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10858 2026-08-12 cs.DL cs.CY cs.HC 新提交 50%

Auditable AI-Assisted Research Writing: An Engineering Discipline with Pre-Registered Process Observation

可审计的AI辅助研究写作:一种带有预注册过程观测的工程学科

Yang Zhou, Chengqun Yu

专题命中 评测与基准 :language model(abstract)

AI总结 针对AI辅助研究写作缺乏可追溯责任历史的问题,该研究提出一套预注册过程观测的可审计性工程规范,通过git密封、红线门等技术实现审计,经实验验证其停止规则可有效终止不合规工作,相关工具包可供第三方复现指标。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10662 2026-08-12 cs.MA 新提交 50%

Reifying Research Logic: AI-Assisted Workflow Construction and Incremental Refinement for Quantitative Syntax

具象化研究逻辑:面向定量句法的AI辅助工作流构建与增量优化

He Wang, Jingbo Chen, Yuqiao Lai, Nan Yang, Hanwen Zhang, Wei Yuan

专题命中 评测与基准 :language model(abstract)

AI总结 针对定量句法研究的步骤逻辑隐藏问题,提出QLWF可视化工作流平台,可通过AI辅助将自然语言描述转为可执行工作流,在基准测试中表现优异并发布相关可复用资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10426 2026-08-12 cs.CV 新提交 50%

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

GeoSeg-OV:利用结构引导弥合地理空间差距的开放词汇遥感分割方法

Ruizhong Liu, Tingzhang Luo, Zaiyan Zhang, Jundong Chen, Hongruixuan Chen, Shaoguang Huang, Hongyan Zhang

机构 * School of Computer Science, China University of Geosciences(中国地质大学计算机学院) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)系统中心) Department of Computer Science, City University of Hong Kong(香港城市大学计算机系) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究促进中心)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出GeoSeg-OV,通过解耦辅助VFM特征与视觉-文本匹配,将其用作结构引导,结合SGA与CAD模块,在HRLC基准上优于当前最优方法,且具备跨域零样本泛化能力。

Comments Code and benchmark: https://github.com/zzaiyan/GeoSeg-OV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09497 2026-08-11 cs.CV 新提交 50%

SwissCrop25: A National Multi-Year Benchmark for Operational Crop Mapping

SwissCrop25:用于业务化作物制图的国家级多年基准数据集

Thomas Lauber, Mehmet Ozgur Turkoglu, Sélène Ledain, Helge Aasen

机构 * Agroscope(阿格罗斯普(瑞士农业研究机构))

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究推出覆盖2019-2025年7个生长季的国家级作物制图基准SwissCrop25,通过留一法年份交叉验证协议测试三类模型,发现领域特定模型表现更优,TSViT整体性能最佳,还揭示了年际分布偏移及季内模型性能权衡等关键结论。

Comments Accepted at the ECCV 2026 Workshop TerraBytes II. To appear in the workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08476 2026-08-11 cs.CV 新提交 50%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08315 2026-08-11 cs.CV cs.MM 新提交 50%

Your VLM Already Knows When: Training-Free Temporal Grounding by Asking Yes or No

你的视觉语言模型(VLM)已经知道时间:通过提问“是/否”实现无需训练的时间定位

Ji Huang, Barry Devereux, Hui Wang

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 针对VLM时间定位任务的自信错误问题,提出无需训练的FV-Action方法,通过从粗到细的二元问题扫描替代时间戳回归,在多个基准数据集上大幅提升了时间定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-11 cs.RO cs.CV 新提交 50%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

专题命中 评测与基准 :language model(abstract)

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures, Published in Sensors

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07941 2026-08-11 cs.CV 新提交 50%

LAD-COD: Language-Aligned Dense Perception for Camouflaged Object Detection

LAD-COD:面向伪装目标检测的语言对齐密集感知

Shangye Song, Tianzhi Zhu, Syed Ariff Syed Hesham, Xin He, Yun Liu

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究针对伪装目标检测中密集视觉特征缺乏语言指导的问题,提出LAD-COD框架,通过语言对齐双视觉融合实现语义与分层视觉特征的对齐,在三个数据集的12组对比中取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07141 2026-08-10 cs.CV 新提交 50%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 50%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07062 2026-08-10 cs.CV 新提交 50%

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark

计算病理学中测试时自适应的解释稳定性:大规模基准测试

R. G. Bahumanya, Harshith V. M., Shreyank N. Gowda, Anala M. R

机构 * R.V. College of Engineering(R.V.工程学院) University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 该研究构建了计算病理学TTA的大规模基准,发现不同TTA方法对模型解释的影响差异显著,解释稳定性与自适应质量弱相关,强调了解释稳定性是TTA的重要可靠性维度。

详情

展开后加载摘要…

URL PDF HTML 收藏