arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2997 篇

2607.19476 2026-07-23 cs.CV 新提交 50%

Detect Early, Escalate Rarely: Anytime Detection of AI-Generated Video from the Compressed Bitstream

尽早检测,极少升级:从压缩比特流中随时检测人工智能生成的视频

Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

专题命中 评测与基准 :language model(abstract)

AI总结 研究从压缩比特流中随时检测人工智能生成视频的问题,核心方法是将任务重定义为流感知并对运动场评分,贡献是重新构建、两个保证及测量前沿,在GenVidBench等上取得较好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19228 2026-07-22 cs.CV 新提交 50%

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

IGGT4D:流式4D实例关联几何变换器

Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu

机构 * Horizon Robotics(地平线机器人公司) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对现实世界空间智能中视频流场景理解问题,提出IGGT4D流式实例关联几何变换器,通过因果时空建模更新统一表示,还构建数据集。实验证明其在长动态序列在线推理上优于现有基线。

Comments Project Page: https://iggt4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交 50%

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-07-21 eess.IV 新提交 50%

When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah

专题命中 评测与基准 :LLM(abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18014 2026-07-21 cs.CV 新提交 50%

SAMRI-3D: Adapting SAM2 for 3D MRI Segmentation with Global Volume Tokens

SAMRI-3D:通过全局体积令牌将SAM2应用于3D MRI分割

Zhao Wang, Wei Dai, Hongfu Sun, Craig Engstrom, Shekhar S. Chandra

机构 * School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) School of Engineering, College of Engineering, Science and Environment, University of Newcastle(工程学院,工程、科学与环境学院,纽卡斯尔大学) School of Human Movement and Nutrition Sciences, The University of Queensland(人类运动与营养科学学院,昆士兰大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对MRI低软组织对比度导致边界难观察的问题,提出SAMRI-3D方法,通过冻结图像编码器、微调解码器和内存模块,并引入全局体积令牌,在3D MRI分割上取得高精度,提升了基于SAM的医学模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17938 2026-07-21 cs.CV 新提交 50%

MuViSeg: Multi-View Segment Correspondences from Dense Geometry Priors

MuViSeg:基于密集几何先验的多视图段对应

Denis Fatykhoph, Timur Akhtyamov, Konstantin Pakulev, German Devchich, Gonzalo Ferrer

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对经典图像对应与对象级推理的差距,基于段级匹配范式提出三个学习匹配头,包括LightGlue风格注意力头、DPT风格多尺度融合模块及多视图扩展,在多个数据集和任务中取得显著性能提升。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17722 2026-07-21 cs.SE 新提交 50%

KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes

KernelDiag:基于代理的内核崩溃根本原因诊断

Weijing Wang, Zan Wang, Dong Wang, Haichi Wang, Junjie Chen

专题命中 评测与基准 :LLM(abstract)

AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 50%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17138 2026-07-21 cs.CV 新提交 50%

Denoising Models Develop Human-Like Perceptual Illusion Representations Across Architectures

去噪模型在不同架构中开发出类似人类的感知错觉表示

Gautam Ranka, Paras Chopra

机构 * Lossfunk

专题命中 评测与基准 :language model(abstract)

AI总结 研究探讨自然图像训练的深度神经网络在亮度错觉输出与人类一致,发现去噪模型在特定内部层有错觉敏感表示,确定相关层和通道,表明去噪目标更关键,虽激活跟踪人类感知模型,但注入表示无像素偏移,此为去噪视觉模型感知表示的首次此类特征描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16540 2026-07-21 cs.CV 新提交 50%

Do Vision Encoders Exhibit Human-like Color Thresholds?

视觉编码器是否表现出类人的颜色阈值?

Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Image Processing Lab, Universitat de València(瓦伦西亚大学图像处理实验室) Arab Academy for Science, Technology, and Maritime Transport(阿拉伯科学、技术和海运学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究探索50多个预训练视觉编码器的色度敏感性,将其与人类辨别阈值比较,发现模型表示与人类感知阈值对齐弱,自监督编码器优于监督的,语言监督模型两极分化,表明当前训练目标不会自然产生类人色度敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16105 2026-07-20 cs.CV cs.HC 新提交 50%

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

用于解释视觉语言模型中视觉素养的注意力引导显著图

Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :language model(abstract)

AI总结 研究视觉语言模型如何解释数据可视化这一问题,提出针对图像文本生成的轻量级诊断显著图方法,通过聚合注意力并映射到图像,生成快速无梯度显著图,用删除度量评估,揭示模型注意力分配情况。

Comments To be presented at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15331 2026-07-20 cs.CV 新提交 50%

Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark

广义少样本基准上的无训练开放词汇3D点云分割

Silas kwabla Gah, Ebenezer Owusu

机构 * University of Ghana(加纳大学)

专题命中 评测与基准 :language model(abstract)

AI总结 研究广义少样本3D点云分割问题,提出无训练方法,用冻结的3D视觉语言模型与概念分割器,通过跨视图一致性协调,在ScanNet200和ScanNet++基准上提升新类mIoU,且无需少样本支持,效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15268 2026-07-17 cs.CV 新提交 50%

Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography

用于超声心动图心肌梗死定位的运动条件多视图融合

Guang Yang, Wentian Xu, Siyu Wang, Betty Raman, Lei Li, Vicente Grau

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对超声心动图心肌梗死定位问题,提出MCF-Net框架,融合心肌运动线索与基础模型表示,通过极稀疏监督建模心脏运动,利用运动衍生软掩码提供先验,跨视图整合运动和视觉优化预测,在节段级定位上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14566 2026-07-17 cs.CR 新提交 50%

Fully Automated End-to-End Adversary Emulation from MITRE ATT\&CK Based Cyber Threat Intelligence Using LLMs

基于MITRE ATT&CK的网络威胁情报,使用大语言模型实现全自动端到端对手模拟

Jueon Choi, Seojun Lee, Sanggwon Yun, Kwanghoon Choi, Gunjin Cha

专题命中 评测与基准 :LLM(abstract)

AI总结 该研究基于MITRE ATT&CK网络威胁情报,利用大语言模型构建全自动端到端对手模拟框架,统一剧本生成、执行与故障恢复流程,经多模型评估,Claude Sonnet 4.5效果最佳,故障恢复机制提升了执行成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13754 2026-07-16 cs.CR 新提交 50%

PriEval-Protect: A Unified Framework for Privacy Evaluation and Protection in Healthcare Systems

PriEval-Protect:医疗系统中隐私评估与保护的统一框架

Ilef Chebil, Asma El Hadj, Souheib Yousfi, Aroua Hedhili, Layth Sliman

专题命中 评测与基准 :LLM(abstract)

AI总结 针对医疗系统隐私问题,PriEval-Protect框架分两阶段统一评估与缓解隐私风险。评估阶段结合法规评分与技术分析得出综合风险评分,保护阶段依风险推荐对策,实现法规与数据级风险分析的衔接,结果具合规性与可解释性。

Comments 10 pages, 3 figures. Accepted at IDT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13506 2026-07-16 cs.CV 新提交 50%

TRACE-PCa: Predicting Prostate Cancer Progression from Longitudinal MRI During Active Surveillance

TRACE-PCa:在主动监测期间从纵向MRI预测前列腺癌进展

Hongye Zeng, Shreeram Athreya, Dingyuan Dai, Steve Raman, Leonard Marks, William Speier, Corey Arnold

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究提出TRACE-PCa模型,无需病变分割,通过预训练3D MRI模型编码序列扫描,引入时间注意力门,融合临床变量,在纵向AS队列验证中表现出色,能减少不必要活检,有预测前列腺癌进展的潜力。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12196 2026-07-15 q-bio.BM 新提交 50%

AlphaFunctor: Bridging The Gap Between Protein Function Annotation and Property Prediction

AlphaFunctor:弥合蛋白质功能注释与特性预测之间的差距

Xiang Liu, Anna E. Yee, Josh V. Vermaas, Daniel R. Woldring, Guo-Wei Wei

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究旨在弥合蛋白质功能注释与特性预测的差距,提出基于范畴论的AlphaFunctor平台,直接从序列预测蛋白质功能并映射到特性预测,经大量数据训练,无需特定任务网络设计,性能优于其他竞争预测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12231 2026-07-15 cs.CV 新提交 50%

The GEST-Engine: From Event Graphs to Synthetic Video. A Full Technical Report

GEST引擎:从事件图到合成视频。完整技术报告

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布赫实验室技术公司)

专题命中 评测与基准 :LLM(abstract)

AI总结 GEST引擎从自然语言文本生成多角色视频,核心是明确的世界模型,以GEST表示世界状态。通过程序或智能系统生成GEST,经四阶段管道执行,能输出多种视频相关数据,且保证相关特性,其输出可作视频理解多方面工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 50%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 评测与基准 :language model(abstract)

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10240 2026-07-14 cs.CV cs.MM 新提交 50%

What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

你的简答题VQA分数实际衡量的是什么?多模态简答题基准中依赖评估者的不稳定性

Guanhua Ye, Niu Jingbin, Yan Li, Meiyu Liang, Zhe Xue, Yingxia Shao, Yawen Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :language model(abstract)

AI总结 研究简答题VQA基准中模型答案语义正确性与和评估者期望表面形式匹配度被混淆的问题,通过人工验证语义判断等方法研究六个视觉语言模型和六个基准,发现答案类型影响不稳定性,提出官方分数应伴有语义审计和答案类型诊断以保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09985 2026-07-14 cs.CV 新提交 50%

UniPose9D: Universal Category-Agnostic Object Pose Estimation

UniPose9D:通用的类别无关物体姿态估计

Yang You, Yi Du, Cole Harrison, Leonidas Guibas

机构 * Stanford University(斯坦福大学) Amazon(亚马逊)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究针对物体姿态估计中现有方法泛化性不足的问题,提出UniPose9D模型,通过采样点对、利用特定特征预测NOCS坐标,引入改进算法及流匹配,构建训练集,实验证明该模型能匹配或超越专业方法,泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08790 2026-07-13 q-bio.QM 新提交 50%

DentiAsk: A VQA Benchmark for Multimodal Reasoning in Panoramic Dental Radiographs

DentiAsk:全景牙科X光片中多模态推理的视觉问答基准测试

Debesh Jha, Tapas Kumar Dutta, Roshan Paudel, Onkar Kishor Susladkar, Aashish Ghimire, Anupam Dhakal, Sabin Adhikari, Nand Kumar Yadav, Deepak Ranjan Nayak, Pravin Pawar, William C. W. Chen, Glenda Reynolds

专题命中 评测与基准 :language model(abstract)

AI总结 研究旨在解决现有医学视觉问答基准测试无法充分体现全景牙科X光片解读复杂性的问题,引入DentiAsk基准测试,涵盖多种病变和推理层次,对10种模型测试发现其在空间定位等方面存在局限,为推进医学成像多模态推理提供挑战基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09628 2026-07-13 cs.HC 新提交 50%

Indirect and Direct AI Scaffolding for Computational Problem Posing: A Pilot Experience Report

用于计算问题提出的间接和直接人工智能支架:初步经验报告

Shayla Sharmin, Mohammad Fahim Abrar, Mohammad Al-Ratrout, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(abstract)

AI总结 该报告介绍两个大语言模型驱动的支架系统,用于支持不同计算场景的问题提出。系统用布鲁姆分类法评估问题,输出方式有间接(引导性问题)和直接(示例)两种。研究表明二者互补,先间接后直接能促进反思与改进,为计算课堂整合此类支架提供策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09161 2026-07-13 cs.SE 新提交 50%

Evaluating Semantic and Quality-Aware Retrieval for Source Code Repositories

评估源代码库的语义和质量感知检索

Marek Horváth, Emília Pietriková

专题命中 评测与基准 :LLM(abstract)

AI总结 研究针对自然语言查询的源代码库检索问题,结合函数级碎片化、文本和代码嵌入等技术及多种检索模式构建原型系统,用C代码语料库评估,发现语义检索总体最强,自动路由表现良好,质量元数据对特定查询有用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09011 2026-07-13 cs.CR cs.MA 新提交 50%

Secret Scanner Agent: Extracting Secrets and Access Context from Unstructured Documents

秘密扫描代理:从非结构化文档中提取秘密和访问上下文

Zixiao Chen, Mariko Wakabayashi, Charlotte Siska

专题命中 评测与基准 :LLM(abstract)

AI总结 研究从非结构化文档提取秘密及访问上下文的问题,提出多智能体大语言模型系统SSA,它能通过检测与审查智能体配对提取相关信息,经合成基准评估,相比传统方法提升了提取精度、召回率,速度更快,让凭证检测更具可操作性。

Comments Submitted to the Conference on Applied Machine Learning for Information Security (CAMLIS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 50%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08086 2026-07-10 cs.CV 新提交 50%

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion

GRE-Diff:用于结构化布局扩散的高斯房间嵌入

Jing Wang, Haoran Xiong, Zihao Yan, Minglun Gong, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省视觉媒体与多维智能重点实验室,计算机科学与软件学院,深圳大学) School of Computer Science, University of Guelph(圭尔夫大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出GRE-Diff框架,结合AI建议与人工编辑,通过大语言模型或图形用户界面让用户指定房间相关约束和操作,利用高斯房间嵌入生成多样合理设计,实验表明其能产生高质量布局,助力空间设计中AI与人类创造力结合。

Comments 37 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07827 2026-07-10 cs.CR 新提交 50%

Open Models, Open Risks: Measuring Unsafe Generation in Text-to-Image Models In the Wild

开放模型,开放风险:衡量实际应用中的文本到图像模型的不安全生成

Peilin Han, Yang Liu, Yilong Yang, Jingchun Zhang, Teng Li, Jianfeng Ma, Zhuo Ma

专题命中 评测与基准 :prompting(abstract)

AI总结 研究实际应用中的文本到图像模型的不安全生成问题,通过越狱视角进行大规模实证研究。引入高级ASR改进指标,评估200多个模型,发现安全退化不普遍不均匀,识别出高风险模型并追溯其发布背景,向Hugging Face报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07744 2026-07-10 cs.SE 新提交 50%

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization

PERFOPT-Bench:评估软件性能优化中的编码代理

Yingyun Cui, Yi Xie, Piaohong Wang, Jiawei Ma, Bo Liu, Liangliang Cao

专题命中 评测与基准 :LLM(abstract)

AI总结 该研究介绍PERFOPT-Bench基准,用于评估软件性能优化中编码代理的完整性能工程循环。通过7个长期任务评估7个不同的代理堆栈,发现优化性能取决于工作负载,原始加速作基准分数不安全,还提出中继试验可恢复额外空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02337 2026-07-10 cs.SE 新提交 50%

Developers' Experience with Generative AI Beyond Productivity Assessment -- Insights from an Empirical Mixed-Methods Field Study

开发者在生产力评估之外的生成式AI使用体验——来自实证混合方法现场研究的见解

Charlotte Brandebusemeyer, Kerim Zunic, Thomas Zimmermann, Tobias Schimmer, Bert Arnrich

专题命中 评测与基准 :prompting(abstract)

AI总结 通过混合方法现场研究,发现开发者对生成式AI总体满意,尤其在单调重复任务中感知效率提升,但同一任务中结合代码建议与聊天提示会削弱收益,并提出基于任务特征选择交互类型的经验法则。

详情

展开后加载摘要…

URL PDF HTML 收藏