arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2605.00924 2026-06-16 cs.LG cs.AI 版本更新 62%

StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer

StyleShield: 通过连续可控风格迁移揭示AIGC检测器的脆弱性

Guantian Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出StyleShield,一种基于流匹配的条件文本风格迁移框架,通过连续控制风格迁移强度,在保持语义相似度的同时实现高规避率,并引入RateAudit算法质疑基于分数的检测可靠性。

Comments 12 pages, 5 figures. Code and model weights will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11687 2026-06-16 cs.LG cs.AI cs.NE 版本更新 62%

Learning in the Recurrent State: Gradient Descent with Linear Recurrent Networks

循环状态中的学习:线性循环网络的梯度下降

Yudou Tian, Neeraj Mohan Sushma, Harshvardhan Mestha, Nicolo Colombo, David Kappel, Anand Subramoney

机构 * Center for Cognitive Interaction Technology CITEC, Universität Bielefeld, Germany(认知交互技术中心CITEC,比勒菲尔德大学,德国) Department of Electrical and Electronics Engineering, Birla Institute of Technology and Science Pilani, India(电子与电子工程系,比拉理工科学与技术学院比兰,印度) Department of Computer Science, Royal Holloway, University of London, United Kingdom(计算机科学系,伦敦皇家霍洛威大学,英国)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种线性循环网络架构GRIL,通过乘法读出和滑动窗口交叉积自注意力更新,使其能在单次前向传播中实现任务特定线性预测器的小批量梯度下降,并在长程竞技场和语言建模中取得有效性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13196 2026-06-11 cs.LG cs.AI quant-ph 版本更新 62%

A Physics-Inspired Optimizer: Velocity Regularized Adam

一种受物理启发的优化器:速度正则化Adam

Pranav Vaidhyanathan, Lucas Schorling, Natalia Ares, Maike Osborne

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VRAdam优化器,通过引入速度正则化技术,结合Adam的参数缩放,提升训练稳定性与收敛速度,理论分析显示其在非凸目标下的收敛速率为O(√(lnN)/√N)。

Comments L. Schorling and P. Vaidhyanathan contributed equally to this work. 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25359 2026-06-11 cs.CL cs.AI 版本更新 62%

Geometric Metrics and LLMs: What They Measure and When They Work

几何度量与大语言模型:它们测量什么以及何时有效

Viacheslav Yusupov, Anna Antipina, Ameliia Alaeva, Danil Maksimov, Anna Vasileva, Tatyana Zaitseva, Alina Ermilova, Evgeny Burnaev, Egor Shvetsov

机构 * Moscow Institute of Physics and Technology(莫斯科物理技术学院) Russian Academy of Sciences(俄罗斯科学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文系统测试了用于大语言模型评估的几何度量,发现部分度量主要反映输出长度,而几何度量在文本统计基础上提供有限但真实的信息,并指出故障检测是最有前景的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06698 2026-06-10 cs.LG cs.CL 版本更新 62%

RECAP: Regression Evaluation for Continual Adaptation of Prompts

RECAP: 提示持续适应的回归评估

Harsh Deshpande, Kushal Chawla, Sangwoo Cho, William Campbell, Sambit Sahu

机构 * Capital One

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 提出RECAP基准,在严格主动适应-测试协议下评估提示优化方法对约束变化的持续学习能力,发现现有方法在主动场景下性能无显著提升,强调设计主动提示适应方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24942 2026-06-09 cs.LG cs.AI 版本更新 62%

Riemannian-Manifold Steering: Geometry-Aware Generative Autoencoders for Label-Free Steering

黎曼流形操控:用于无标签操控的几何感知生成自编码器

Narmeen Oozeer, Shivam Raval, Philip Quirke, Manikandan Ravikiran, Jeff Phillips, Shriyash Upadhyay, Amirali Abdullah

机构 * Martian Harvard University(哈佛大学) Thoughtworks University of Utah(犹他大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出将语言模型操控重新定义为激活空间上的黎曼测地线计算,通过基于输出空间Hellinger距离学习的编码器实现无标签、无拓扑先验的流形操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09151 2026-06-09 cs.CV cs.AI cs.LG 版本更新 62%

Video Understanding by Design: How Datasets Shape Video Models

通过设计理解视频:数据集如何塑造视频模型

Lei Wang, Syuan-Hao Li, Piotr Koniusz, Yongsheng Gao

机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文从数据集视角出发,提出统一框架连接数据集结构、归纳偏差与架构设计,分析数据集特性如何驱动视频理解架构创新,并讨论不同数据体制下的表征偏差。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09787 2026-06-09 astro-ph.IM astro-ph.GA cs.LG 版本更新 61%

Learning What's Real: Disentangling Signal and Measurement Artifacts in Multi-Sensor Data, with Applications to Astrophysics

学习真实内容:在多传感器数据中分离信号和测量伪影,应用于天体物理学

Pablo Mercader-Perez, Carolina Cuesta-Lazaro, Daniel Muthukrishna, Jeroen Audenaert, V. Ashley Villar, David W. Hogg, Marc Huertas-Company, William T. Freeman

机构 * Massachusetts Institute of Technology(麻省理工学院) Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会) Institute for Advanced Studies(高级研究 institute) Harvard University(哈佛大学) New York University(纽约大学) Instituto de Astrofísica de Canarias(加那利大天文台)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG;foundation model(comments)

AI总结 本文提出一种深度学习框架,通过重叠观测、双编码器架构和反事实生成目标,分离多传感器数据中的信号与伪影,提升天体物理学研究的准确性。

Comments Accepted at the 2nd Workshop on Foundation Models for Science at ICLR 2026. 10 pages, 7 figures (main text), plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-25 cs.CL 版本更新 57%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Vasu Rangarajan, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15224 2026-08-25 cs.LG 版本更新 57%

Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach

用于原则评估的语义嵌入结构化:一种原型引导的对比学习方法

Che Shen, Junwei Su, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文针对通用文本嵌入在任务区分上的不足,提出PGCL方法,通过多流结合的正则化模块生成任务适配表示,在三个代理任务数据集上均优于原始冻结嵌入,明确了方法适用边界并修订了理论分析。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR). 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-25 cs.CL 版本更新 57%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

Comments Paper accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12792 2026-08-25 cs.CR cs.AI 版本更新 57%

Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels

无声警报:一种用于跨模型和量化级别比较危险识别的J空间协议

Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun, Anton Sergeev

机构 * HSE University(俄罗斯高等经济大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究提出JADR协议,通过J空间测量模型内部表示,不依赖外部评判模型,计算本地运行。应用于六个模型跨越三种权重表示形式,以SafetyAUC指标比较,能显著区分不同安全机制模型,捕捉量化差异。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08269 2026-08-25 cs.AI 版本更新 57%

PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs

PolyUQuest:基于异构图的可验证结构感知网络检索增强生成

Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye, Mingtao Zhang, Haoyang Li, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 研究针对现有RAG系统不足,提出基于异构图的PolyUQuest框架。通过双层路由器分配查询到三种检索模式,答案可验证。在PolyU官网等评估中,该框架在多方面优于现有系统,还提供交互式界面,准备部署为学生问答服务。

Comments Accepted at CIKM 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10949 2026-08-25 cs.AI 版本更新 57%

Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models

回忆过好:记忆增强模型中的谄媚评估与缓解

Shelly Bensal, Axel Magnuson, Aparna Balagopalan, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本研究首次系统评估记忆增强模型中的谄媚现象,提出MIST基准测试,发现记忆会放大谄媚行为(最高25倍),并提出两种轻量级缓解方法。

Comments Under submission; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22225 2026-08-25 cs.CV cs.AI 版本更新 57%

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新 57%

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06519 2026-08-24 cs.CL 版本更新 57%

MedRAGChecker: Claim-Level Verification for Biomedical Retrieval-Augmented Generation

MedRAGChecker: 用于生物医学检索增强生成的声明级验证

Yuelyu Ji, Min Gu Kwak, Hang Zhang, Xizhi Wu, Chenyu Li, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 MedRAGChecker通过声明级验证和诊断框架,提高生物医学RAG生成答案的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07303 2026-08-21 cs.LG 版本更新 57%

Bootstrap Theory of Representational Emergence (TBER): Explanatory Insufficiency, Transition Regimes, and the Emergence of New Representational Levels

表征涌现的自举理论:解释不充分性作为表征学习与世界模型的驱动力

Jacques Raynal, Pierre Slangen, Elsa Raynal, Jacques Margerit

机构 * Laboratory of Bioengineering and Nanosciences (LBN), University of Montpellier(生物工程与纳米科学实验室(LBN),蒙彼利埃大学) EuroMov Digital Health in Motion, University of Montpellier, IMT Mines Alès(EuroMov数字健康运动,蒙彼利埃大学,IMT矿山阿尔勒) Certified Sophrologist, Sensorimotor Practice, Montpellier, France(认证Sophrologist,运动觉实践,蒙彼利埃,法国) Emeritus Professor, University of Montpellier(荣誉教授,蒙彼利埃大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出表征涌现自举理论(TBER),将解释不充分性视为新表征涌现的积极信号,通过五阶段递归过程驱动表征创新,应用于表征学习、世界模型和科学发现。

Comments Version 4. Major theoretical revision introducing the distinction between manifestations of explanatory insufficiency and resolution regimes (local-corrective, representationally resolutive, and structurally recurrent), together with regime-sensitive diagnosis and closure assessment. Formal mathematical boundary cases have been clarified. 28 references, no figures or tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-20 cs.AI 版本更新 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14905 2026-08-20 cs.CL 版本更新 57%

How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

智能体在自动研究(AutoResearch)中如何失败?针对100项真实前沿研究任务的端到端诊断评估

Yanlin Fei, Nazhou Liu, Xinmiao Yu, Shaolong Chen, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 本研究推出AutoResearchEval评估平台,构建含45种失效模式的ARFT分类体系,发现当前智能体缺乏元认知循环是核心缺陷,公开发布相关资源以推动自主科学发现研究。

Comments *Equal Contribution (alphabetical order by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09560 2026-08-20 cs.LG 版本更新 57%

The Diffusion-Attention Connection

扩散与注意的联系

Julio Candanedo

机构 * SparseTrace.ai, Appleton, Wisconsin, USA(SparseTrace.ai,美国威斯康星州阿普尔顿)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文揭示Transformer、扩散图和磁拉普拉斯为单一马尔可夫几何的不同模式,通过定义QK双向发散实现注意力、扩散图和磁扩散的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01684 2026-08-20 cs.IR cs.CL 版本更新 57%

LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum

LACONIC: 通过双阶段训练课程实现可扩展稀疏检索的密集级有效性

Zhichao Xu, Shengyao Zhuang, Crystina Zhang, Xueguang Ma, Yijun Tian, Maitrey Mehta, Jimmy Lin, Vivek Srikumar

机构 * University of Utah(犹他大学) The University of Queensland(昆士兰大学) University of Waterloo(滑铁卢大学) University of Notre Dame(圣约翰大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 LACONIC通过双阶段训练课程实现高效稀疏检索,以更少的计算资源达到与密集模型相当的检索效果。

Comments SIGIR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07897 2026-08-19 cs.AI cs.HC 版本更新 57%

Pander Score: A Continuous Measure of Sycophancy as Epistemic Deference

AI认知顺从指数:谄媚行为的连续度量

Alejandro Botas, Paul de Font-Reaulx, Luke Hewitt

机构 * Independent(独立研究者) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Transluce

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出AI认知顺从指数(AEDI),通过从自然语言输出中估计概率来连续度量模型对用户态度的顺从程度,测试8个模型发现显著差异,Claude顺从最少,Grok和Gemini最多。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06837 2026-08-19 eess.AS cs.LG 版本更新 57%

SEAM: Shortcut-Aware Real-Time Detection of Scripted vs. Spontaneous Speech for Interview Guardrails

SEAM:面向面试防护栏的脚本化与自发语音的快捷方式感知实时检测

Vsevolod, Kovalev, Pranay Manocha

机构 * Symbal AI Princeton University(普林斯顿大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 提出SEAM框架,通过统一预处理、接缝感知采样、非语音增强和紧凑DistilHuBERT骨干,在8秒窗口下实现0.971 ROC-AUC,并揭示快捷方式学习问题。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09696 2026-08-19 cs.CL 版本更新 57%

An Analysis of Language Frequency and Error Correction for Esperanto

世界语的语言频率与错误修正分析

Junhong Liang

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究针对低资源语言世界语的GEC缺口,构建了Eo-GP和Eo-GEC数据集,实验发现GPT-4在世界语语法错误修正任务上优于GPT-3.5,为低资源语言的GEC提供了新方向。

Comments Data is now available at: https://github.com/Skywalker-Harrison/Eo-GEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07370 2026-08-18 cs.CL 版本更新 57%

LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering

LitTraceQA:面向科学问答的多阶段溯源与验证基准

Xuye Liu, Yimu Wang, Peng Shi, Bo Xue, Xiangrui Ke, Songcheng Cai, Kath Choi, Di Wu, Freda Shi, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学) Amazon(亚马逊公司) City University of Hong Kong(香港城市大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究提出LitTraceQA基准,用于科学问答的多阶段溯源与验证,提供含多类型证据的问答数据,可评估系统的论文检索、证据溯源及答案准确性,助力生成可验证的科学问答结果。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18237 2026-08-18 cs.CV cs.LG 版本更新 57%

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

视觉相似性的多种意义:一种文本提示的图像感知度量

Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究人类视觉相似性判断的上下文依赖问题,通过引入大规模数据集微调VLM,产生能捕捉多种视觉相似性意义的TPIPS度量,该度量与人类感知更契合,还在多种任务中开启新功能。

Comments Project Webpage: https://peterwang512.github.io/TPIPS Code: https://github.com/adobe-research/TPIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13039 2026-08-18 cs.CY cs.AI 版本更新 57%

Safeguard-Conditioned Uplift: Measuring Utility-Risk Frontiers for Dual-Use Biology Assistants

保障条件提升:衡量两用生物助手的效用-风险前沿

Dipesh Tharu Mahato

机构 * New York University(纽约大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究两用生物助手访问条件对效用和风险的影响,提出保障条件提升协议,通过人工判断效用-风险前沿比较访问条件,评估了Claude Sonnet 4.6和Gemini 3.5 Flash,给出部署级评估目标和校准程序,衡量其对效用-风险前沿的作用。

Comments 27 pages, 3 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04525 2026-08-18 cs.CV cs.AI 版本更新 57%

SLUM-i: Semi-supervised Learning for Urban Mapping of Informal Settlements and Data Quality Benchmarking

SLUM-i: 非正规住区城市制图的半监督学习与数据质量基准测试

Muhammad Taha Mukhtar, Syed Musa Ali Kazmi, Khola Naseem, Muhammad Ali Chattha, Andreas Dengel, Sheraz Ahmed, Muhammad Naseer Bajwa, Muhammad Imran Malik

机构 * School of Electrical Engineering and Computer Science, National University of Sciences and Technology (NUST)(电气工程与计算机科学学院,国立科学与技术大学(NUST)) Smart Data & Knowledge Services, German Research Center for Artificial Intelligence (DFKI)(智能数据与知识服务,德国人工智能研究中心(DFKI))

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对非正规住区制图中标注稀缺和数据质量挑战,提出半监督分割框架,集成类别自适应阈值和DINOv2过滤机制,在跨三大洲七城市实验中mIoU提升最高5.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏