arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2608.17044 2026-08-19 cs.CV cs.AI 新提交 57%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16852 2026-08-18 cs.AI 新提交 57%

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

合规检测器读取什么?激活探针与防护模型的审计

Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(雷克西实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16661 2026-08-18 cs.CV cs.LG 新提交 57%

Turning spectra into images improves plant trait retrieval with 2D-CNNs

将光谱转换为图像可通过2D-CNN改进植物性状检索

Javier Lopatin, Teja Kattenborn, Eya Cherif, Sebastián Moreno

机构 * Adolfo Ibáñez University(阿道夫·伊瓦涅斯大学) University of Chile(智利大学) University of Freiburg(弗莱堡大学) Leipzig University(莱比锡大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本研究将一维光谱转为二维图像,用EfficientNet-B0在GreenHyperSpectra数据集上实验,发现直接重塑为二维网格的方法提升了植物多性状预测精度,且2D光谱图像的表征优势是性能提升的关键。

Comments 38 pages, 14 figures, 11 tables. Supplementary material appended after the references. v2: adds a per-image vs global scaling ablation, expands the methods, and corrects several figures and captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 57%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16203 2026-08-18 cs.SD cs.CL eess.AS 新提交 57%

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

INSPIRE:指令感知语音检索基准

Chen-An Li, Hung-yi Lee

机构 * National Taiwan University(台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对现有语音检索系统无法适配多样用户意图的问题,构建首个指令感知语音检索基准INSPIRE,评估四类检索范式,发现当前无方法能稳健处理所有检索意图,凸显统一架构的必要性。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15407 2026-08-18 cs.CR cs.AI cs.NE 新提交 57%

Chameleon: An Adaptive AI-Driven Honeypot Architecture Using Threat-Calibrated Particle Swarm Optimization and Semantic Deception Rapidly-Exploring Random Trees

变色龙:一种采用威胁校准粒子群优化算法与语义欺骗快速探索随机树的自适应AI驱动蜜罐架构

Rohit Swami, Tushar Singh, Akash Warde, Sri Muthu

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Chameleon是一种开源自适应AI蜜罐平台,通过BiLSTM分类器、Qwen3.5-0.8B模型及TC-PSO、S-RRT引擎,解决传统蜜罐与商业产品的缺陷,性能显著提升且成本大幅降低。

Comments 10 pages, 7 figures, 2 tables. Under consideration for journal publication. MIT-licensed code and datasets: https://github.com/RohitSwami33/Chameleon-cybersecurity-ml

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14669 2026-08-18 cs.AI 新提交 57%

Beyond Correctness: Toward Automated Novelty Verification with Lean 4

超越正确性:基于 Lean 4 的自动化新颖性验证研究

Ayrton Porto

机构 * Universidad Nacional del Centro de la Provincia de Buenos Aires (UNICEN)(布宜诺斯艾利斯省国立中部大学(UNICEN))

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出 AViD Journal 流程,基于 Lean 4 从三维度验证数学定理新颖性,评估时发现编译不保证语义保真度等三个通用障碍。

Comments 20 pages. Preliminary version; a large-scale quantitative evaluation (N theorems x M models) is left to future work. Comments welcome. Code: https://github.com/ayrtonporto/avid-journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14663 2026-08-18 cs.LG stat.AP 新提交 57%

In-Context Learning to Assess Built Environment Impacts on Perceived Neighborhood Walkability Among Mobility-impaired Older Adults

基于上下文学习评估建成环境对行动受限老年人感知社区步行便利性的影响

Houhao Liang, Kresimir Friganovic, Joanne Kua, Noor Hafizah Ismail, Su Su, Bryan Yijia Tan, Navrag B. Singh, Panos Mavros

机构 * Future Health Technologies, Singapore-ETH Centre(未来健康技术中心,新加坡-ETH中心) Institute of Geriatrics and Active Ageing, Tan Tock Seng Hospital(陈笃生医院老年病学与 active 老龄化研究所) Geriatric Medicine, Khoo Teck Puat Hospital(邱德拔医院老年医学科) Department of Orthopedic Surgery, Woodlands Health Campus(伍德兰兹健康园区骨科)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究采用TabPFN的上下文学习方法,在小规模数据集上较传统模型更优,通过SHAP-IQ揭示高阶特征交互对行动受限老年人感知社区步行便利性的影响。

Comments 8 pages, 2 tables, 1 figure

Journal ref COSIT 2026 Poster Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15373 2026-08-18 cs.LG cs.NA math.NA 新提交 57%

Beyond Field Accuracy: Two-Axis Diagnosis of Inverse-PINN Parameter Error

超越场精度:逆物理信息神经网络参数误差的双轴诊断

Yifan Zhang, Qian Tao

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对逆PINNs的参数误差问题,提出双轴后训练诊断方法,经三类合成PDE及耦合双参数达西检验验证,可有效分离有限样本分辨率与参数偏好,助力后续研究方向确定。

Comments Preprint with supplementary appendix. 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14228 2026-08-17 cs.LG 新提交 57%

AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs

AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地

Yiming Zhang, Koji Tsuda

机构 * The University of Tokyo(东京大学) National Institute for Materials Science(国立材料科学研究所) RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14054 2026-08-17 cs.LG 新提交 57%

Model-agnostic Retrieval-Augmented Extended Forecasting for time series

模型无关的检索增强扩展预测用于时间序列

Juan Pablo Villa Serna, Rohan Asthana, Vasileios Belagiannis

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出模型无关的RAEF方法,通过改进检索与聚合机制提升时间序列预测性能,其效果优于RAF,兼具高效性与竞争力,可替代微调用于时间序列预测的领域适配。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13564 2026-08-17 cs.AI 新提交 57%

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

生成无奖励的评判标准以减少智能体评估中的过度打分

Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

机构 * Trinity College Dublin(都柏林三一学院) University College Dublin(都柏林大学学院) Dublin City University(都柏林城市大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13337 2026-08-14 cs.LG 新提交 57%

Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation

测量位置决定测量内容:基于消融的SAE评估中的位置选择

Valentin Noël

机构 * Devoteam(德孚替)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究发现基于消融的SAE评估中,测量位置的选择会影响结果,提出需统一测量位置的评估协议,修正方法仅需一行代码,且随语料库规模扩大问题更严重。

Comments 19 pages, 3 figures. Code and data: https://github.com/vcnoel/sae-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13197 2026-08-14 cs.LG 新提交 57%

Beyond Simulated Benchmarks: Evaluating Motion Representations for Fall Detection Under Real-World Data Scarcity

超越模拟基准:真实世界数据稀缺下跌倒检测的运动表示评估

Timilehin B. Aderinola, Ilaria D'Ascanio, Luca Palmerini, Lorenzo Chiari, Jochen Klenk, Clemens Becker, Brian Caulfield, Georgiana Ifrim

机构 * University College Dublin (UCD)(都柏林大学学院) University of Bologna(博洛尼亚大学) Robert Bosch Hospital(罗伯特博世医院) Heidelberg University Hospital(海德堡大学医院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文针对真实世界数据稀缺下的跌倒检测,系统评估了不同运动表示的性能,发现高参数模型在模拟数据表现好但泛化差,增强的符号表示泛化能力最优,为可部署跌倒检测提供了关键参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12776 2026-08-14 cs.CL 新提交 57%

ViTOED: A Dataset for Target-Oriented Emotion Detection on Vietnamese Social Media Texts

ViTOED:面向越南社交媒体文本的定向情感检测数据集

Chanh Vo, Son T. Luu, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究构建了越南社交媒体定向情感检测数据集ViTOED,提出基于结构化情感图的基线方法并评估相关预训练模型,揭示了该任务的挑战及模型改进空间。

Comments Accepted for publication at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12351 2026-08-14 cs.CY cs.AI 新提交 57%

Assessment Design in the GenAI Era: The X1-X2-X3 Assessment Pattern for Testing Students' AI Literacy, Learning Outcomes, and Reflection

生成式人工智能(GenAI)时代的评估设计:用于测试学生AI素养、学习成果与反思的X1-X2-X3评估模式

Riasat Islam, Thomas Roelleke

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文针对GenAI对在线评估的挑战,提出可复用的X1-X2-X3评估模式,用于测试学生AI素养等,为教师适配GenAI时代评估提供实践指导。

Comments 30 pages, 1 figure, 11 tables. Submitted to the following journal: Assessment & Evaluation in Higher Education (Taylor & Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12086 2026-08-13 cs.CV cs.LG 新提交 57%

Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP

看看探针发现了什么!MedCLIP中的真实世界胸部X光捷径

Nikolette Pedersen, Regitze Sydendal, Veronika Cheplygina, Théo Sourget

机构 * Pattern Recognition Revisited Lab (PURRlab)(模式识别重访实验室(PURRlab)) IT University of Copenhagen(哥本哈根信息技术大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 该研究探究MedCLIP模型中不同层的真实世界胸部X光捷径,发现局部捷径出现在较后层、弥散捷径出现在较早层,且两个数据集存在数据质量问题,凸显高质量数据集的必要性。

Comments 11 pages, 3 figure, poster presentation at the joint FAIMI, BRIDGE, and EPIMI workshop at MICCAI 2026 (Strasbourg, France) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11767 2026-08-13 cs.CL 新提交 57%

Causal Structure is Inducible but Functionally Decoupled: The Routing/Readout Boundary of a Typed Mechanism Library

因果结构可诱导但功能解耦:类型化机制库的路由/读出边界

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd.(清教信息科学(北京)有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究在两种规模的语言模型中发现,类型化机制库的因果结构可由监督诱导,其路由功能与答案读出解耦,且无额外开销、可审计恢复,为因果知识组织机制提供了新见解。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11681 2026-08-13 cs.CV cs.AI cs.MM 新提交 57%

Learning from Multimodal Pseudo-Labels for Robust Open-Vocabulary Instance and Panoptic Segmentation

学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割

Duy Tran Thanh, Yeejin Lee, Byeongkeun Kang

机构 * Seoul National University of Science and Technology(首尔科技大学) Chung-Ang University(中央大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。

Comments 14 pages

Journal ref Neurocomputing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11643 2026-08-13 cs.CV cs.LG 新提交 57%

Robustness of AI-Art Detectors under Generator Shift

生成器偏移下AI生成艺术检测器的鲁棒性

Shivank Singh Thakur, Meien Li, Mark Stamp

机构 * San Jose State University(圣何塞州立大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 该研究针对生成器偏移问题,在SD3.5m数据集上评估了五个AI艺术检测器的鲁棒性,发现模型在跨生成器场景下泛化能力不足,CLIP ViT-L/14表现最优,为分层防御检测器的开发提供了依据。

Comments To appear as a chapter in the book "Artificial Intelligence for Cyber Defense in Emerging Threats", to be published by Springer by early 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11367 2026-08-13 cs.CV cs.AI 新提交 57%

Gaze Target Estimation Anywhere with Concepts

基于概念的任意场景注视目标估计

Xu Cao, Houze Yang, Vipin Gunda, Zhongyi Zhou, Tianyu Xu, Adarsh Kowdle, Inki Kim, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌公司)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 针对现有注视估计方法依赖中间阶段、缺乏灵活性的局限,提出PGE任务,构建Gaze-Co数据集,开发GazeAnywhere模型,实现端到端的概念驱动注视目标估计并达到最优性能。

Comments CVPR 2026 Code and Benchmark are aviliable at https://github.com/IrohXu/GazeAnywhere and https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11341 2026-08-13 cs.AI 新提交 57%

Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

Apodex Discovery:用于评估和构建发现式人工智能的现实基准与环境

Brian Wang, Bin Feng, Xiaoman Pan, Chenyang An, Felix Liu, Tangqi Fang, Gongbo Sun, Lingfeng Shen, Ning Wang, Handuo Zhang, Feng Chen, Fuchao Yang, Xiang Wang, Jiacheng Lin, Siting Li, Zixuan Liu, Chi Han, Zhenhailong Wang, Kunlun Zhu, Lawrence Zhao, Yueqi Guo, Kailong Wen, Feng Xing, Yiling Guo, Lidong Bing, David Tan, Bo An, Heng Ji, Sheng Wang

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 Apodex Discovery是评估和构建发现式AI的框架,含三个核心组件,在AAV衣壳设计等任务中较现有方法取得性能提升,推动AI评估向可验证的真正发现研究发展。

Comments 85 pages, 9 figures, 38 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11250 2026-08-13 cs.AI cs.MA q-fin.CP q-fin.PM 新提交 57%

AgonAlpha: Autonomous Alpha Discovery via Prompt Economy and Scalable Agentic Search

AgonAlpha:通过提示经济与可扩展智能体搜索实现自主阿尔法发现

Weicheng Ye, Youran Sun, Xingyu Ren, Shunyao Yu, Chugang Yi, Haizhao Yang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 AgonAlpha是首个结合经验证构件搜索、对抗审核器与并行预算分配的阿尔法挖掘系统,在WorldQuant BRAIN部署后产出SPECTACULAR级阿尔法,为交易因子自主研究提供了完整证据轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10670 2026-08-12 cs.CL 新提交 57%

Seeds Before Objectives: Rethinking Evaluation for Low-Resource Garhwali ASR

目标之前的种子:重新审视低资源加尔瓦利语自动语音识别(ASR)的评估

Karamvir Singh Batra, Prathamjyot Singh, Ashima Sood, Jasmeet Singh, Sahil Sharma

机构 * Thapar Institute of Engineering and Technology(塔帕尔工程技术学院) Ulster University(阿尔斯特大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 针对低资源加尔瓦利语ASR评估,构建首个可复现多种子基准,发现多种子评估可区分真实增益与种子噪声,且w2v-BERT 2.0搭配标准CTC表现最优。

Comments 19 pages, 3 figures. Accepted for oral presentation at ICNLSP 2026, Trento, Italy, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交 57%

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10195 2026-08-12 cs.CV cs.LG 新提交 57%

More Accurate, Less Human: Gestalt Grouping in Vision Models

更准确,更少人工:视觉模型中的格式塔分组

Sudhanva Manjunath Athreya, Sai Phani Kumar Malladi

机构 * University of Utah(犹他大学) Siemens AG(西门子公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究引入行为测试套件,对比45个不同类型视觉模型与人类在四项分组任务上的表现,发现部分封闭模型的感知组织对齐度低于基准准确率,为可视化研究提供了审核模型的可复用标准。

Comments 9 pages, 7 figures, 5 tables. Conditionally accepted to VISxVision 2026, a workshop at IEEE VIS 2026. Includes appendix with per-task stimuli, metric derivations, and full per-model results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09944 2026-08-12 cs.HC cs.AI 新提交 57%

Navigation Alone Is Not Enough: Evaluating Explanatory Assistive UI Agents

仅导航是不够的:评估解释性辅助UI智能体

Santosh Patapati

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 该研究推出辅助UI智能体基准NeXUI,评估其导航、解释及用户控制能力,实验发现Gemini-3.5-Flash在该基准中表现不佳,为相关研发提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09230 2026-08-11 cs.AI 新提交 57%

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08982 2026-08-11 cs.LG 新提交 57%

Twin Rollouts: Noise-Coupled Counterfactual Branching in Interactive Video World Models

双回滚:交互式视频世界模型中的噪声耦合反事实分支

Yu Ma, Hongli Shi, Xinran Xu

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 本研究提出噪声耦合双回滚框架,解决交互式视频世界模型的反事实生成问题,规避近似逆问题,定义时空局部性度量,待开展实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏