arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 3102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 3102 篇

2607.04537 2026-07-07 cs.SE cs.AI 新提交 57%

Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

服从、发散、崩溃:对错误指令的盲目服从驱使代码语言模型陷入无法恢复的代码语义崩溃

Raj Jaiswal, Anany Singh Divy, Savar Bhasin, Adi Bajpai, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度德里国家理工学院) IIT Kanpur(印度坎浦尔理工学院) Microsoft Research India(微软印度研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究代码语言模型在指令错误时的表现,通过四个实验评估其在单步和迭代修复设置中对错误指令的应对,发现模型会盲目服从错误指令致代码语义崩溃,引入幽灵错误且无法恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交 57%

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04139 2026-07-07 cs.LG 新提交 57%

Masked Generative-Contrastive Representation Learning for Cross-Dataset EEG-Based Emotion Recognition

用于跨数据集基于脑电图的情绪识别的掩码生成对比表示学习

Huqin Weng, Jiayang Huang, Yimin Wen, Jie Du, Chi-Man Vong, Chuangquan Chen

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 提出掩码生成对比表示学习框架MGCRL用于跨数据集脑电图情绪识别,基于区域感知时空编码器,整合生成与对比学习,通过关键设计实现跨数据集泛化的细粒度和全局判别表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04034 2026-07-07 cs.SE cs.AI 新提交 57%

The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

“我不知道”过滤器:提高函数调用中智能体的可靠性

Stefan Broecker, Mason del Rosario, Boris Selitser, Thomas Strohmer

机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) Okareo, Inc.(Okareo公司) University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 57%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03821 2026-07-07 cs.CR cs.AI 新提交 57%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03650 2026-07-07 cs.CV cs.AI 新提交 57%

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

Enshuo Hsu, Jin Zhou, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03523 2026-07-07 cs.SE cs.CL 新提交 57%

Anchored Self-Play for Code Repair

用于代码修复的锚定自博弈

Caroline Choi, Zeyneb Kaya, Shirley Wu, Tengyu Ma, Tatsunori Hashimoto, Ludwig Schmidt

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究代码修复能力,提出生成器-修复器自博弈,通过强化学习训练单个模型生成并修复错误,引入BugSourceBench测试泛化性,发现问题后提出锚定自博弈,提高修复率。

Comments 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03381 2026-07-07 cs.DL cs.CL 新提交 57%

Large-scale dataset of automatically classified rhetorical sections in scientific papers

科学论文中自动分类修辞部分的大规模数据集

Daniel Verdi, Jacob Aarup Dalsgaard, Roberta Sinatra

机构 * Graduate School of Education, Stanford University(斯坦福大学教育研究生院) Center for Social Data Science (SODAS), University of Copenhagen(哥本哈根大学社会科学数据科学中心) Networks, Data, and Society (NERDS), IT University of Copenhagen(哥本哈根IT大学网络、数据与社会中心) Pioneer Centre for Artificial Intelligence (P1), Denmark(丹麦先锋人工智能中心) Complexity Science Hub, Austria(奥地利复杂科学中心)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究利用基于规则的分类算法,对语义学者开放研究语料库中的数百万篇科学论文进行质量筛选和标注,构建了一个数据集,可助力大规模科学话语和写作模式的计算研究。

Comments Data descriptor; includes supplementary information (1 PDF). 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03135 2026-07-07 cs.SE cs.AI 新提交 57%

Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis

通过运行时跟踪分析检测安全关键固件中的架构漂移

Domenico Francesco De Angelis, Marco De Luca, Domenico Amalfitano, Pasquale Cimmino, Anna Rita Fasolino

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Micron Technology, Inc(美光技术公司) DIETI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究在长寿命安全关键固件中检测架构漂移问题,核心方法是收集硬件辅助执行跟踪,经抽象比较找出差异,还基于大语言模型生成报告,贡献是经评估该方法有效。

Comments accepted at 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02956 2026-07-07 cs.CV cs.CL 新提交 57%

MORE: A Multilingual Document Parsing Benchmark and Evaluation

MORE:一个多语言文档解析基准和评估

Long Xu, Binghong Wu, Tinghao Yu, Hao Feng, Zhenyu Huang, Haoqing Jiang, Yunhao Wang, Shuo Huang, Feng Zhang

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对多语言文档解析,现有基准侧重高资源语言。为此引入MORE基准,其具规模大、结构复杂、数据真实的特点,用它评估模型,为长尾语言建性能基线并验证基准有效性。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 11 figures. Code and dataset available at https://github.com/zimoqingfeng/MORE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02569 2026-07-07 cs.CV cs.LG 新提交 57%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 57%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01751 2026-07-03 cs.CV cs.AI 新提交 57%

MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding

MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准

Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01517 2026-07-03 cs.CL 新提交 57%

Parameter Golf: What Really Works?

参数高尔夫:什么真正有效?

Prashanna Mani Paudel, Shivanand Venkanna Sheshappanavar

机构 * Geometric Intelligence Research Lab., Department of Electrical Engineering and Computer Science University of Wyoming(几何智能研究实验室,电气与计算机科学系,怀俄明大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 通过分析社区竞赛中的2037个拉取请求和1430个评分提交,构建84种优化技术分类,测量每种技术对bits-per-byte的贡献,发现大多数技术收益在竞争提交中缩小,仅少数方法能持续提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 57%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00159 2026-07-02 cs.CL cs.CV cs.IR cs.MM 新提交 57%

Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting

识别和解决基于知识的VQA基准测试中的陷阱:审计、修复与增强

Qian Ma, S M Rayeed, Charles V. Stewart, Qiong Wu, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文审计现有KB-VQA基准测试,发现答案缺失/矛盾、问题不明确和视觉场景简单等系统性问题,导致准确率指标误导模型排名;提出审计-修复协议和多重实体增强协议,重新评估后性能趋势显著变化。

Comments Accepted to ECCV 2026. The datasets and code are available in https://github.com/VAN-QIAN/ECCV26-ARA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30902 2026-07-01 q-bio.BM cs.CE cs.LG 新提交 57%

Structure-Regularized Interpretable TCR-Epitope Prediction

结构正则化的可解释TCR-表位预测

Jiarui Li, Zixiang Yin, Yunbei Zhang, Janet Wang, Samuel J. Landry, Zhengming Ding, Ramgopal R. Mettu

机构 * Department of Computer Science, Tulane University(杜兰大学计算机科学系) Department of Biochemistry and Molecular Biology, Tulane University School of Medicine(杜兰大学医学院生物化学与分子生物学系)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出TCR-SRIM模型,结合蛋白质语言模型嵌入与可解释接触原型,在TCR-XAI基准上实现最优预测性能和解释质量,并揭示生成结构对模型学习的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30686 2026-07-01 cs.RO cs.AI 新提交 57%

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

立场:视觉-语言-动作模型无法被验证执行物理推理

Taozhao Chen, Ian Manchester, Huaming Chen

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 57%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22678 2026-07-01 cs.SE cs.AI 新提交 57%

RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents

RigorBench: 自主AI编码代理中工程过程纪律的基准测试

Meher Bhaskar Madiraju, Meher Sai Preetam Madiraju

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出RigorBench基准,通过五个维度评估AI编码代理的过程纪律,实验表明结构化过程纪律使过程质量提升41%,结果正确性提升17%。

Comments 9 pages, 7 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27474 2026-06-29 cs.SE cs.AI 新提交 57%

Speculative Refinement: A Hybrid Autoregressive Diffusion Decoding Strategy and Its Behavior Across Benchmarks

推测性精炼:一种混合自回归扩散解码策略及其跨基准测试的行为

Aditi Gupta, Neel Mishra, Kushagra Trivedi, Pawan Kumar

机构 * IIIT Hyderabad

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出推测性精炼(SpecRef),一种无需训练的混合解码方法,通过熵引导选择性掩码从自回归草稿启动掩码扩散模型,并在六个基准上揭示代码基准的结构性混淆、精炼张力现象、似然与生成评估排名差异及后处理问题。

Comments 7 pages + 2 pages References

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27438 2026-06-29 cs.LG 新提交 57%

Unified Zero-Shot Time Series Forecasting: A Darts Foundation

统一零样本时间序列预测:Darts 基础模型

Zhihao Dai, Dennis Bader, Alain Gysi

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对基础模型接口碎片化问题,Darts 开发了统一 FoundationModel 类集合,提供标准化全周期预测接口,实现零样本或微调预测、不确定性估计和回测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24320 2026-06-29 cs.SD cs.AI 新提交 57%

ZONOS2 Technical Report

ZONOS2 技术报告

Gabriel Clark, Sofian Mejjoute, Mohamed Osman, George Close, Beren Millidge

机构 * Zyphra

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出ZONOS2 8B TTS模型,通过MoE架构、6M小时训练数据和简化后训练配方,在自然度、韵律和声音克隆保真度上达到最先进水平。

Comments 15 pages, 7 figures, 7 tables. Technical report. Model weights, inference code, and the ZTTS1-Eval benchmark released under Apache 2.0. Code: https://github.com/Zyphra/ZONOS2 ; weights: https://huggingface.co/Zyphra/ZONOS2 ; benchmark: https://github.com/Zyphra/ZTTS1-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27282 2026-06-26 cs.LG 新提交 57%

How Good Can Linear Models Be for Time-Series Forecasting?

线性模型在时间序列预测中能有多好?

Lang Huang, Jinglue Xu, Luke Darlow

机构 * Sakana AI, Tokyo, Japan(Sakana AI,日本东京) National Institute of Informatics, Japan(日本国立信息学研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 通过调整预处理(上下文长度、归一化、正则化、数据增强)而非扩大模型规模,Ridge回归在8个基准上超越Transformer、MLP和CNN,挑战了“更大容量带来更高精度”的假设。

Comments Project page: https://sakanaai.github.io/SearchCast/ 17 pages, 10 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27215 2026-06-26 cs.AI 新提交 57%

Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text

自然语言分类器对进化生成的对抗文本的脆弱性

Manjinder Singh, Alexander E. I. Brownlee, Mohamed Elawady

机构 * University of Stirling(斯特灵大学) University of Strathclyde(斯特拉斯克莱德大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GAversary混合遗传算法,仅利用模型logit输出作为黑盒,通过GloVe嵌入改进词替换的语义相似性,在多个基准数据集上显著降低目标模型准确率(最佳从76.8%降至5.8%),但扰动词数约为对比方法的两倍。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27187 2026-06-26 cs.CV cs.CL 新提交 57%

HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models

HarmVideoBench:大型多模态模型中有害视频理解的基准测试

Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochi Zhang, Leixin Sun, Eric Hanchen Jiang, Yushan Li, Ruiyu Li, Mengkai Huang, Yan Gao, Xu Zhang, Guancheng Wan

机构 * Central South University(中南大学) Tsinghua University(清华大学) South China Normal University(华南师范大学) ByteDance Inc(字节跳动公司) University of Zaragoza(阿拉维达大学) CosmosMind Wuhan University(武汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Southeast University(东南大学) Tencent(腾讯公司) Nankai University(南开大学) Supermicro Computer Inc(Supermicro计算机公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26923 2026-06-26 cs.CL 新提交 57%

GAVEL: Grounded Caption Error Verification and Localization

GAVEL:基于视觉定位的标题错误验证与定位

Zixian Gao, Atsushi Hashimoto, Kuniaki Saito

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出GAVEL任务,联合解决图像-文本对的验证、解释和定位问题,构建数据集和基准,监督基线在定位和解释指标上持续改进。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 57%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 57%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏