arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2607.20284 2026-07-23 cs.CV 新提交 50%

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

用于遥感图像理解的多模态大语言模型:领域特定还是通用?

Qiwei Ma, Chunping Qiu, Xinjun Cheng, Xiaoyu Zhang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) Yuelushan Center for Industrial Innovation(岳麓山工业创新中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文针对遥感图像理解的多模态大语言模型展开研究,通过系统调查和评估,比较其与通用模型在不同任务上的表现,发现当前模型存在局限,进而给出未来方向,为开发相关模型提供系统参考。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 50%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 50%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04802 2026-07-23 cs.CV 版本更新 50%

VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?

VISTA-Bench: 视觉-语言模型是否真的能像纯文本一样理解可视化文本?

Qing'an Liu, Juntong Feng, Yuhao Wang, Xinzhe Han, Yujie Cheng, Yue Zhu, Haiwen Diao, Yunzhi Zhuge, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 VISTA-Bench通过对比纯文本和可视化文本问题,揭示了视觉-语言模型在处理可视化文本时的模态差距,发现模型在语义相同的情况下表现显著下降。

Comments 32 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24739 2026-07-23 cs.CV 版本更新 50%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18716 2026-07-22 cs.CV 新提交 50%

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18244 2026-07-22 cs.NI cs.IT math.IT 新提交 50%

Accelerating Heterogeneous Agent Collaboration in Dynamic Edge Networks

加速动态边缘网络中的异构智能体协作

Tianji He, Yulin Shao, Fen Hou

专题命中 推理评测 :reasoning(abstract)

AI总结 研究在动态边缘网络中加速异构智能体协作的问题,提出PRADA框架,通过将PRM作为离线教师,结合轻量级策略和拉格朗日调度器解决资源竞争,大幅降低延迟并保留LLM准确性,还揭示阈值效应,为资源配置提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11899 2026-07-22 cs.CV 版本更新 50%

Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models

阅读还是忽略?视觉语言模型中排版攻击鲁棒性和文本识别的统一基准

Futa Waseda, Shojiro Yamabe, Daiki Shiono, Kento Sasaki, Tsubasa Takahashi

机构 * Turing Inc.(Turing公司) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) Tohoku University(东北大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究大型视觉语言模型排版攻击鲁棒性和文本识别问题,引入RIO-VQA任务及RIO-Bench基准,发现目标中心防御的权衡,提出数据驱动防御基线,提升模型在两方面的性能,凸显现有鲁棒性范围与现实需求的错位。

Comments Accepted at ECCV 2026. The project page is available at: https://turingmotors.github.io/rio-vqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17722 2026-07-21 cs.SE 新提交 50%

KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes

KernelDiag:基于代理的内核崩溃根本原因诊断

Weijing Wang, Zan Wang, Dong Wang, Haichi Wang, Junjie Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17353 2026-07-21 cs.CR 新提交 50%

Measuring and Evaluating the Performance of Generative AI Models for Scam Detection

测量和评估用于诈骗检测的生成式人工智能模型的性能

Cem Topcuoglu, Seyed Ali Akhavani, Harel Berger, Sadia Afroz, Michalis Pachilakis, Vibhor Sehgal, Leyla Bilge, Engin Kirda

专题命中 推理评测 :reasoning(abstract)

AI总结 研究大语言模型在无特定任务微调下检测诈骗的能力,通过策划发布独特基准数据集,评估九个不同模型,发现较大模型性能优,有效提示可提升小模型性能,且LLMs泛化能力强,还发布了数据集和评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 50%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13420 2026-07-21 cs.CV 版本更新 50%

VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task

VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象

Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。

Comments Accepted at ACM MM 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 50%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16105 2026-07-20 cs.CV cs.HC 新提交 50%

Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs

用于解释视觉语言模型中视觉素养的注意力引导显著图

Maeve Hutchinson, Abderrahmane Wassim Mehdaoui, Pranava Madhyastha

机构 * The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究视觉语言模型如何解释数据可视化这一问题,提出针对图像文本生成的轻量级诊断显著图方法,通过聚合注意力并映射到图像,生成快速无梯度显著图,用删除度量评估,揭示模型注意力分配情况。

Comments To be presented at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15738 2026-07-20 cs.CY 新提交 50%

EduGuard: A Safe RAG-Based LLM Tutor for Programming Education

EduGuard:一种用于编程教育的基于安全检索增强生成的语言模型导师

S M Asif Hossain, Ruksat Khan Shayoni, M. F. Mridha, Jungpil Shin

专题命中 推理评测 :verifier(abstract)

AI总结 研究针对学生使用GenAI进行编程学习时的问题,提出EduGuard安全RAG辅导框架,集成多种功能。通过构建基准测试并与强基线比较,在正确性、基础等方面表现最佳,能提升准确率并降低过度依赖,证明安全GenAI辅导需多方面保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15283 2026-07-20 cs.IR 新提交 50%

Adaptive Retrieval Strategies for Biomedical Question Answering

生物医学问答的自适应检索策略

Han Yue, Eric Zhou, Alex Hu, Xueshen Li, Yuan Zhang, Jinfeng Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究生物医学问答中不同问题类型的有效检索策略,提出自适应检索框架,依问题类型选检索和证据聚合策略,结合多种技术,经实验验证该策略能提升证据相关性和答案质量,为增强相关问答系统提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04020 2026-07-20 cs.CV 版本更新 50%

Paired Uterine Whole-Slide Images and Pathology Reports for Multimodal Computational Pathology

用于多模态计算病理学的配对子宫全切片图像和病理报告

Han Li, Jingsong Liu, Ayako Ura, Junlin Hou, Zhengyang Xu, Azar Kazemi, Oskar Thaeter, Christian Grashei, Fabian Gülhan, Reza Nasirigerdeh, Xun Ma, Rui Yan, Hao Chen, S. Kevin Zhou, Nassir Navab, Carolin Mogler, Peter Schüffler

机构 * Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理研究所) Computer Aided Medical Procedures (CAMP), Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序(CAMP)) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Human Pathology, Juntendo University Graduate School of Medicine(顺天堂大学医学研究生院人体病理学部) The Hong Kong University of Science and Technology(香港科技大学) Munich Data Science Institute (MDSI)(慕尼黑数据科学研究所)

专题命中 推理评测 :planning(abstract)

AI总结 研究子宫疾病病理诊断,针对全切片图像与病理报告配对数据集稀缺问题,引入TUM-Uteria数据集,含多对病例及切片级配对,经验证,为计算病理学研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20147 2026-07-20 cs.SE 版本更新 50%

Not All Tokens Matter: Data-Centric Optimization for Efficient Code Summarization

并非所有标记都重要:面向高效代码摘要的数据导向优化

Saima Afrin, Zaiyu Cheng, Tushar Sharma, Alexander Serebrenik, Massimiliano Di Penta, Antonio Mastropaolo

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨了系统提示对代码生成任务中ILMs和CLMs性能的影响,发现模型规模越大影响越显著,少样本提示效果优于零样本提示,且Java对提示变化更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23213 2026-07-20 cs.SE 版本更新 50%

GAPS: Targeted Execution of Android Apps via Static Path Reconstruction

GAPS:通过静态路径重构实现安卓应用的定向执行

Samuele Doria, Alexander Pilgun, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 推理评测 :reasoning(abstract)

AI总结 研究安卓应用定向执行难题,提出GAPS方法,结合静态程序分析与动态GUI探索,通过反向遍历调用图和数据流推理识别路径并转化为策略,在基准测试和热门应用评估中表现出色,有效且可扩展地解决了定向方法执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12620 2026-07-20 cs.SE cs.PL 版本更新 50%

Improving Code Understanding in Large Language Models through Concept-Aware Consistency Learning

通过概念感知一致性学习提高大语言模型中的代码理解能力

Xiaoning Ren, Qiang Hu, Wei Ma, Chongyang Liu, Yan Li, Yao Zhang, Lingxiao Jiang, Yongqiang Lyu, Yinxing Xue

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对大语言模型对基本编程概念理解浅的问题,引入结合概念感知调整的反事实代码增强框架,经多模型和基准综合评估,证明此方法能引导大语言模型增强概念理解,有效提升其在代码相关任务中的表现。

Comments To appear at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14684 2026-07-17 cs.CV 新提交 50%

GlobalForge: Towards Robust AI-Generated Image Detection

GlobalForge:迈向强大的人工智能生成图像检测

Manni Cui, Ruiqi Liu, Dianyuan Zou, Ziheng Qin, Jingrui Xu, ZiAn Wang, Jianglan Wei, Han Zhou, Yu Liu, Yan Wang, Shu Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Jilin University(吉林大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对AI生成图像检测器在现实世界通道传播后性能下降问题,提出GlobalForge框架,通过局部信息瓶颈和全局结构推理模块,基于退化对比结构损失联合训练,提升了检测器在多种基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 50%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 50%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 推理评测 :reasoning(abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12254 2026-07-17 cs.CV 版本更新 50%

Self-Aware Recursively Self-Improving Agents for Personal Singularity: A Goal-, Scope-, Tool-, and Benchmark-Driven Multi-Agent Architecture

如何实现递归式自我提升智能体与个人奇点:一种目标、范围、工具和基准驱动的多智能体架构

Chengshuai Yang

机构 * NextGen PlatformAI C Corp.(下一代平台人工智能C公司)

专题命中 推理评测 :verifier(abstract)

AI总结 研究大型语言模型智能体进步引发的问题,提出受治理多智能体架构实现递归式自我提升,以个人奇点为目标,详细介绍智能体各要素及架构组成,形式化多种机制并提供设计与路线图。

Comments 28 pages, 5 figures, 7 tables, and 5 algorithms. Position and systems-design paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10767 2026-07-16 cs.SE 版本更新 50%

VulWeaver: Weaving Broken Semantics for Grounded Vulnerability Detection

VulWeaver: 修补断裂语义以实现基于事实的漏洞检测

Yiheng Cao, Yihao Chen, Xin Hu, Bihuan Chen, Jiayi Deng, Zhuotong Zhou, Susheng Wu, Yiheng Huang, Xueying Du, Xingman Chen, Miaohua Li, Xin Peng

专题命中 推理评测 :reasoning(abstract)

AI总结 VulWeaver通过整合确定性规则与LLM语义推理构建增强依赖图,提取完整漏洞上下文,利用元提示和专家指南提升LLM推理能力,实验显示其在PrimeVul4J数据集上F1得分达0.75,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22830 2026-07-16 cs.CV cs.RO 版本更新 50%

A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

大型视觉-语言模型在SOTIF条件下2D目标检测的比较评估

Ji Zhou, Yilin Ding, Yongqi Zhao, Jiachen Xu, Dong Bi, Johannes Betz, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(汽车工程研究所,格拉茨技术大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文评估了大型视觉-语言模型在SOTIF条件下2D目标检测的性能,发现其在复杂场景中召回率显著优于传统方法,但几何精度仍有一定优势。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12467 2026-07-15 cs.SE 新提交 50%

Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization

命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测

Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng

专题命中 推理评测 :chain-of-thought(abstract)

AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12125 2026-07-15 cs.HC 新提交 50%

Faster AI, Uneven Frontier: Rapid Crossings, a Jagged Frontier, and the Repositioning of Human Judgment

更快的人工智能,参差不齐的前沿:快速跨越、锯齿状前沿与人类判断力的重新定位

Ancuta Margondai, Julie Rader, Emma Rader, Sara Willox, Mustapha Mouloua

专题命中 推理评测 :reasoning(abstract)

AI总结 研究人工智能在认知任务上快速跨越人类基线但前沿参差不齐的现象,指出人类在一些方面仍具优势,基准结果有偏差,人类将系统用作认知扩展,人机协作需重新定位人类角色,阐述了相应状况及意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17253 2026-07-15 cs.AR 版本更新 50%

PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM/VLM Agents for VLSI Physical Design

PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化

Qiufeng Li, Rongqian Chen, Quan Cheng, Chengxuan Wang, Sizhe Tang, Chia-Tung Ho, David Z. Pan, Tian Lan, Weidong Cao

专题命中 推理评测 :reasoning(abstract)

AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10385 2026-07-15 cs.CV 版本更新 50%

GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

GTASA:用于视频模型空间时间分析、评估和训练的地面真实标注

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GTASA,一种包含多主体视频的标注数据集,通过空间关系图和事件级时间映射,验证了其在视频模型训练和评估中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏