arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5878 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5878 篇

2605.01329 2026-05-05 cs.AI cs.CY 57%

Truth or Tribe: How In-group Favoritism Prioritize Facts in Persona Agents

真实还是部落:群体偏好如何优先事实于拟人代理

Shijun Lei, Hongyu Wang, Yunji Liang, Haowen Zheng, Bin Guo, Zhiwen Yu

机构 * Northwestern Polytechnical University(西北工业大学) Central University of Finance and Economics(中央财经大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了群体偏好在面对矛盾信息时对拟人代理的影响,提出Triadic交互框架和三种干预策略以缓解群体偏见。

Comments 21 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16323 2026-05-05 cs.SE cs.AI 57%

Beyond the 'Diff': Addressing Agentic Entropy in Agentic Software Development

超越'差异':应对代理软件开发中的代理熵

Matteo Casserini, Alessandro Facchini, Andrea Ferrario

机构 * Dipartimento Tecnologie Innovative, SUPSI(技术创新部,SUPSI) Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理(MINDS)系,科津斯基大学) Institute of Biomedical Ethics and History of Medicine, University of Zurich(生物医学伦理与医学史研究所,苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种过程导向的可解释框架,通过时间、工具调用和架构边界揭示代理决策过程,解决代理行为与架构意图的偏离问题,为代理监控提供意图层面的 telemetry。

Comments Camera-ready version of the position paper accepted to the Human-Centered Explainable AI (HCXAI) Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05254 2026-05-05 cs.IR cs.CL 57%

TagRAG: Tag-guided Hierarchical Knowledge Graph Retrieval-Augmented Generation

TagRAG:基于标签的分层知识图谱检索增强生成

Wenbiao Tao, Xinyuan Li, Yunshi Lan, Weining Qian

机构 * East China Normal University(东华师范大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 TagRAG通过构建标签知识图谱和标签引导的检索生成框架,提升小语言模型的全局推理能力和知识增量效率,实验显示其在多个领域数据集上表现优异。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16767 2026-05-04 cs.LG 57%

When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected

结构无助时:LLM在文本属性图上表现不如我们预期

Haotian Xu, Yuning You, Tengfei Ma

机构 * Stony Brook University(石溪大学) California Institute of Technology(加州理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究发现,LLM在仅依赖节点文本描述时已能高效处理文本属性图,而多数结构编码策略效果有限,挑战了传统图学习范式,推动语义驱动的新方法。

Comments LoG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03724 2026-05-04 cs.AI cs.MA 57%

Outbidding and Outbluffing Elite Humans: Mastering Liar's Poker via Self-Play and Reinforcement Learning

超越精英人类:通过自我对战与强化学习掌握骗子扑克

Richard Dewey, Janos Botyanszki, Ciamac C. Moallemi, Andrew T. Zheng

机构 * Allometry Labs(Allometry实验室) Graduate School of Business, Columbia University(哥伦比亚大学商学院) Sauder School of Business, University of British Columbia(不列颠哥伦比亚大学萨德尔商学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Solly,首个在简化版骗子扑克中达到精英人类水平的AI,通过自我对战与深度强化学习实现超越人类和大语言模型的策略与表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28147 2026-05-01 cs.CL 57%

On the Proper Treatment of Units in Surprisal Theory

关于在惊奇理论中正确处理单位的探讨

Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在惊奇理论中正确处理语言单位的重要性,提出应明确区分单位定义与预测区域选择,并统一框架处理任意单位库。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27929 2026-05-01 cs.CL 57%

DPN-LE: Dual Personality Neuron Localization and Editing for Large Language Models

DPN-LE: 大语言模型双人格神经元定位与编辑

Lifan Zheng, Xue Yang, Jiawei Chen, Chenyan Wu, Jingyuan Zhang, Fanheng Kong, Xinyi Zeng, Xiang Chen, Yu Tian

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Zhejiang University of Technology(浙江工业大学) Kuaishou Technology(快手科技) Northeastern University(东北大学) Tsinghua University(清华大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DPN-LE方法,通过对比高特质与低特质样本的MLP激活,定位并编辑双人格神经元,实现精准的人格控制与能力保留。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 57%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27264 2026-05-01 cs.SE cs.AI 57%

Self-Evolving Software Agents

自演化软件代理

Marco Robol, Paolo Giorgini

机构 * University of Trento(特伦托大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出自演化软件代理,结合BDI推理与大语言模型,使代理能自主进化目标、推理和可执行代码。实验显示代理可自主发现新目标并生成行为,验证了LLM驱动进化的可行性与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27092 2026-05-01 cs.AI physics.optics 57%

End-to-end autonomous scientific discovery on a real optical platform

端到端自主科学发现于真实光学平台

Shuxing Yang, Fujia Chen, Rui Zhao, Junyao Wu, Yize Wang, Haiyao Luo, Ning Han, Qiaolu Chen, Yuze Hu, Wenhao Li, Mingzhu Li, Hongsheng Chen, Yihao Yang

机构 * State Key Laboratory of Extreme Photonics and Instrumentation, College of Information Science and Electronic Engineering, ZJU-Hangzhou Global Scientific and Technological Innovation Center, The Electromagnetics Academy at Zhejiang University, Zhejiang University(极端光子学与仪器国家重点实验室,信息科学与电子工程学院,浙大杭州国际科学技术创新中心,浙江大学电磁学学院,浙江大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Qiushi Discovery Engine,通过非线性研究阶段、Meta-Trace记忆和双层架构,在真实光学平台实现端到端自主科学发现,首次实验验证了非平凡物理机制。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26378 2026-04-30 cs.LG 57%

CoQuant: Joint Weight-Activation Subspace Projection for Mixed-Precision LLMs

CoQuant:混合精度LLM的联合权重-激活子空间投影

Zhe Ding, Su Pan, Duowei Pan

机构 * School of Internet of Things, Nanjing University of Posts and Telecommunications(南京邮电大学物联网学院) Amazon AGI(亚马逊人工智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 CoQuant通过联合建模权重和激活的子空间,提升混合精度LLM的量化效果,在WikiText perplexity和零样本常识推理准确率上优于现有方法。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26091 2026-04-30 cs.AI cs.CE cs.MA 57%

Operating-Layer Controls for Onchain Language-Model Agents Under Real Capital

链上语言模型代理在真实资本下的操作层控制

T. J. Barton, Chris Constantakis, Patti Hauseman, Annie Mous, Alaska Hoffman, Brian Bergeron, Hunter Goodreau

机构 * DX Research Group(DX研究组)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究链上语言模型代理在真实资本下的可靠性,通过操作层控制提升资本管理效能,展示从用户指令到结算的全流程评估重要性。

Comments 18 pages, 6 figures. Public onchain dashboard and supporting documentation linked in paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18239 2026-04-30 cs.CY cs.AI 57%

Can LLMs Help Allocate Public Health Resources? A Case Study on Childhood Lead Testing

大语言模型能否帮助分配公共卫生资源?一项关于儿童铅检测的案例研究

Mohamed Afane, Ying Wang, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, Stevens Institute of Technology(史蒂文斯理工学院系统工程系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究大语言模型在分配公共卫生资源中的有效性,通过芝加哥、纽约和华盛顿特区136个社区的案例,发现LLM在处理铅暴露高风险区域时存在显著局限性。

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23829 2026-04-29 cs.AI 57%

Domain-Filtered Knowledge Graphs from Sparse Autoencoder Features

从稀疏自编码器特征中提取领域过滤的知识图谱

John Winnicki, Abeynaya Gnanasekaran, Eric Darve

机构 * Institute for Computational and Mathematical Engineering, Stanford University(计算与数学工程研究所,斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过对比激活和多阶段过滤构建领域特定概念集,并构建共现图和转换机制图,将稀疏自编码器特征转化为可读的知识图谱,揭示模型知识结构和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25259 2026-04-29 cs.LG 57%

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

DGLight:基于DQN的GRPO对大语言模型进行交通信号控制的微调

Chenbo Yu

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DGLight框架,通过预训练大语言模型适应交通信号控制,采用CoLight深度Q网络估计交通状态的动作价值,并利用GRPO优化策略,实现可解释的信号决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25011 2026-04-29 cs.CL 57%

Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models

为什么强化学习能够泛化?对大语言模型后训练的特征层面机制研究

Dan Shi, Zhuowen Han, Simon Ostermann, Renren Jin, Josef van Genabith, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland University(萨尔兰大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过对比强化学习与监督微调在大语言模型中的表现,揭示其泛化机制,发现强化学习通过持续演变的特征保持基模型表示,而监督微调引入稳定但专用的特征。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24881 2026-04-29 cs.AI 57%

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

潜在代理:一种事后训练过程用于内部化多代理辩论

John Seon Keun Yi, Aaron Mueller, Dokyun Lee

机构 * Boston University(波士顿大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种两阶段微调流程,将多代理辩论转化为单个LLM,通过动态奖励调度和长度截断实现内部化,减少93%的token使用,同时通过激活引导发现代理特定子空间,并展示通过内部化辩论抑制恶意代理的应用。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 57%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19699 2026-04-29 cs.CL cs.CY 57%

Epistemic orientation in parliamentary discourse is associated with deliberative democracy

议会话语中的认知倾向与 deliberative democracy 的关联

Segun Aroyehun, Stephan Lewandowsky, David Garcia

机构 * Department of Politics and Public Administration, University of Konstanz(康斯坦茨大学政治与公共行政系) School of Psychological Science, University of Bristol(布里斯托大学心理学科学学院) Complexity Science Hub(复杂性科学中心) Department of Psychology, University of Potsdam(波茨坦大学心理学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究通过EMI评分分析议会话语中的认知倾向,发现其与democratic deliberation和治理质量正相关,揭示政治话语的认知特性对民主和治理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15473 2026-04-29 cs.AI 57%

Agent Lifecycle Toolkit (ALTK): Reusable Middleware Components for Robust AI Agents

智能体生命周期工具包(ALTK):用于鲁棒AI智能体的可重用中间件组件

Zidane Wright, Jason Tsay, Anupama Murthi, Osher Elhadad, Diego Del Rio, Saurabh Goyal, Kiran Kate, Jim Laredo, Koren Lazar, Vinod Muthusamy, Yara Rizk

机构 * IBM Research(IBM研究院) IBM

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 ALTK通过模块化中间件组件系统性解决智能体全生命周期中的故障模式问题,提供一致接口并兼容低代码工具,显著降低构建可靠生产级智能体的难度。

Comments to appear in CAIS 2026 demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08816 2026-04-29 cs.IR cs.AI 57%

MemRec: Collaborative Memory-Augmented Agentic Recommender System

MemRec:协同记忆增强的代理推荐系统

Weixin Chen, Yuhan Zhao, Jingyuan Huang, Zihe Ye, Clark Mingxuan Ju, Tong Zhao, Neil Shah, Li Chen, Yongfeng Zhang

机构 * Hong Kong Baptist University(香港 Baptist大学) Rutgers University(罗格斯大学) Snap Inc.(Snap公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 MemRec通过引入协同记忆机制,解决传统推荐系统中记忆隔离导致的上下文过载问题,通过轻量级语言模型管理动态记忆图谱,提升推荐精度与效率。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16558 2026-04-29 cs.CR cs.AI 57%

A First Look at the Security Issues in the Model Context Protocol Ecosystem

对模型上下文协议生态系统安全问题的首次观察

Xiaofan Li, Xing Gao

机构 * University of Delaware, USA(德克萨斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文首次研究了模型上下文协议生态系统中的跨实体安全问题,揭示了注册表层面的漏洞和代码层面的攻击风险,提出了MCPInspect工具检测漏洞和可疑元数据。

Comments This paper has been accepted to DSN 2026. The title has been updated from the anonymous submission version used during double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24002 2026-04-28 cs.HC cs.AI cs.MM 57%

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

IntentVLM: 通过视频语言模型的前-后向建模实现开放词汇意图识别

Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

机构 * Institute of Intelligent Systems and Robotics (ISIR)(智能系统与机器人研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IntentVLM框架,通过前-后向建模提升多模态环境下的人意图识别效果,实验表明其在IntentQA和Inst-IT Bench数据集上达到80%准确率,超越基线30%,接近人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29957 2026-04-28 cs.SE cs.LG 57%

Think Anywhere in Code Generation

在代码生成中任意思考

Xue Jiang, Tianyu Zhang, Ge Li, Mengyang Liu, Taozhi Chen, Zhenhua Xu, Binhua Li, Wenpin Jiao, Zhi Jin, Yongbin Li, Yihong Dong

机构 * School of Computer Science, Peking University(1 计算机科学系,北京大学) Tongyi Lab, Alibaba Group(2 龙洋实验室,阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Think-Anywhere机制,使LLM在代码生成过程中可按需调用推理,通过冷启动训练和基于结果的强化学习奖励,实现适应性推理,提升代码生成性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15846 2026-04-28 cs.CL 57%

Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs

基于门控树交叉注意力的检查点兼容语法注入解码器-only LLMs

Xinyu Gao, Shaonan Wang, Nai Ding

机构 * College of Biomedical Engineering & Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种检查点兼容的门控树交叉注意力机制,用于在解码器-only LLMs中注入语法结构,提升语法鲁棒性而不影响问答和常识推理性能。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10362 2026-04-28 cs.CV cs.AI 57%

Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models

视觉漏斗:缓解多模态大语言模型中的上下文盲区

Woojun Jung, Jaehoon Go, Mingyu Jeon, Sunjae Yoon, Junyeong Kim

机构 * Department of AI, Chung-Ang University(Chung-Ang 大学人工智能系)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出视觉漏斗方法,通过上下文锚定和熵缩放投资组合缓解多模态大语言模型中的上下文盲区问题,通过动态调整裁剪尺寸和中心点,提升视觉细节与全局上下文的关联性。

Comments Accepted to CVPR 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08686 2026-04-28 cs.IR cs.AI 57%

MVIGER: Multi-View Variational Integration of Complementary Knowledge for Generative Recommender

MVIGER:多视图变分整合互补知识的生成推荐系统

Tongyoung Kim, Soojin Yoon, SeongKu Kang, Jinyoung Yeo, Dongha Lee

机构 * Yonsei University(延世大学) Korea University(韩国大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MVIGER框架,通过统一变分方法整合互补知识,解决不同提示模板和物品索引导致的输出不一致问题,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23446 2026-04-28 cs.AI 57%

IndustryAssetEQA: A Neurosymbolic Operational Intelligence System for Embodied Question Answering in Industrial Asset Maintenance

IndustryAssetEQA: 一种用于工业资产维护中具身体验问答的神经符号操作智能系统

Chathurangi Shyalika, Dhaval Patel, Amit Sheth

机构 * Artificial Intelligence Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) University of South Carolina(南卡罗来纳大学) IBM Yorktown(IBM约克镇分公司) Indian AI Research Organization(印度人工智能研究组织)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IndustryAssetEQA系统,结合事件 telemetry 表示与FMEA-KG知识图谱,提升工业资产问答的结构有效性、反事实准确性及解释蕴含性,减少专家评估的过度声称。

Comments 20 pages, 4 figures, 4 tables, Accepted for the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026) Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23413 2026-04-28 cs.CL 57%

Beyond Local vs. External: A Game-Theoretic Framework for Trustworthy Knowledge Acquisition

超越局部与外部:一种博弈论框架用于可信知识获取

Rujing Yao, Yufei Shi, Yang Wu, Ang Li, Zhuoren Jiang, XiaoFeng Wang, Haixu Tang, Xiaozhong Liu

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) Worcester Polytechnic Institute(沃斯通理工学院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Indiana University Bloomington(印第安纳大学布利克学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GTKA框架,通过博弈论平衡知识效用与隐私,设计隐私感知子查询生成器、对抗重建攻击者和可信本地整合器,减少敏感意图泄露并保持高答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23407 2026-04-28 cs.CV cs.AI 57%

PushupBench: Your VLM is not good at counting pushups

PushupBench: 你的VLM在计数俯卧撑时并不出色

Shengzhi Li, Jiarun Chen, Karun Sharma, Jiaqi Su, Shichao Pei

机构 * Shengzhi Li(李盛之) Jiarun Chen(陈佳润) Karun Sharma(Sharma 卡鲁恩) Jiaqi Su(苏佳琦) Shichao Pei(裴世超)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 PushupBench通过446个长视频片段评估重复计数任务,发现最佳模型准确率仅42.1%,开源模型表现更差,表明计数能力反映更广泛的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏