arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-02 至 2025-12-02 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 31 篇

2510.27378 2025-12-02 cs.LG cs.AI cs.CL 87%

Measuring Chain-of-Thought Monitorability Through Faithfulness and Verbosity

通过忠实性与详尽性衡量推理链的可监控性

Austin Meek, Eitan Sprejer, Iván Arcuschin, Austin J. Brockmeier, Steven Basart

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,comments);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过结合忠实性与详尽性提出新的可监控性评分,评估模型推理链的透明度和可监控性,发现不同模型家族的可监控性差异显著。

Comments Project page at https://ajmeek.github.io/cot_monitorability_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 87%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 推理评测 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01725 2025-12-02 cs.CL 85%

Beware of Reasoning Overconfidence: Pitfalls in the Reasoning Process for Multi-solution Tasks

警惕推理过度自信:多解任务中推理过程的陷阱

Jiannan Guan, Qiguang Chen, Libo Qin, Dengyun Peng, Jinhao Liu, Liangyu Huo, Jian Xie, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学) Du Xiaoman (Beijing) Science Technology Co., Ltd.(杜小蔓(北京)科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文指出LLMs在多解任务中存在推理过度自信问题,通过引入MuSoBench基准测试发现Short-CoT方法存在过度自信,而Long-CoT方法通过迭代探索缓解此问题,并提出认知刚性假说解释其成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02429 2025-12-02 cs.AI cs.CL 84%

IoT-LLM: a framework for enhancing Large Language Model reasoning from real-world sensor data

IoT-LLM: 一个增强大语言模型现实世界传感器数据推理能力的框架

Tuo An, Yunjiao Zhou, Han Zou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(MARS实验室,机械与航空航天工程学院,南洋理工大学,新加坡) School of Mechanical and Aerospace Engineering, Nanyang Technological University, Singapore(机械与航空航天工程学院,南洋理工大学,新加坡)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 IoT-LLM通过整合物联网数据与常识知识,提升大语言模型在现实世界传感任务中的推理能力。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01274 2025-12-02 cs.CL cs.AI cs.LG 82%

SUPERChem: A Multimodal Reasoning Benchmark in Chemistry

SUPERChem:化学领域的多模态推理基准

Zehua Zhao, Zhixian Huang, Junren Li, Siyu Lin, Junting Zhou, Fengqi Cao, Kun Zhou, Rui Ge, Tingting Long, Yuexiang Zhu, Yan Liu, Jie Zheng, Junnian Wei, Rong Zhu, Peng Zou, Wenyu Li, Zekai Cheng, Tian Ding, Yaxuan Wang, Yizhao Yan, Tingru Wei, Haowei Ming, Weijie Mao, Chen Sun, Yiming Liu, Zichen Wang, Zuo Zhang, Tong Yang, Hao Ma, Zhen Gao, Jian Pei

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SUPERChem通过多模态推理基准测试,评估LLMs在化学领域的能力,揭示模型对视觉信息的依赖,并区分高保真推理与启发式推理。

Comments 35 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01992 2025-12-02 cs.AI cs.CL 81%

LLM CHESS: Benchmarking Reasoning and Instruction-Following in LLMs through Chess

LLM CHESS: 通过国际象棋评估大语言模型的推理与指令遵循能力

Sai Kolasani, Maxim Saplin, Nicholas Crispino, Kyle Montgomery, Jared Quincy Davis, Matei Zaharia, Chi Wang, Chenguang Wang

机构 * UC Berkeley(加州大学伯克利分校) Independent Researcher(独立研究者) UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LLM CHESS通过国际象棋评估大语言模型的推理与指令遵循能力,揭示了推理模型与非推理模型的显著差异,并提供了评估框架和公开排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV 81%

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15209 2025-12-02 cs.CV cs.AI cs.LG 81%

PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation

PRIMA:多图像视觉-语言模型用于推理分割

Muntasir Wahed, Kiet A. Nguyen, Adheesh Sunil Juvekar, Xinzhuo Li, Xiaona Zhou, Vedant Shah, Tianjiao Yu, Pinar Yanardag, Ismini Lourentzou

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 PRIMA通过整合像素级定位与多图像推理,提升了多图像分割任务的性能,其在Recall和S-IoU上分别优于现有基线7.83%和11.25%。

Comments Project page: https://plan-lab.github.io/prima

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00881 2025-12-02 cs.AI 79%

Hybrid-DMKG: A Hybrid Reasoning Framework over Dynamic Multimodal Knowledge Graphs for Multimodal Multihop QA with Knowledge Editing

Hybrid-DMKG: 一种基于动态多模态知识图谱的混合推理框架用于多模态多跳问答与知识编辑

Li Yuan, Qingfei Huang, Bingshan Zhu, Yi Cai, Qingbao Huang, Changmeng Zheng, Zikun Deng, Tao Wang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 Hybrid-DMKG通过动态多模态知识图谱实现多跳问答中的准确推理,提升对知识更新的鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12263 2025-12-02 cs.CV cs.AI 79%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11278 2025-12-02 cs.HC cs.AI cs.SE 79%

Is General-Purpose AI Reasoning Sensitive to Data-Induced Cognitive Biases? Dynamic Benchmarking on Typical Software Engineering Dilemmas

通用人工智能推理是否受数据诱导的认知偏差影响?典型软件工程困境中的动态基准测试

Francesco Sovrano, Gabriele Dominici, Rita Sevastjanova, Alessandra Stramiglio, Alberto Bacchelli

机构 * Collegium Helveticum, ETH Zurich(瑞士苏黎世联邦理工学院) University of Zurich(苏黎世大学) University of Italian-speaking Switzerland(意大利语瑞士大学) ETH Zurich(苏黎世联邦理工学院) University of Bologna(博洛尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过动态基准测试框架评估GPAI在软件工程中对数据诱导认知偏差的敏感性,发现GPAI系统在面对偏见诱导语言线索时易产生错误推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00215 2025-12-02 cs.SE 78%

Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation

解析LLM推理轨迹中的错误:对代码执行模拟的实证研究

Mohammad Abdollahi, Khandaker Rifah Tasnia, Soumit Kanti Saha, Jinqiu Yang, Song Wang, Hadi Hemmati

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01010 2025-12-02 cs.MA cs.AI cs.LG cs.SE physics.comp-ph physics.flu-dyn 73%

Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis

单元物理链:一种以基础原理为中心的科学代码合成方法

Vansh Sharma, Venkat Raman

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出单元物理链框架,通过以基础原理为中心的多代理系统,有效解决科学代码生成中的可靠性问题,实现高精度和高效能的代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17220 2025-12-02 cs.CL cs.AI cs.CE cs.LG 67%

PARROT: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs

PARROT:输出真实性的说服与同意鲁棒性评级——面向大语言模型的共情鲁棒性基准

Yusuf Çelebi, Özay Ezerceli, Mahmoud El Hussieni

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PARROT提出了一种评估大语言模型在权威压力下鲁棒性的基准,发现先进模型表现稳健,而旧模型易出现知识崩溃,强调需将抗过度拟合压力作为安全部署的关键目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01852 2025-12-02 cs.CL cs.AI cs.ET 62%

BHRAM-IL: A Benchmark for Hallucination Recognition and Assessment in Multiple Indian Languages

BHRAM-IL:多印度语言中的幻觉识别与评估基准

Hrishikesh Terdalkar, Kirtan Bhojani, Aryan Dongare, Omm Aditya Behera

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BHRAM-IL是一个用于多印度语言中幻觉识别与评估的基准,通过评估14种多语言LLM在多个任务上的表现,揭示了幻觉检测的跨语言和事实性问题。

Comments Accepted at BHASHA Workshop @ IJCNLP/AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01507 2025-12-02 cs.AI cs.LG 62%

SynthStrategy: Extracting and Formalizing Latent Strategic Insights from LLMs in Organic Chemistry

SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察

Daniel Armstrong, Zlatko Jončev, Andres M Bran, Philippe Schwaller

机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00586 2025-12-02 cs.LG cs.CL q-bio.QM 62%

Statistical NLP for Optimization of Clinical Trial Success Prediction in Pharmaceutical R&D

统计自然语言处理用于药理研发中临床试验成功预测的优化

Michael R. Doane

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文利用统计自然语言处理技术开发了基于BioBERT的模型,以优化神经科学领域临床试验成功预测,提升研发决策效率。

Comments Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16671 2025-12-02 cs.CL cs.AI cs.CV 62%

MimeQA: Towards Socially-Intelligent Nonverbal Foundation Models

MimeQA: 向具有社会智能的非语言基础模型迈进

Hengzhi Li, Megan Tjandrasuwita, Yi R. Fung, Armando Solar-Lezama, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MimeQA通过引入非语言互动数据集,评估视频大语言模型在非语言社会推理中的表现,发现其准确率较低,人类表现更优。

Comments NeurIPS 2025 Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00290 2025-12-02 cs.CL cs.AI 62%

EduEval: A Hierarchical Cognitive Benchmark for Evaluating Large Language Models in Chinese Education

EduEval: 一个用于评估大语言模型在中文教育中表现的分层认知基准

Guoqing Ma, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Jiawei Shen, Zilong Li, Yidan Liang

机构 * Zhejiang Normal University(浙江师范大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EduEval通过分层认知基准评估大语言模型在中文教育中的表现,揭示其在事实性任务与创造性任务上的差异,并发现开源模型在复杂教育推理上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00042 2025-12-02 cs.CV cs.AI cs.CL cs.CY 62%

Closing the Gap: Data-Centric Fine-Tuning of Vision Language Models for the Standardized Exam Questions

弥合差距:面向标准化考试题目的视觉语言模型数据驱动微调

Egemen Sert, Şeyda Ertekin

机构 * organization= Department of Computer Engineering, Middle East Technical University (METU) , city= Ankara , country= Türkiye organization= METU-DTX Digital Transformation \& Innovation Centre, METU , city= Ankara , country= Türkiye

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过高质量数据和优化语法提升视觉语言模型在标准化考试题目的多模态推理性能,达到接近SOTA的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00039 2025-12-02 cs.NI cs.AI cs.CL 62%

LM4Opt-RA: A Multi-Candidate LLM Framework with Structured Ranking for Automating Network Resource Allocation

LM4Opt-RA: 一种带有结构化排序的多候选LLM框架,用于自动化网络资源分配

Tasnim Ahmed, Siana Rizwan, Naveed Ejaz, Salimur Choudhury

机构 * School of Computing(计算机学院) Queen’s University(女王大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LM4Opt-RA通过结构化排序机制和多种提示策略,提升网络资源分配优化的LLM性能,实现优于基线模型的数学评估成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01558 2025-12-02 cs.LG cs.CL 62%

Predicting the Performance of Black-box LLMs through Follow-up Queries

通过后续查询预测黑盒大语言模型的性能

Dylan Sam, Marc Finzi, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过后续查询预测黑盒大语言模型性能,利用响应概率训练可靠预测器,有效区分模型正确性及对抗性影响。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01255 2025-12-02 cs.CR cs.CL cs.SE 57%

Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation

大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估

Qingyuan Fei, Xin Liu, Song Li, Shujiang Wu, Jianwei Hou, Ping Chen, Zifeng Kang

机构 * Lanzhou University(兰州大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) Fudan University(复旦大学) Beijing University of Posts(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01232 2025-12-02 cs.SE cs.AI 57%

LLM-as-a-Judge for Scalable Test Coverage Evaluation: Accuracy, Operational Reliability, and Cost

基于LLM的判别器用于可扩展的测试覆盖率评估:准确性、操作可靠性与成本

Donghao Huang, Shila Chew, Anna Dutkiewicz, Zhaoxia Wang

机构 * School of Computing and Information Systems(计算与信息系统学院) Singapore Management University(新加坡管理大学) Research and Development(研发)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LLM-as-a-Judge通过低成本高可靠性的测试覆盖率评估方法,显著降低评估成本并提升准确性。

Comments 7 pages, accepted by the AAAI 2026 Workshop on Next Gen Code Development with Collaborative AI Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01191 2025-12-02 cs.CL 57%

Generalist Large Language Models Outperform Clinical Tools on Medical Benchmarks

通用大语言模型在医疗基准测试中优于临床工具

Krithik Vishwanath, Mrigayu Ghosh, Anton Alyakin, Daniel Alexander Alber, Yindalon Aphinyanaphongs, Eric Karl Oermann

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通用大语言模型在医疗基准测试中表现优于临床工具,揭示了临床AI系统在某些关键能力上的不足。

Comments 17 pages, 4 figures (2 regular, 2 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00630 2025-12-02 cs.LG q-fin.CP 57%

Financial Text Classification Based On rLoRA Finetuning On Qwen3-8B model

基于Qwen3-8B模型的金融文本分类研究:rLoRA微调

Zhiming Lian

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于rLoRA微调的Qwen3-8B模型,用于金融文本分类,展示了其在准确率和训练效率上的优势。

Comments This paper has been accepted to the 2025 2nd International Conference on Digital Economy and Computer Science (DECS 2025) and is awaiting publication in the ACM International Conference Proceeding Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00231 2025-12-02 cs.SE cs.AI 57%

CodeFlowLM: Incremental Just-In-Time Defect Prediction with Pretrained Language Models and Exploratory Insights into Defect Localization

CodeFlowLM:基于预训练语言模型的增量即需缺陷预测与缺陷定位的探索性洞察

Monique Louise Monteiro, George G. Cabral, Adriano L. I. OLiveira

机构 * cin.ufpe.br(佛罗里达大学佩德罗斯分校计算机学院) Recife-PE – Brazil(巴西佩德罗斯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CodeFlowLM通过增量学习提升即时软件缺陷预测性能,同时探索LLMs在缺陷定位中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 50%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV 50%

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 50%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 推理评测 :reasoning(abstract)

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏