arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2011.02403 2020-11-05 cs.AI cs.LG cs.RO 62%

IDE-Net: Interactive Driving Event and Pattern Extraction from Human Data

Xiaosong Jia, Liting Sun, Masayoshi Tomizuka, Wei Zhan

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.09788 2020-10-21 cs.AI cs.CL 62%

Deriving Commonsense Inference Tasks from Interactive Fictions

Mo Yu, Xiaoxiao Guo, Yufei Feng, Xiaodan Zhu, Michael Greenspan, Murray Campbell

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.14505 2020-10-12 cs.AI cs.CL 62%

TaxiNLI: Taking a Ride up the NLU Hill

Pratik Joshi, Somak Aditya, Aalok Sathe, Monojit Choudhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 9 figures, 4 tables. Accepted at CoNLL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00691 2020-09-22 cs.CL cs.AI 62%

Connecting the Dots: A Knowledgeable Path Generator for Commonsense Question Answering

Peifeng Wang, Nanyun Peng, Filip Ilievski, Pedro Szekely, Xiang Ren

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 4 figures. Accepted to EMNLP'20 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.08837 2020-07-30 cs.CR cs.AI cs.LG cs.SE stat.ML 62%

Vulnerabilities of Connectionist AI Applications: Evaluation and Defence

Christian Berghoff, Matthias Neu, Arndt von Twickel

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.02164 2020-06-16 cs.CL cs.AI 62%

TabFact: A Large-scale Dataset for Table-based Fact Verification

Wenhu Chen, Hongmin Wang, Jianshu Chen, Yunkai Zhang, Hong Wang, Shiyang Li, Xiyou Zhou, William Yang Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICLR 2020, 17 pages, 15 figures. Main paper has 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.08314 2020-05-19 cs.CL cs.LG 62%

TaBERT: Pretraining for Joint Understanding of Textual and Tabular Data

Pengcheng Yin, Graham Neubig, Wen-tau Yih, Sebastian Riedel

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments To Appear at ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.05240 2020-05-12 cs.AI cs.CL 62%

Commonsense Evidence Generation and Injection in Reading Comprehension

Ye Liu, Tao Yang, Zeyu You, Wei Fan, Philip S. Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by SIGDIAL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.01348 2020-05-08 cs.CL cs.LG 62%

The Sensitivity of Language Models and Humans to Winograd Schema Perturbations

Mostafa Abdou, Vinit Ravishankar, Maria Barrett, Yonatan Belinkov, Desmond Elliott, Anders Søgaard

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments ACL 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.00582 2020-05-05 cs.AI cs.LG 62%

Learning to Complement Humans

Bryan Wilder, Eric Horvitz, Ece Kamar

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments Accepted at IJCAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.11764 2020-04-24 cs.CL cs.LG 62%

FreeLB: Enhanced Adversarial Training for Natural Language Understanding

Chen Zhu, Yu Cheng, Zhe Gan, Siqi Sun, Tom Goldstein, Jingjing Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Adding results with ALBERT

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.08735 2020-03-05 cs.AI cs.LG 62%

Robust Opponent Modeling via Adversarial Ensemble Reinforcement Learning in Asymmetric Imperfect-Information Games

Macheng Shen, Jonathan P. How

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.09451 2020-03-02 cs.LG cs.CL stat.ML 62%

Improving Neural Story Generation by Targeted Common Sense Grounding

Huanru Henry Mao, Bodhisattwa Prasad Majumder, Julian McAuley, Garrison W. Cottrell

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.07338 2020-02-19 cs.CL cs.AI 62%

Conditional Self-Attention for Query-based Summarization

Yujia Xie, Tianyi Zhou, Yi Mao, Weizhu Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.08530 2020-02-19 cs.CV cs.CL cs.LG 62%

VL-BERT: Pre-training of Generic Visual-Linguistic Representations

Weijie Su, Xizhou Zhu, Yue Cao, Bin Li, Lewei Lu, Furu Wei, Jifeng Dai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by ICLR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08444 2019-12-19 cs.LG cs.AI cs.CV cs.RO stat.ML 62%

Relational Mimic for Visual Adversarial Imitation Learning

Lionel Blondé, Yichuan Charlie Tang, Jian Zhang, Russ Webb

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03063 2019-12-09 cs.CV cs.CL cs.LG cs.NE 62%

Weak Supervision helps Emergence of Word-Object Alignment and improves Vision-Language Tasks

Corentin Kervadec, Grigory Antipov, Moez Baccouche, Christian Wolf

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.01917 2019-11-06 cs.AI cs.CL 62%

Scenarios and Recommendations for Ethical Interpretive AI

John Licato, Zaid Marji, Sophia Abraham

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments To appear in the Proceedings of the Human-Centered AI: Trustworthiness of AI Models & Data (HAI) track at AAAI Fall Symposium, DC, November 7-9, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.05054 2019-11-05 cs.CL cs.CV cs.LG 62%

Fusion of Detected Objects in Text for Visual Question Answering

Chris Alberti, Jeffrey Ling, Michael Collins, David Reitter

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.05276 2019-10-14 cs.CL cs.LG 62%

exBERT: A Visual Analysis Tool to Explore Learned Representations in Transformers Models

Benjamin Hoover, Hendrik Strobelt, Sebastian Gehrmann

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.00610 2019-10-03 cs.CL cs.AI 62%

DyKgChat: Benchmarking Dialogue Generation Grounding on Dynamic Knowledge Graphs

Yi-Lin Tuan, Yun-Nung Chen, Hung-yi Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.11788 2019-07-30 cs.LG cs.AI stat.ML 62%

On Hard Exploration for Reinforcement Learning: a Case Study in Pommerman

Chao Gao, Bilal Kartal, Pablo Hernandez-Leal, Matthew E. Taylor

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment (AIIDE) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.04365 2019-07-29 cs.CL cs.LG 62%

CODAH: An Adversarially Authored Question-Answer Dataset for Common Sense

Michael Chen, Mike D'Arcy, Alisa Liu, Jared Fernandez, Doug Downey

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 8 pages, Appeared in RepEval 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01356 2019-07-04 physics.chem-ph cs.CL cs.LG 62%

Predicting Retrosynthetic Reaction using Self-Corrected Transformer Neural Networks

Shuangjia Zheng, Jiahua Rao, Zhongyue Zhang, Jun Xu, Yuedong Yang

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.08809 2019-06-24 cs.LG cs.AI stat.ML 62%

A Deep Reinforcement Learning Approach for Global Routing

Haiguang Liao, Wentai Zhang, Xuliang Dong, Barnabas Poczos, Kenji Shimada, Levent Burak Kara

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

Comments Preprint submitted to ASME JMD

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.01360 2019-05-07 cs.MA cs.AI cs.LG 62%

Skynet: A Top Deep RL Agent in the Inaugural Pommerman Team Competition

Chao Gao, Pablo Hernandez-Leal, Bilal Kartal, Matthew E. Taylor

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 4th Multidisciplinary Conference on Reinforcement Learning and Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07613 2017-11-22 cs.CV cs.AI cs.CL 62%

Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning

Qi Wu, Peng Wang, Chunhua Shen, Ian Reid, Anton van den Hengel

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 61%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17019 2026-04-21 cs.AI 61%

Mini-BEHAVIOR-Gran: Revealing U-Shaped Effects of Instruction Granularity on Language-Guided Embodied Agents

Mini-BEHAVIOR-Gran:揭示指令粒度对语言引导的具身智能体的影响

Sukai Huang, Chenyuan Zhang, Fucai Ke, Zhixi Cai, Gholamreza Haffari, Lizhen Qu, Hamid Rezatofighi

机构 * Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学)

专题命中 推理评测 :planning(abstract,comments);分类 cs.AI

AI总结 本文提出Mini-BEHAVIOR-Gran基准,通过多级指令变体研究指令粒度对具身智能体性能的影响,发现粒度与性能呈非单调U型关系,粗粒度性能反弹与浅层 grounding 有关。

Comments 23 pages, Keywords: Language Grounding, Language Granularity, Instruction Following Agent, Width-based Planning Research Area: Multimodality and Language Grounding to Vision, Robotics and Beyond Research Area Keywords: vision language navigation, multimodality, neurosymbolic approaches

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19210 2025-12-23 cs.AI 61%

Observer, Not Player: Simulating Theory of Mind in LLMs through Game Observation

观察者,而非玩家:通过游戏观察模拟大语言模型中的理论心理论

Jerry Wang, Ting Yiu Liu

机构 * Department of Management Information Systems, National ChengChi University(管理信息系,国立中正大学)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI

AI总结 通过游戏观察模拟大语言模型中的理论心理论,评估其在顺序行为中的推理能力。

Comments Accepted at NeurIPS Workshop on Foundations of Reasoning in Language Models and Workshop on Bridging Language, Agent, and World Model

详情

展开后加载摘要…

URL PDF HTML 收藏