arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2502.11387 2025-02-18 cs.CL 57%

RoleMRC: A Fine-Grained Composite Benchmark for Role-Playing and Instruction-Following

Junru Lu, Jiazheng Li, Guodong Shen, Lin Gui, Siyu An, Yulan He, Di Yin, Xing Sun

机构 * Tencent YouTu Lab(腾讯优图实验室) King’s College London(伦敦国王学院) University of Warwick(华威大学) The Alan Turing Institute(阿兰·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14326 2025-02-18 cs.CL 57%

medIKAL: Integrating Knowledge Graphs as Assistants of LLMs for Enhanced Clinical Diagnosis on EMRs

Mingyi Jia, Junwen Duan, Yan Song, Jianxin Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11288 2025-02-18 cs.CL cs.CV 57%

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Baptist University(香港浸会大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19318 2025-02-18 cs.CL 57%

TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios

Xiaokang Zhang, Sijia Luo, Bohan Zhang, Zeyao Ma, Jing Zhang, Yang Li, Guanlin Li, Zijun Yao, Kangli Xu, Jinchang Zhou, Daniel Zhang-Li, Jifan Yu, Shu Zhao, Juanzi Li, Jie Tang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Tsinghua University(清华大学) Computer Science, Anhui University(安徽大学计算机学院) Zhipu AI(智谱AI)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments https://tablellm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10410 2025-02-18 cs.CY cs.AI 57%

Auto-Evaluation: A Critical Measure in Driving Improvements in Quality and Safety of AI-Generated Lesson Resources

Hannah-Beth Clark, Margaux Dowland, Laura Benton, Reka Budai, Ibrahim Kaan Keskin, Emma Searle, Matthew Gregory, Mark Hodierne, William Gayne, John Roberts

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 27 pages, Part of MIT Open Learning AI and Open Education Initiative Series, published Jan 2025 https://aiopeneducation.pubpub.org/pub/i36sncz8/release/3?readingCollection=06969c6d

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01882 2025-02-18 cs.CR cs.AI cs.ET cs.SE 57%

HoneyGPT: Breaking the Trilemma in Terminal Honeypots with Large Language Model

Ziyang Wang, Jianzhou You, Haining Wang, Tianwei Yuan, Shichao Lv, Yang Wang, Limin Sun

机构 * Institute of Information Engineering CAS(中国科学院信息工程研究所) School of Cyber Security UCAS(中国科学院大学网络空间安全学院) Sangfor Technologies Inc.(深信服科技股份有限公司) Virginia Tech(弗吉尼亚理工大学) Shenzhen Institute of Advanced Technology CAS(中国科学院深圳先进技术研究院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09940 2025-02-17 cs.CL cs.SD eess.AS 57%

A Preliminary Exploration with GPT-4o Voice Mode

Yu-Xiang Lin, Chih-Kai Yang, Wei-Chih Chen, Chen-An Li, Chien-yu Huang, Xuanjun Chen, Hung-yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14497 2025-02-17 cs.CL 57%

Evaluating and Improving Graph to Text Generation with Large Language Models

Jie He, Yijun Yang, Wanqiu Long, Deyi Xiong, Victor Gutierrez-Basulto, Jeff Z. Pan

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08796 2025-02-14 cs.CL cs.CY cs.HC 57%

A Systematic Review on the Evaluation of Large Language Models in Theory of Mind Tasks

Karahan Sarıtaş, Kıvanç Tezören, Yavuz Durmazkeser

机构 * University of Tübingen(蒂宾根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15512 2025-02-13 cs.CL 57%

Reverse Question Answering: Can an LLM Write a Question so Hard (or Bad) that it Can't Answer?

Nishant Balepur, Feng Gu, Abhilasha Ravichander, Shi Feng, Jordan Boyd-Graber, Rachel Rudinger

机构 * University of Maryland(马里兰大学) University of Washington(华盛顿大学) George Washington University(乔治华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06843 2025-02-12 cs.CV cs.AI cs.HC 57%

Vision-Integrated LLMs for Autonomous Driving Assistance : Human Performance Comparison and Trust Evaluation

Namhee Kim, Woojin Park

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06087 2025-02-12 cs.CL 57%

ConMeC: A Dataset for Metonymy Resolution with Common Nouns

Saptarshi Ghosh, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01175 2025-02-12 cs.CV cs.AI 57%

OBI-Bench: Can LMMs Aid in Study of Ancient Script on Oracle Bones?

Zijian Chen, Tingzhu Chen, Wenjun Zhang, Guangtao Zhai

机构 * Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究所) School of Humanities, Shanghai Jiao Tong University(上海交通大学人文学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by ICLR 2025 as a Poster. 31 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04430 2025-02-12 cs.LG 57%

Towards Unifying Interpretability and Control: Evaluation via Intervention

Usha Bhalla, Suraj Srinivas, Asma Ghandeharioun, Himabindu Lakkaraju

机构 * Harvard University(哈佛大学) Kempner Institute(肯普纳研究所) Robert Bosch LLC(罗伯特·博世有限责任公司) Google Deepmind(谷歌DeepMind) Harvard Business School(哈佛商学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06738 2025-02-11 cs.LG 57%

Resurrecting saturated LLM benchmarks with adversarial encoding

Igor Ivanov, Dmitrii Volkov

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05926 2025-02-11 eess.IV cs.CL cs.CV 57%

A Generative Framework for Bidirectional Image-Report Understanding in Chest Radiography

Nicholas Evans, Stephen Baker, Miles Reed

机构 * Bandırma Onyedi Eylül University(班迪尔马奥涅迪埃伊吕勒大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06039 2025-02-11 cs.SE cs.AI cs.CR 57%

Benchmarking Prompt Engineering Techniques for Secure Code Generation with GPT Models

Marc Bruni, Fabio Gabrielli, Mohammad Ghafari, Martin Kropp

机构 * University of Applied Sciences and Arts Northwestern Switzerland(西北瑞士应用科学与艺术大学) University of Applied Sciences(应用科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at the 2025 IEEE/ACM Second International Conference on AI Foundation Models and Software Engineering (Forge 2025). 10 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05660 2025-02-11 cs.CV cs.CL 57%

Evaluating Vision-Language Models for Emotion Recognition

Sree Bhattacharyya, James Z. Wang

机构 * College of Information Sciences and Technology, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14179 2025-02-11 cs.CL cs.CV 57%

MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems

Zifeng Zhu, Mengzhao Jia, Zhihan Zhang, Lang Li, Meng Jiang

机构 * Xi’an Jiaotong University(西安交通大学) University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL 2025, 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05716 2025-02-10 cs.RO cs.AI 57%

Transferring Foundation Models for Generalizable Robotic Manipulation

Jiange Yang, Wenhui Tan, Chuhao Jin, Keling Yao, Bei Liu, Jianlong Fu, Ruihua Song, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Microsoft Research(微软研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments WACV 2025, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01535 2025-02-04 cs.CV cs.CL q-bio.QM 57%

VisTA: Vision-Text Alignment Model with Contrastive Learning using Multimodal Data for Evidence-Driven, Reliable, and Explainable Alzheimer's Disease Diagnosis

Duy-Cat Can, Linh D. Dang, Quang-Huy Tang, Dang Minh Ly, Huong Ha, Guillaume Blanc, Oliver Y. Chén, Binh T. Nguyen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01270 2025-02-04 cs.CL 57%

Main Predicate and Their Arguments as Explanation Signals For Intent Classification

Sameer Pimparkhede, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15606 2025-02-04 cs.AI cs.CV 57%

Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage

Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaojian Ma, Tao Yuan, Yue Fan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI通用人工智能国家重点实验室) Beijing Key Laboratory of Intelligent Information Technology, Beijing Institute of Technology(北京理工大学智能信息技术北京市重点实验室) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(深圳北理莫斯科大学广东机器感知与智能计算实验室) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments ICLR 2025, https://mat-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18081 2025-01-31 cs.AI cs.CY 57%

Normative Evaluation of Large Language Models with Everyday Moral Dilemmas

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab, University of California, Berkeley(加州大学伯克利分校D-Lab)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06595 2025-01-31 cs.CL 57%

GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering

Sacha Muller, António Loison, Bilel Omrani, Gautier Viaud

机构 * Illuin Technology(Illuin科技公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Proceedings of the 31st International Conference on Computational Linguistics

Journal ref Proceedings of the 31st International Conference on Computational Linguistics (2025), pages 4510 to 4534, Abu Dhabi, UAE. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19369 2025-01-30 cs.CL cs.HC 57%

Evaluating Telugu Proficiency in Large Language Models_ A Comparative Analysis of ChatGPT and Gemini

Katikela Sreeharsha Kishore, Rahimanuddin Shaik

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Disparities in fundamental understandings about the article between the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09560 2025-01-29 cond-mat.mtrl-sci cs.CL cs.IR 57%

Foundational Large Language Models for Materials Research

Vaibhav Mishra, Somaditya Singh, Dhruv Ahlawat, Mohd Zaki, Vaibhav Bihani, Hargun Singh Grover, Biswajit Mishra, Santiago Miret, Mausam, N. M. Anoop Krishnan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15755 2025-01-28 cs.LG 57%

GraphICL: Unlocking Graph Learning Potential in LLMs through Structured Prompt Design

Yuanfu Sun, Zhengnan Ma, Yi Fang, Jing Ma, Qiaoyu Tan

机构 * New York University (Shanghai)(纽约大学(上海)) New York University(纽约大学) Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15660 2025-01-28 cs.CV cs.AI eess.IV physics.med-ph 57%

Marker Track: Accurate Fiducial Marker Tracking for Evaluation of Residual Motions During Breath-Hold Radiotherapy

Aimee Guo, Weihua Mao

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 14 pages, 9 figures, Regeneron STS 2025 project. Project page: https://sites.google.com/view/markertrack?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15268 2025-01-28 cs.CL 57%

New Evaluation Paradigm for Lexical Simplification

Jipeng Qiang, Minjiang Huang, Yi Zhu, Yunhao Yuan, Chaowei Zhang, Xiaoye Ouyang

机构 * School of Information and Engineering, Yangzhou University(扬州大学信息工程学院) China Academy of Electronic and Information Technology(中国电子信息产业发展研究院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏