arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2504.00189 2025-04-02 eess.IV cs.CV cs.LG 57%

Detecting Glioma, Meningioma, and Pituitary Tumors, and Normal Brain Tissues based on Yolov11 and Yolov8 Deep Learning Models

Ahmed M. Taha, Salah A. Aly, Mohamed F. Darwish

机构 * Egypt University of Informatics(埃及信息大学) Badya University(巴迪亚大学) Fayoum University(法尤姆大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments 6 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17238 2025-04-02 cs.RO cs.LG 57%

Temporal and Semantic Evaluation Metrics for Foundation Models in Post-Hoc Analysis of Robotic Sub-tasks

Jonathan Salfity, Selma Wanna, Minkyu Choi, Mitch Pryor

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :planning(abstract);分类 cs.LG

Comments 8 pages, 3 figures. IROS 2024 Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13164 2025-04-02 cs.LG 57%

VL-ICL Bench: The Devil in the Details of Multimodal In-Context Learning

Yongshuo Zong, Ondrej Bohdal, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14739 2025-03-31 cs.CL 57%

SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines

P Team, Xinrun Du, Yifan Yao, Kaijing Ma, Bingli Wang, Tianyu Zheng, King Zhu, Minghao Liu, Yiming Liang, Xiaolong Jin, Zhenlin Wei, Chujie Zheng, Kaixin Deng, Shawn Gavin, Shian Jia, Sichao Jiang, Yiyan Liao, Rui Li, Qinrui Li, Sirun Li, Yizhi Li, Yunwen Li, David Ma, Yuansheng Ni, Haoran Que, Qiyao Wang, Zhoufutu Wen, Siwei Wu, Tyshawn Hsing, Ming Xu, Zhenzhu Yang, Zekun Moore Wang, Junting Zhou, Yuelin Bai, Xingyuan Bu, Chenglin Cai, Liang Chen, Yifan Chen, Chengtuo Cheng, Tianhao Cheng, Keyi Ding, Siming Huang, Yun Huang, Yaoru Li, Yizhe Li, Zhaoqun Li, Tianhao Liang, Chengdong Lin, Hongquan Lin, Yinghao Ma, Tianyang Pang, Zhongyuan Peng, Zifan Peng, Qige Qi, Shi Qiu, Xingwei Qu, Shanghaoran Quan, Yizhou Tan, Zili Wang, Chenqing Wang, Hao Wang, Yiya Wang, Yubo Wang, Jiajun Xu, Kexin Yang, Ruibin Yuan, Yuanhao Yue, Tianyang Zhan, Chun Zhang, Jinyang Zhang, Xiyue Zhang, Xingjian Zhang, Yue Zhang, Yongchi Zhao, Xiangyu Zheng, Chenghua Zhong, Yang Gao, Zhoujun Li, Dayiheng Liu, Qian Liu, Tianyu Liu, Shiwen Ni, Junran Peng, Yujia Qin, Wenbo Su, Guoyin Wang, Shi Wang, Jian Yang, Min Yang, Meng Cao, Xiang Yue, Zhaoxiang Zhang, Wangchunshu Zhou, Jiaheng Liu, Qunshu Lin, Wenhao Huang, Ge Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21717 2025-03-28 cs.CL 57%

CLAIMCHECK: How Grounded are LLM Critiques of Scientific Papers?

Jiefu Ou, William Gantt Walden, Kate Sanders, Zhengping Jiang, Kaiser Sun, Jeffrey Cheng, William Jurayj, Miriam Wanner, Shaobo Liang, Candice Morgan, Seunghoon Han, Weiqi Wang, Chandler May, Hannah Recknor, Daniel Khashabi, Benjamin Van Durme

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15454 2025-03-28 cs.CL 57%

Bias Evaluation and Mitigation in Retrieval-Augmented Medical Question-Answering Systems

Yuelyu Ji, Hang Zhang, Yanshan Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20446 2025-03-27 eess.IV cs.AI cs.CV 57%

Attention Xception UNet (AXUNet): A Novel Combination of CNN and Self-Attention for Brain Tumor Segmentation

Farzan Moodi, Fereshteh Khodadadi Shoushtari, Gelareh Valizadeh, Dornaz Mazinani, Hanieh Mobarak Salari, Hamidreza Saligheh Rad

机构 * Imam Khomeini Hospital(伊玛目霍梅尼医院) Quantitative Medical Imaging Systems Group(定量医学成像系统组) Research Center for Molecular and Cellular Imaging(分子与细胞成像研究中心)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17354 2025-03-24 cs.AI 57%

HCAST: Human-Calibrated Autonomy Software Tasks

David Rein, Joel Becker, Amy Deng, Seraphina Nix, Chris Canal, Daniel O'Connel, Pip Arnott, Ryan Bloom, Thomas Broadley, Katharyn Garcia, Brian Goodrich, Max Hasin, Sami Jawhar, Megan Kinniment, Thomas Kwa, Aron Lajko, Nate Rush, Lucas Jun Koba Sato, Sydney Von Arx, Ben West, Lawrence Chan, Elizabeth Barnes

机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) Equistamp Independent Contributor(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 32 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15985 2025-03-21 cs.AI 57%

Exploring the Reliability of Self-explanation and its Relationship with Classification in Language Model-driven Financial Analysis

Han Yuan, Li Zhang, Zheng Ma

机构 * Global Decision Science, American Express(美国运通全球决策科学部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15876 2025-03-21 cs.AI 57%

DeepPsy-Agent: A Stage-Aware and Deep-Thinking Emotional Support Agent System

Kai Chen, Zebing Sun

机构 * Research Center for Social Psychological Service(社会心理服务研究中心) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04425 2025-03-21 cs.CL 57%

DELIFT: Data Efficient Language model Instruction Fine Tuning

Ishika Agarwal, Krishnateja Killamsetty, Lucian Popa, Marina Danilevksy

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14672 2025-03-20 cs.CV cs.AI 57%

FiVL: A Framework for Improved Vision-Language Alignment through the Lens of Training, Evaluation and Explainability

Estelle Aflalo, Gabriela Ben Melech Stan, Tiep Le, Man Luo, Shachar Rosenman, Sayak Paul, Shao-Yen Tseng, Vasudev Lal

机构 * Intel Labs(英特尔实验室) Hugging Face

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14189 2025-03-19 cs.CL cs.CV 57%

Towards Harmless Multimodal Assistants with Blind Preference Optimization

Yongqi Li, Lu Yang, Jian Wang, Runyang You, Wenjie Li, Liqiang Nie

机构 * The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11911 2025-03-19 cs.CL 57%

LAG-MMLU: Benchmarking Frontier LLM Understanding in Latvian and Giriama

Naome A. Etori, Kevin Lu, Randu Karisa, Arturs Kanepajs

机构 * University of Minnesota-Twin Cities(明尼苏达大学双城校区) Bellarmine College Preparatory(贝拉明学院预备学校) Masakhane(马萨卡内项目机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at NoDaLiDa/Baltic-HLT 2025. https://hdl.handle.net/10062/107190

Journal ref Joint 25th Nordic Conference on Computational Linguistics and 11th Baltic Conference on Human Language Technologies (NoDaLiDa/Baltic-HLT 2025) : Proceedings of the Conference: March 3-4, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12687 2025-03-18 cs.AI 57%

AI Agents: Evolution, Architecture, and Real-World Applications

Naveen Krishnan

专题命中 推理评测 :planning(abstract);分类 cs.AI

Comments 52 pages, 4 figures, comprehensive survey and analysis of AI agent evolution, architecture, evaluation frameworks, and applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10427 2025-03-18 cs.CL 57%

VisTW: Benchmarking Vision-Language Models for Traditional Chinese in Taiwan

Zhi Rui Tam, Ya-Ting Pai, Yen-Wei Lee, Yun-Nung Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National Taiwan University(台湾大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10944 2025-03-17 cs.CR cs.LG 57%

Phishsense-1B: A Technical Perspective on an AI-Powered Phishing Detection Model

SE Blake

机构 * Shrewd Research(什鲁德研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Phishing Detection Model https://huggingface.co/AcuteShrewdSecurity/Llama-Phishsense-1B

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20622 2025-03-17 cs.CV cs.AI 57%

Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models

Ashish Seth, Dinesh Manocha, Chirag Agarwal

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10321 2025-03-13 cs.DB cs.CL 57%

LLM-SQL-Solver: Can LLMs Determine SQL Equivalence?

Fuheng Zhao, Jiayue Chen, Lawrence Lim, Ishtiyaque Ahmad, Divyakant Agrawal, Amr El Abbadi

机构 * UC Santa Barbara(圣巴巴拉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05440 2025-03-13 cs.LG 57%

Can LLMs Understand Time Series Anomalies?

Zihao Zhou, Rose Yu

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06949 2025-03-12 cs.CL 57%

LexPro-1.0 Technical Report

Haotian Chen, Yanyu Xu, Boyan Wang, Chaoyue Zhao, Xiaoyu Han, Fang Wang, Lizhen Cui, Yonghui Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07041 2025-03-11 cs.CL 57%

TCM-3CEval: A Triaxial Benchmark for Assessing Responses from Large Language Models in Traditional Chinese Medicine

Tianai Huang, Lu Lu, Jiayuan Chen, Lihao Liu, Junjun He, Yuping Zhao, Wenchao Tang, Jie Xu

机构 * School of Acupuncture-Moxibustion and Tuina, Shanghai University of Traditional Chinese Medicine(上海中医药大学针灸推拿学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) China Academy of Chinese Medical Sciences(中国中医科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06689 2025-03-11 cs.SE cs.CL 57%

DependEval: Benchmarking LLMs for Repository Dependency Understanding

Junjia Du, Yadi Liu, Hongcheng Guo, Jiawei Wang, Haojian Huang, Yunyi Ni, Zhoujun Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11903 2025-03-11 cs.CL 57%

MMRC: A Large-Scale Benchmark for Understanding Multimodal Large Language Model in Real-World Conversation

Haochen Xue, Feilong Tang, Ming Hu, Yexin Liu, Qidong Huang, Yulong Li, Chengzhi Liu, Zhongxing Xu, Chong Zhang, Chun-Mei Feng, Yutong Xie, Imran Razzak, Zongyuan Ge, Jionglong Su, Junjun He, Yu Qiao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Monash University(莫纳什大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) HKUST(香港科技大学) USTC(中国科学技术大学) IHPC, A*STAR(新加坡科技研究局资讯通信研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17267 2025-03-11 cs.CV cs.AI 57%

UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios

Baichuan Zhou, Haote Yang, Dairong Chen, Junyan Ye, Tianyi Bai, Jinhua Yu, Songyang Zhang, Dahua Lin, Conghui He, Weijia Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17631 2025-03-11 cs.AI cs.CE cs.MA 57%

BioDiscoveryAgent: An AI Agent for Designing Genetic Perturbation Experiments

Yusuf Roohani, Andrew Lee, Qian Huang, Jian Vora, Zachary Steinhart, Kexin Huang, Alexander Marson, Percy Liang, Jure Leskovec

机构 * Stanford University(斯坦福大学) Arc Institute(Arc研究所) Gladstone-UCSF Institute of Genomic Immunology(Gladstone-加州大学旧金山分校基因组免疫学研究所) University of California, San Francisco(加州大学旧金山分校) UCSF Helen Diller Family Comprehensive Cancer Center(加州大学旧金山分校海伦·迪勒家族综合癌症中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16461 2025-03-11 cs.CL 57%

Comparative Study of Multilingual Idioms and Similes in Large Language Models

Paria Khoshtab, Danial Namazifard, Mostafa Masoudi, Ali Akhgary, Samin Mahdizadeh Sani, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University(哈塔姆大学德黑兰高等研究院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04783 2025-03-10 cs.CL cs.CR 57%

Comparative Analysis Based on DeepSeek, ChatGPT, and Google Gemini: Features, Techniques, Performance, Future Prospects

Anichur Rahman, Shahariar Hossain Mahir, Md Tanjum An Tashrif, Airin Afroj Aishi, Md Ahsan Karim, Dipanjali Kundu, Tanoy Debnath, Md. Abul Ala Moududi, MD. Zunead Abedin Eidmum

机构 * National Institute of Textile Engineering and Research (NITER)(国家纺织工程与研究学院(NITER)) Dhaka University(达卡大学) Daffodil International University(水仙花国际大学) Stony Brook University(石溪大学) Bangabandhu Sheikh Mujibur Rahman Digital University(邦班杜·谢赫·穆吉布·拉赫曼数字大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19519 2025-03-10 cs.HC cs.AI 57%

Static Vs. Agentic Game Master AI for Facilitating Solo Role-Playing Experiences

Nicolai Hejlesen Jørgensen, Sarmilan Tharmabalan, Ilhan Aslan, Nicolai Brodersen Hansen, Timothy Merritt

机构 * Aalborg University(奥尔堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 17 pages, 10 figures, 1 table, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04693 2025-03-07 cs.CL 57%

UIPE: Enhancing LLM Unlearning by Removing Knowledge Related to Forgetting Targets

Wenyu Wang, Mengqi Zhang, Xiaotian Ye, Zhaochun Ren, Zhumin Chen, Pengjie Ren

机构 * Shandong University(山东大学) Beijing University of Posts and Telecommunications(北京邮电大学) Leiden University(莱顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏