arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2505.08905 2026-01-27 cs.AI cs.CL 62%

Grounding Synthetic Data Evaluations of Language Models in Unsupervised Document Corpora

在无监督文档语料中使语言模型的合成数据评估接地

Michael Majurski, Cynthia Matuszek

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种自动化方法,利用文档语料生成事实性合成数据评估,以提高语言模型在无监督文档中的评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16478 2026-01-26 cs.CL cs.AI 62%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15457 2026-01-23 cs.CL cs.AI cs.IR 62%

Chunking, Retrieval, and Re-ranking: An Empirical Evaluation of RAG Architectures for Policy Document Question Answering

分块、检索与重排序:RAG架构在政策文件问答中的实证评估

Anuj Maharjan, Umesh Yadav

机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06518 2026-01-23 cs.CL cs.AI 62%

Medal Matters: Probing LLMs' Failure Cases Through Olympic Rankings

奖牌 matters:通过奥运排名探测 LLMs 的失败案例

Juhwan Choi, Seunguk Yu, JungMin Yun, YoungBin Kim

机构 * AITRCS, Republic of Korea, Seoul(韩国首尔AITRCS研究中心) Chung-Ang University, Republic of Korea, Seoul(韩国首尔 Chung-Ang 大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过奥运排名数据探测 LLMs 在知识整合和推理方面的局限性,揭示其在任务二中的失败案例,并提供改进方向及研究资源。

Comments COLM 2025 ORIGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15267 2026-01-22 cs.CY cs.AI cs.CL 62%

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

评估大型语言模型在法律应用中的表现:挑战、方法与未来方向

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng, Siyuan Zheng, Qingyao Ai, Yun Liu, Renjun Bian, Yiqun Liu, Charles L. A. Clarke, Weixing Shen, Ben Kao

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14695 2026-01-22 cs.LG cs.AI 62%

CoScale-RL: Efficient Post-Training by Co-Scaling Data and Computation

CoScale-RL: 通过协同扩展数据与计算实现高效后期训练

Yutong Chen, Jiandong Gao, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院) Beijing National Research Center for Information Science(北京信息科学国家研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CoScale-RL通过协同扩展数据与计算,提升大型推理模型的训练效率和推理能力。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14160 2026-01-21 cs.CL cs.AI 62%

Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law

通过合成数据实现领域适应:通过合成数据微调大型语言模型进行德国法律问答

Ali Hamza Bashir, Muhammad Rehan Khalid, Kostadin Cvejoski, Jana Birr, Jule Berghaus, Armin Berger, Sandra Halscheidt, Christian Temath, Rafet Sifa, David Berghaus

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Georg-August-University Göttingen(哥廷根乔治-亚历山大大学) Lamarr Institute(拉马尔研究所) University of Bonn(波恩大学) JetBrains Research(JetBrains研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据生成方法微调大型语言模型,提升其在德国法律问答任务中的性能,展示合成数据在替代人工标注方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20543 2026-01-21 cs.CL cs.AI 62%

The Dog the Cat Chased Stumped the Model: Measuring When Language Models Abandon Structure for Shortcuts

狗追猫的猫让模型困惑:衡量语言模型何时放弃结构分析而采用捷径

Sangmitra Madhusudan, Kaige Chen, Ali Emami

机构 * Emory University(埃默里大学) Brock University(布罗克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CenterBench数据集,用于衡量语言模型在处理中心嵌套句子时何时从结构分析转向语义捷径,揭示模型在复杂性增加时性能差距扩大及人类与模型的差异。

Comments 9 pages (excluding references), accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20941 2026-01-21 cs.CL cs.AI 62%

Do LLMs Truly Understand When a Precedent Is Overruled?

大型语言模型真的能理解当先例被推翻时的情况吗?

Li Zhang, Jaromir Savelka, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过评估LLMs在识别美国最高法院案件中推翻关系的能力,揭示了模型在时间敏感性、推理深度和上下文依赖性方面的局限性,并提出了一种更贴近真实法律推理任务的长上下文基准。

Comments 12 pages, 2 figures, JURIX 2025

Journal ref Proceedings of the 2025 Conference on Legal Knowledge and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08464 2026-01-21 cs.CL cs.LG cs.SI 62%

Large Language Models Meet Stance Detection: A Survey of Tasks, Methods, Applications, Challenges and Future Directions

大语言模型与立场检测:任务、方法、应用、挑战与未来方向的综述

Lata Pangtey, Anukriti Bhatnagar, Shubhi Bansal, Shahid Shafi Dar, Nagendra Kumar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT) Indore, Indore 453552, India(计算机科学与工程系,印度理工学院(IIT)印多尔,印多尔453552,印度)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大语言模型在立场检测中的任务、方法、应用及挑战,提出分类框架并探讨未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12259 2026-01-21 cs.AI cs.CE cs.LG 62%

FutureX-Pro: Extending Future Prediction to High-Value Vertical Domains

FutureX-Pro: 将未来预测扩展到高价值垂直领域

Jiashuo Liu, Siyuan Chen, Zaiyuan Wang, Zhiyuan Zeng, Jiacheng Guo, Liang Hu, Lingyue Yin, Suozhi Huang, Wenxin Hao, Yang Yang, Zerui Cheng, Zixin Yao, Lingyue Yin, Haoxin Liu, Jiayi Cheng, Yuzhen Li, Zezhong Ma, Bingjie Wang, Bingsen Qiu, Xiao Liu, Zeyang Zhang, Zijian Liu, Jinpeng Wang, Mingren Yin, Tianci He, Yali Liao, Yixiao Tian, Zhenwei Zhu, Anqi Dai, Ge Zhang, Jingkai Liu, Kaiyuan Zhang, Wenlong Wu, Xiang Gao, Xinjie Chen, Zhixin Yao, Zhoufutu Wen, B. Aditya Prakash, Jose Blanchet, Mengdi Wang, Nian Si, Wenhao Huang

机构 * Hong Kong University of Science and Technology(香港科技大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FutureX-Pro通过扩展未来预测到金融、零售、公共健康和自然灾害等高价值垂直领域,评估代理LLMs在工业部署中的领域基础能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11776 2026-01-21 cs.CL cs.AI 62%

Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models

净化人工智能:一种用于大型语言模型的自反思净化框架

Kaituo Zhang, Zhimeng Jiang, Na Zou

机构 * University of Houston(休斯顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 推理评测 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种自反思净化框架,利用LLMs自身能力检测并纠正有毒内容,提升文本生成的安全性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11658 2026-01-21 cs.CL cs.AI 62%

Towards AGI A Pragmatic Approach Towards Self Evolving Agent

迈向AGI:一种务实的自我进化代理方法

Indrajit Kar, Sammy Zonunpuia, Zonunfeli Ralte

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种分层自我进化多代理框架,通过整合基础LLM、操作SLM代理、代码生成LLM和教师LLM,实现代理的持续适应与自我进化,展示了在不同任务难度下的进化优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11567 2026-01-21 cs.CL cs.AI 62%

Measuring Stability Beyond Accuracy in Small Open-Source Medical Large Language Models for Pediatric Endocrinology

在儿科内分泌学中超越准确性的医疗小型开源大语言模型稳定性测量

Vanessa D'Amario, Randy Daniel, Alessandro Zanetti, Dhruv Edamadaka, Nitya Alaparthy, Joshua Tarkoff

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了儿科内分泌学中医疗小型开源大语言模型的稳定性,发现高一致性不等于正确性,且系统扰动会影响输出,强调了评估框架的必要性。

Comments 20 pages, 11 figures, accepted at 47 workshop Reproducible Artificial Intelligence (AAAI 2026, Singapore, January 27, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23816 2026-01-21 cs.CL cs.LG 62%

A Course Correction in Steerability Evaluation: Revealing Miscalibration and Side Effects in LLMs

在可转向性评估中的课程修正:揭示LLMs中的误校准与副作用

Trenton Chang, Tobias Schnabel, Adith Swaminathan, Jenna Wiens

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种多维目标空间框架,揭示LLMs在文本改写任务中存在意外副作用,表明现有对齐策略可能不足。

Comments 8 pages, 6 figures. 26 pages of references and supplementary material, 22 additional figures. Association for the Advancement of Artificial Intelligence Conference (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09733 2026-01-16 cs.CL cs.AI 62%

Closing the Data Loop: Using OpenDataArena to Engineer Superior Training Datasets

闭合数据循环:利用OpenDataArena工程更优质的训练数据集

Xin Gao, Xiaoyang Wang, Yun Zhu, Mengzhang Cai, Conghui He, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用OpenDataArena构建闭合循环数据集,通过ODA-Math-460k和ODA-Mixture数据集展示其在数学推理和多领域指令任务上的卓越性能。

Comments Superior ODA-Math, ODA-Mixture Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06821 2026-01-15 cs.CL cs.AI cs.SE 62%

Can LLMs Generate Reliable Test Case Generators? A Study on Competition-Level Programming Problems

LLMs能否生成可靠的测试用例生成器?对竞赛级编程问题的研究

Yuhan Cao, Zian Chen, Kun Quan, Ziliang Zhang, Yu Wang, Xiaoning Dong, Yeqi Feng, Guanzhong He, Jingcheng Huang, Jianhao Li, Yixuan Tan, Jiafu Tang, Yilin Tang, Junlei Wu, Qianyu Xiao, Can Zheng, Shouchen Zhou, Yuxiang Zhu, Yiming Huang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) ShanghaiTech University(上海科技大学) Wuhan University(武汉大学) Fuzhou University(福州大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University(南京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在生成竞赛级编程问题测试用例生成器方面的能力,提出TCGBench基准测试,并通过实验发现LLMs在生成针对性测试用例以暴露代码缺陷方面存在不足。

Comments 37 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09089 2026-01-15 cs.CL cs.AI 62%

SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding

SubTokenTest: 一个用于现实世界子token理解的实用基准

Shuyang Hou, Yi Hu, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SubTokenTest通过实用任务评估大语言模型在子token理解上的能力,揭示分词过程对性能的影响,并分析字符级信息的编码方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09066 2026-01-15 cs.CL cs.AI 62%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08472 2026-01-14 cs.CL cs.AI 62%

sui-1: Grounded and Verifiable Long-Form Summarization

sui-1:可验证的长文本摘要

Benedikt Droste, Jan Philipp Harries, Maximilian Idahl, Björn Plüster

机构 * ellamind

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 sui-1通过生成带引用的摘要,解决了大型语言模型摘要不可验证的问题,展示了任务特定训练在引用支持摘要中的优越性。

Comments 13 pages, 4 figures, model weights at https://huggingface.co/ellamind/sui-1-24b

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 62%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02333 2026-01-14 cs.CL cs.AI cs.SI 62%

Human Mobility Datasets Enriched With Contextual and Social Dimensions

具有上下文和社会维度的人类移动数据集

Chiara Pugliese, Francesco Lettich, Guido Rocchietti, Chiara Renso, Fabio Pinelli

机构 * IIT-CNR(意大利理工学院-克雷莫纳国家研究委员会) ISTI-CNR(意大利信息科学研究所-克雷莫纳国家研究委员会) IMT Lucca(利卡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出两个结合语义丰富和社交媒体数据的人类移动数据集,用于多模态移动分析与知识图谱构建。

Comments 5 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07593 2026-01-13 cs.AR cs.CL cs.LG 62%

GRPO with State Mutations: Improving LLM-Based Hardware Test Plan Generation

GRPO与状态突变:改进基于LLM的硬件测试计划生成

Dimple Vijay Kochar, Nathaniel Pinckney, Guan-Ting Liu, Chia-Tung Ho, Chenhui Deng, Haoxing Ren, Brucek Khailany

机构 * Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA(麻省理工学院电子工程与计算机科学系) NVIDIA Research, Austin, TX(NVIDIA研究部) NVIDIA Research, Taiwan(NVIDIA台湾研究部) NVIDIA Research, Santa Clara, CA(NVIDIA圣克拉拉研究部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 GRPO-SMu通过改进LLM训练方法,显著提升硬件验证中测试计划生成的准确率和突变检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07316 2026-01-13 cs.LG cs.AI 62%

BEAT-Net: Injecting Biomimetic Spatio-Temporal Priors for Interpretable ECG Classification

BEAT-Net:注入生物仿生时空先验以实现可解释的ECG分类

Runze Ma, Caizhi Liao

机构 * School of Information Technology(信息科技学院) Monash University Malaysia(墨尔本大学马来西亚分校) Faculty of Biomedical Engineering(生物医学工程学院) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 BEAT-Net通过生物仿生时空先验实现ECG分类的可解释性与高效性

Comments 8 pages, 4 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 62%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07153 2026-01-13 cs.CL cs.AI 62%

Can Large Language Models Understand, Reason About, and Generate Code-Switched Text?

大语言模型能否理解、推理并生成混合语言文本?

Genta Indra Winata, David Anugraha, Patrick Amadeus Irawan, Anirban Das, Haneul Yoo, Paresh Dashore, Shreyas Kulkarni, Ruochen Zhang, Haruki Sakajo, Frederikus Hudi, Anaelia Ovalle, Syrielle Montariol, Felix Gaschi, Michael Anugraha, Rutuj Ravindra Puranik, Zawad Hayat Ahmed, Adril Putra Merin, Emmanuele Chersoni

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过CodeMixQA基准测试评估大语言模型在理解、推理和生成混合语言文本方面的能力,揭示了模型在混合语言环境中的局限性,并提供了改进多语言LLMs的见解。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 62%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06750 2026-01-13 cs.CV cs.AI cs.CL 62%

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models

医疗多模态大语言模型的视点临床意图理解能力基准测试

Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng, Wenting Chen, Jie Liu, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06636 2026-01-13 cs.CL cs.AI 62%

MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis

MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应

Wenting Chen, Zhongrui Zhu, Guolin Huang, Wenxuan Wang

机构 * Stanford University(斯坦福大学) Xi’an Jiaotong University(西安交通大学) Shenzhen University(深圳大学) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06151 2026-01-13 cs.LG cs.CL 62%

PromptPort: A Reliability Layer for Cross-Model Structured Extraction

PromptPort:跨模型结构提取的可靠性层

Varun Kotte

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 PromptPort通过结合确定性规范化与轻量级验证器和安全覆盖策略,解决跨模型结构提取中的格式坍塌问题,提升输出可靠性与语义能力。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏