arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2603.24440 2026-03-26 cs.LG cs.AI cs.CV 73%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI 73%

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13154 2026-03-16 cs.CL cs.AI 73%

ESG-Bench: Benchmarking Long-Context ESG Reports for Hallucination Mitigation

ESG-Bench: 对长上下文 ESG 报告进行基准测试以缓解幻觉

Siqi Sun, Ben Peng Wu, Mali Jin, Peizhen Bai, Hanpei Zhang, Xingyi Song

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ESG-Bench 数据集,用于评估大语言模型在解析 ESG 报告和减少幻觉方面的能力,通过人工标注的 QA 对和细粒度标签,系统评估模型提取和推理 ESG 内容的能力。

Comments To be published in the AAAI 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15479 2026-03-13 cs.CL cs.AI 73%

Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts

在生物医学和多领域背景下对LLM进行成对因果发现的基准测试

Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了13个开源LLM在生物医学和多领域背景下进行成对因果发现的能力,发现现有模型在处理复杂因果关系时表现不佳,提出了统一的评估框架并公开数据以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 73%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05218 2026-03-06 cs.AI cs.LG 73%

KARL: Knowledge Agents via Reinforcement Learning

通过强化学习的知识代理:KARL

Jonathan D. Chang, Andrew Drozdov, Shubham Toshniwal, Owen Oertell, Alexander Trott, Jacob Portes, Abhay Gupta, Pallavi Koppol, Ashutosh Baheti, Sean Kulinski, Ivan Zhou, Irene Dea, Krista Opsahl-Ong, Simon Favreau-Lessard, Sean Owen, Jose Javier Gonzalez Ortiz, Arnav Singhvi, Xabi Andrade, Cindy Wang, Kartik Sreenivasan, Sam Havens, Jialu Liu, Peyton DeNiro, Wen Sun, Michael Bendersky, Jonathan Frankle

机构 * Databricks AI Research(Databricks人工智能研究)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 KARL通过强化学习训练企业搜索代理,结合多任务学习和定制合成数据,实现高效且高性能的知识代理,在多个复杂任务中表现优异。

Comments 77 pages, 43 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04763 2026-03-06 cs.CV cs.AI cs.LG 73%

Evaluating GPT-5 as a Multimodal Clinical Reasoner: A Landscape Commentary

评估GPT-5作为多模态临床推理者的有效性:领域评论

Alexandru Florea, Shansong Wang, Mingzhe Hu, Qiang Li, Zach Eidex, Luke del Balzo, Mojtaba Safari, Xiaofeng Yang

机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科,Winship癌症研究所,埃默里大学医学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文评估GPT-5在多模态临床推理中的表现,发现其在文本推理和部分视觉问答任务中优于GPT-4o,但在神经放射学和乳腺摄影等专业领域仍显不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03543 2026-03-05 cs.CL cs.AI 73%

Tucano 2 Cool: Better Open Source LLMs for Portuguese

Tucano 2 Cool: 更好的开源葡萄牙语大语言模型

Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Science and Thought(科学与思想研究中心) Helmholtz-Institut für Strahlen- und Kernphysik(亥姆霍兹辐射与核物理研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Tucano 2推出了一系列开源葡萄牙语大语言模型,通过扩展数据集和改进训练方法,实现了在多种语言任务上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00530 2026-03-03 cs.AI cs.CL 73%

CityLens: Evaluating Large Vision-Language Models for Urban Socioeconomic Sensing

CityLens:评估大型视觉-语言模型用于城市社会经济感知

Tianhui Liu, Hetian Pang, Xin Zhang, Tianjian Ouyang, Zhiyuan Zhang, Jie Feng, Yong Li, Pan Hui

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CityLens通过评估大型视觉-语言模型在城市社会经济指标预测中的表现,揭示了其在可持续城市发展中的潜力与局限性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25232 2026-02-24 cs.AI cs.CL 73%

From Medical Records to Diagnostic Dialogues: A Clinical-Grounded Approach and Dataset for Psychiatric Comorbidity

从医疗记录到诊断对话:一种基于临床的途径和数据集用于精神疾病共病

Tianxi Wan, Jiaming Luo, Siyuan Chen, Kunyao Lan, Jianhua Chen, Haiyang Geng, Mengyue Wu

机构 * X - LANCE Lab, Shanghai Jiao Tong University, China(上海交通大学X-LANCE实验室) Shanghai Mental Health Center, SJTU School of Medicine, China(上海精神卫生中心,上海交通大学医学院) Chen Frontier Lab for AI and Mental Health, Tianqiao and Chrissy Chen Institute, Shanghai, China(陈前沿人工智能与心理健康实验室,田青和克里斯蒂娜·陈研究所)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于临床的途径和数据集,用于生成支持精神疾病共病的多轮诊断对话,通过合成患者电子医疗记录和多智能体对话生成技术,构建了首个大规模对话数据集PsyCoTalk,提升了诊断准确性和治疗计划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18776 2026-02-24 cs.CL cs.AI 73%

ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models

阿拉伯数字阅读基准:评估大型语言模型在阿拉伯数字阅读任务中的表现

Anas Alhumud, Abdulaziz Alhammadi, Muhammad Badruddin Khan

机构 * Imam Mohammad Ibn Saud Islamic University Saudi Arabia(伊玛目穆罕默德·本·沙特伊斯兰大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 阿拉伯数字基准评估大型语言模型在阿拉伯数字阅读任务中的表现,揭示不同提示策略和模型在准确率上的显著差异,指出结构化输出生成的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07672 2026-02-17 cs.SE cs.AI cs.LG cs.PL cs.SC 73%

Debugging code world models

调试代码世界模型

Babak Rahmani

机构 * Tübingen AI Center, University of Tübingen, Microsoft Research(图宾根人工智能中心、图宾根大学、微软研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 代码世界模型通过模拟程序执行来预测运行时状态,研究发现其在长周期状态跟踪中存在token预算耗尽和字符串状态处理的局限性,提出改进监督和状态表示的方向。

Comments 8 pages, 4 figures, under review in conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03669 2026-02-17 cs.LG cs.CL 73%

Token Hidden Reward: Steering Exploration-Exploitation in Group Relative Deep Reinforcement Learning

令牌隐藏奖励:在组相对深度强化学习中引导探索-利用

Wenlong Deng, Yi Ren, Yushu Li, Boying Gong, Danica J. Sutherland, Xiaoxiao Li, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Amii(阿米人工智能研究所) UC Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 令牌隐藏奖励通过调整组相对策略优化的学习信号,引导探索-利用平衡,提升大语言模型在推理任务中的表现。

Comments Full version of submission to 2nd AI for Math Workshop@ ICML 2025 (best paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08543 2026-02-16 cs.CL cs.AI cs.IR 73%

GISA: A Benchmark for General Information-Seeking Assistant

GISA:通用信息检索助手的基准测试

Yutao Zhu, Xingshuo Zhang, Maosen Zhang, Jiajie Jin, Liancheng Zhang, Xiaoshuai Song, Kangzhi Zhao, Wencong Zeng, Ruiming Tang, Han Li, Ji-Rong Wen, Zhicheng Dou

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 GISA是一个针对通用信息检索助手的基准测试,包含373个人工设计的查询,旨在评估信息检索任务中深度推理与信息聚合的能力。

Comments Project repo: https://github.com/RUC-NLPIR/GISA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05392 2026-02-06 cs.CL cs.AI 73%

Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances

超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估

Jiyun Chun, Eric Fosler-Lussier, Michael White, Andrew Perrault

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 73%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01675 2026-02-03 cs.AI cs.LG 73%

TRIP-Bench: A Benchmark for Long-Horizon Interactive Agents in Real-World Scenarios

TRIP-Bench:面向现实场景的长周期交互智能体基准

Yuanzhe Shen, Zisu Huang, Zhengyuan Wang, Muzhao Tian, Zhengkang Guo, Chenyang Zhang, Shuaiyu Zhou, Zengjie Hu, Dailin Li, Jingwen Xu, Kaimin Wang, Wenhao Liu, Tianlong Li, Fengpeng Yue, Feng Hong, Cao Liu, Ke Zeng

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Fudan University(复旦大学计算机学院) Dalian University of Technology(大连理工大学) Peking University(北京大学) Wuhan University(武汉大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Bench是一个面向现实场景的长周期交互智能体基准,通过真实旅行规划场景测试多工具推理与约束满足,提出GTPO方法提升智能体鲁棒性与性能。

Comments 40 pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22930 2026-02-02 cs.RO cs.AI cs.LG 73%

MTDrive: Multi-turn Interactive Reinforcement Learning for Autonomous Driving

MTDrive: 多轮交互式强化学习用于自动驾驶

Xidong Li, Mingyu Guo, Chenchao Xu, Bailin Li, Wenjing Zhu, Yangang Zou, Rui Chen, Zehuan Wang

机构 * Li Auto Inc.(利汽车公司) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MTDrive通过多轮交互式强化学习框架,结合多模态大语言模型与强化学习,提升自动驾驶轨迹规划的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22162 2026-02-02 q-fin.GN cs.AI cs.CL 73%

UniFinEval: Towards Unified Evaluation of Financial Multimodal Models across Text, Images and Videos

UniFinEval: 向跨文本、图像和视频的金融多模态模型统一评估迈进

Zhi Yang, Lingfeng Zeng, Fangqi Lou, Qi Qi, Wei Zhang, Zhenyu Wu, Zhenxiong Yu, Jun Han, Zhiheng Jin, Lejie Zhang, Xiaoming Huang, Xiaolong Liang, Zheng Wei, Junbo Zou, Dongpo Cheng, Zhaowei Liu, Xin Guo, Rongjunchen Zhang, Liwen Zhang

机构 * SUFE(上海财经大学) Tencent(腾讯) Gatech(佐治亚理工学院) HiThink Research(慧图研究)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 UniFinEval提出首个统一多模态基准,用于评估金融领域高信息密度下的多模态模型能力,通过五个真实金融场景和大规模数据集验证模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 73%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13717 2026-01-21 cs.CL cs.AI 73%

Simulated Ignorance Fails: A Systematic Study of LLM Behaviors on Forecasting Problems Before Model Knowledge Cutoff

模拟无知失败:在模型知识截止前的预测问题上的系统研究

Zehan Li, Yuxuan Wang, Ali El Lahib, Ying-Jieh Xia, Xinyu Pi

机构 * University of Chicago(芝加哥大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在模型知识截止前的预测问题中,模拟无知方法的局限性,发现其无法有效近似真实无知,且推理链推理和优化模型在抑制先前知识方面存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13368 2026-01-21 cs.CL cs.LG 73%

Recurrent Confidence Chain: Temporal-Aware Uncertainty Quantification in Large Language Models

递归置信链:大型语言模型中的时间感知不确定性量化

Zhenjiang Mao, Anirudhh Venkat

机构 * University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出递归置信链方法,通过跨步骤注意力和隐藏置信机制,提升大型语言模型在不确定性量化中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08176 2026-01-14 cs.CL cs.AI 73%

Prompt-Based Clarity Evaluation and Topic Detection in Political Question Answering

基于提示的清晰度评估与政治问答主题检测

Lavanya Prahallad, Sai Utkarsh Choudarypally, Pragna Prahallad, Pranathi Prahallad

机构 * Research Spark Hub Inc. Emerald High School

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于提示的清晰度评估与政治问答主题检测,发现思维链提示显著提升清晰度和主题识别准确性,但细粒度逃避检测仍具挑战性。

Comments 6 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07877 2026-01-14 cs.LG cs.AI 73%

E^2-LLM: Bridging Neural Signals and Interpretable Affective Analysis

E²-LLM:连接神经信号与可解释的情感分析

Fei Ma, Han Lin, Yifan Xie, Hongwei Ren, Xiaoyu Shen, Wenbo Ding, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所) Huawei(华为)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 E²-LLM通过整合预训练EEG编码器与Qwen-based LLM,实现了可解释的情绪分析,展示了模型扩展在情感识别和可解释性上的优势。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05432 2026-01-12 cs.CV cs.AI cs.CL 73%

Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization

基于地图的思考:用于地理定位的强化并行地图增强智能体

Yuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu, Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09602 2025-12-30 physics.flu-dyn cs.AI cs.CL 73%

Fine-tuning a Large Language Model for Automating Computational Fluid Dynamics Simulations

针对计算流体力学模拟的大型语言模型微调

Zhehao Dong, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 通过微调领域特定LLM,实现从自然语言到CFD模拟配置的自动化,提升复杂工程流程的效率和准确性。

Journal ref Theor. Appl. Mech. Lett. 15, 100594 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11656 2025-12-16 cs.MA cs.AI cs.CL 73%

MALLM: Multi-Agent Large Language Models Framework

MALLM:多智能体大语言模型框架

Jonas Becker, Lars Benedikt Kaesberg, Niklas Bauer, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州实验室)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 MALLM是一个开源框架,通过提供多种配置选项,系统分析多智能体辩论的组件,促进对智能体角色、响应生成器、讨论范式和决策协议的深入理解。

Comments Accepted at EMNLP 2025 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04324 2025-12-05 cs.CL cs.AI 73%

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

DAComp: 在全数据智能生命周期中跨领域评估数据代理

Fangyu Lei, Jinxiang Meng, Yiming Huang, Junjie Zhao, Yitong Zhang, Jianwen Luo, Xin Zou, Ruiyi Yang, Wenbo Shi, Yan Gao, Shizhu He, Zuo Wang, Qian Liu, Yang Wang, Ke Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 DAComp通过210个任务评估数据代理在数据工程与分析中的能力,揭示现有代理在复杂流程编排和开放性推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06540 2025-12-03 cs.LG cs.AI stat.ML 73%

Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families

Sloth: LLM技能的缩放定律用于跨家族预测多基准性能

Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Yuekai Sun, Mikhail Yurochkin

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI实验室,IBM研究) Computer Science and Artificial Intelligence Laboratory, MIT(MIT计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 推理评测 :reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 Sloth提出一种基于低维潜在技能的LLM缩放定律,通过跨基准相关性提升预测准确性,减少多家族训练需求。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01010 2025-12-02 cs.MA cs.AI cs.LG cs.SE physics.comp-ph physics.flu-dyn 73%

Chain of Unit-Physics: A Primitive-Centric Approach to Scientific Code Synthesis

单元物理链:一种以基础原理为中心的科学代码合成方法

Vansh Sharma, Venkat Raman

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出单元物理链框架,通过以基础原理为中心的多代理系统,有效解决科学代码生成中的可靠性问题,实现高精度和高效能的代码生成。

详情

展开后加载摘要…

URL PDF HTML 收藏