arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2608.12150 2026-08-13 cs.AI cs.CL 新提交 62%

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

哪种模型表现最佳取决于你给的时间:大语言模型评估中依赖预算的排名

Rodrigo Guedes de Souza, Alison R. Panisson

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学(UFSC))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过调整 token 生成预算评估 4 个大语言模型在 3 个推理基准的表现,发现模型排名随预算变化反转,提出需采用预算条件化的评估协议。

Comments 19 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11775 2026-08-13 cs.AI cs.CL 新提交 62%

The Sleeping Agent: What Gist-Based Context Compression Loses and Why

休眠智能体:基于主旨的上下文压缩会丢失什么以及为什么

Nicholas E. Kyrkewood

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究以SWC为工具,发现主旨压缩对多跳推理等任务表现优于截断,但会损害时间相关问题的性能,通过修改提示可提升时间问题的评判准确率。

Comments 7 pages, 5 tables, appendices. Code and results at https://github.com/kyrkewood/sleeping-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 62%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11244 2026-08-13 cs.AI cs.CL 新提交 62%

BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model

BEST-KAG:通过多模态知识图谱建模与大语言模型增强建筑工程标准的问答能力

Jia-Rui Lin, Junxi Guo, Keyin Chen, Peng Pan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出BEST-KAG框架,通过多模态知识图谱建模与大语言模型,解决建筑工程标准问答的现有局限,在相关评估指标上优于主流大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12310 2026-08-13 cs.CL cs.AI 版本更新 62%

LakeQuest: A Three-Domain Benchmark for Grounded Question Answering across Data Lakes

LakeQuest:用于跨数据湖的有基础问答的三领域基准测试

Michael Solodko, Steven Gong, Guangwei Yu, Satya Krishna Gorti, Jesse C. Cresswell, Victor Zhong

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍LakeQuest基准测试,用于评估跨数据湖的有基础问答。它跨越三个领域,含9846个QA对及证据指针,能暴露系统故障模式。通过基线评估发现高质量检索不能保证正确推理,凸显未来智能QA系统需强大发现和跨文件组合机制。

Comments 24 pages, 4 figures, 18 tables. Accepted at the Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 62%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 62%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10315 2026-08-12 cs.CL cs.AI 新提交 62%

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量

Siyang Wu, Yibo Jiang, Bryon Aragam

机构 * University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10268 2026-08-12 cs.LG cs.AI cs.CY 新提交 62%

Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

面向大语言模型的人权基准测试:一种试点方法

Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee, Matilda Wysocki, Malcolm Langford, Caitlin Kraft Buchman

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了首个经专家验证的人权基准HumRightsBench,调整IRAC框架为IRAP,通过真实场景测试LLMs的人权推理能力,发现模型准确率差异显著,可推动AI评估科学发展。

Comments Best paper, honorable mention, at the ICML 2026 Workshop on AI4Law, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00135 2026-08-12 cs.LG cs.AI 版本更新 62%

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

论智能体工具调用与强化学习训练的有效性与效率

Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13201 2026-08-12 cs.CL cs.AI 版本更新 62%

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

InfiniteScienceGym:一个无界的、程序生成的科学分析基准

Oliver Bentham, Vivek Srikumar

机构 * Kahlert School of Computing(卡勒特计算学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfiniteScienceGym,通过程序生成科学仓库和可验证问答任务,评估证据推理、回避和工具分析能力,发现现有模型在回答不可答问题上存在显著缺陷。

Comments 31 pages, 5 figures, 8 tables. Accepted to COLM 2026. See https://infinitesciencegym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06336 2026-08-12 cs.LG cs.AI 版本更新 62%

BiScale-GTR: Fragment-Aware Graph Transformers for Multi-Scale Molecular Representation Learning

BiScale-GTR:基于多尺度分子表示学习的片段感知图变换器

Yi Yang, Ovidiu Daescu

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 BiScale-GTR通过结合化学基础的片段分词与自适应多尺度推理,改进了图变换器的分子表示学习,提升了对局部化学环境、子结构特征和长程依赖关系的联合捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25251 2026-08-12 cs.HC cs.AI cs.LG 版本更新 62%

Does Explanation Correctness Matter? Linking Computational XAI Evaluation to Human Understanding

解释正确性是否重要?将计算XAI评估与人类理解联系起来

Gregor Baer, Chao Zhang, Isel Grau, Pieter Van Gorp

机构 * Information Systems Group, Eindhoven University of Technology(埃因霍温理工大学信息系统组) Human-Technology Interaction Group, Eindhoven University of Technology(埃因霍温理工大学人机交互组)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过用户实验检验解释正确性对人类理解的影响,发现正确性降低时理解性能下降,但并非所有正确性水平均导致性能下降,且完全正确解释也不保证理解。

Comments 31 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03922 2026-08-12 cs.CL cs.AI cs.CV 版本更新 62%

HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Models

HSSBench: 多模态大语言模型在人文学与社会科学能力评估中的基准测试

Zhaolu Kang, Junhao Gong, Jiaxu Yan, Wanke Xia, Yian Wang, Ziwen Wang, Huaxuan Ding, Zhuo Cheng, Wenhao Cao, Zhiyuan Feng, Siqi He, Shannan Yan, Junzhe Chen, Xiaomin He, Chaoya Jiang, Wei Ye, Kaidong Yu, Xuelong Li

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) University of British Columbia(不列颠哥伦比亚大学) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HSSBench是一个专门评估多模态大语言模型在人文学与社会科学任务能力的基准测试,包含多语言样本,通过协作生成数据提升跨学科推理能力。

Comments ICLR 2026 (OpenReview: https://openreview.net/forum?id=iQsKotob31)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09393 2026-08-11 cs.CL cs.AI cs.IR 新提交 62%

Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

法律检索增强生成(RAG)中的时间错位:面向法国税法的版本化语料库基准

Rose Cymbler, Daniel Guez, Laurent Fabre

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律RAG的时间错位问题,构建法国税法版本化语料库基准FiscalQA Pro,发现现有模型时间推理能力差,端到端多版本检索器性能优异,还发布了相关数据集与代码。

Comments 13 pages, 1 figure, 4 tables. Accepted at the ICML 2026 Workshop on AI for Law (AI4Law), Seoul. Code and data: https://github.com/rosecymbler/fiscal-fr-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08634 2026-08-11 cs.AI cs.CL cs.IR q-fin.GN 新提交 62%

Can Open-Weight Models Compete on Financial Text Comprehension?

开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?

Jan Spörer

机构 * University of St. Gallen(圣加仑大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。

Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08176 2026-08-11 cs.AI cs.LG 新提交 62%

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

匹配监督与学生学习能力:一种用于在线自蒸馏的统一框架

Yongkang Yang, Zhezheng Hao, Hong Zhang, Yi Liu, Xiankun Lin, Wence Ji, Fanjunduo Wei, Jiarui Yu, Qiang Lin, Xiaoyun Liang, Hande Dong

机构 * Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文针对在线自蒸馏的次优问题,提出统一在线自蒸馏(USD)框架,该框架通过耦合学习难度预算与师生 divergence,在多模型规模及推理基准上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 62%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 62%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06123 2026-08-11 cs.AI cs.CL 版本更新 62%

Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

Poli-Bias:理解与测量大型语言模型在国际政治冲突中的偏差

Massi-Nissa Abboud, Aladin Djuhera, Elena Cabrio, Holger Boche

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出细粒度反事实框架Poli-Bias,通过交换国家身份的成对提示对比响应,分解偏差维度,发现13个LLMs存在因国家身份导致的政治偏差,可用于审计LLMs的政治公正性与谄媚性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26368 2026-08-11 cs.CL cs.AI 版本更新 62%

Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text

金融披露文本中的细粒度不一致分类诊断

Aman Kumar, Lasitha Vidyaratne, Dipanjan D Ghosh, Arnab Chakrabarti, Ahmed K Farahat

机构 * Hitachi America, Ltd(美国日立公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对金融披露文本的细粒度不一致分类问题,在SBID-FD基准上对比多种模型,发现紧凑型监督编码器效率较高,证据定位是关键瓶颈,需同时提升证据提取与类别推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26937 2026-08-11 cs.CL cs.AI 版本更新 62%

Beyond Questions: Evaluating LLM's Knowledge Expression

超越问题:评估大型语言模型(实际)知道什么

Luca Giordano, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(ScaDS.AI 德尔布兰德/莱比锡及德累斯顿技术大学,德国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出开放知识评估新范式,通过开放式提示(如“告诉我关于M.L. King的一切”)评估模型自然表达的知识,并构建BeQu基准测试10,000个实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23878 2026-08-11 cs.AI cs.LG 版本更新 62%

ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems

ZenBrain:一种受神经科学启发的7层记忆架构用于自主AI系统

Alexander Bering

机构 * Zensation AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ZenBrain提出一种7层神经科学启发的记忆架构,通过整合15种验证的神经科学机制,在LongMemEval-500任务中实现了与长上下文Oracle的二元判断准确率接近,并在多个指标上优于现有系统。

Comments 48 pages, 27 tables, 4 figures. v3 is a correction release: a full source-verification pass over all 83 references corrects 30 defective entries and withdraws two ancillary evaluations run on synthetic stand-in data; no measured numbers changed. Changelog: 10.5281/zenodo.21858218. Earlier versions: Zenodo concept DOI 10.5281/zenodo.19353663, TDCommons dpubs_series/9683

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11687 2026-08-11 cs.SE cs.CL cs.LG 版本更新 62%

MetaLint: Easy-to-Hard Generalization for Code Linting

MetaLint: 代码检查的易到难泛化

Atharva Naik, Lawanya Baghel, Dhakshin Govindarajan, Darsh Agrawal, Yiqing Xie, Daniel Fried, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 MetaLint通过元学习框架将代码检查转化为指令遵循任务,能根据自然语言规范评估代码是否符合最佳实践,实现无需重新训练的泛化能力,且在不同编程语言和场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 62%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15701 2026-08-11 cs.AI cs.CL cs.HC 62%

Collaborative Gym: A Framework for Enabling and Evaluating Human-Agent Collaboration

协作健身房:一种促进和评估人机协作的框架

Yijia Shao, Vinay Samuel, Yucheng Jiang, John Yang, Diyi Yang

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 Co-Gym框架通过模拟和真实环境支持人机协作研究,展示协作代理在任务性能上的优势,同时揭示当前语言模型的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00549 2026-08-11 cs.CL cs.AI 62%

Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages

Hyangsuk Min, Yuho Lee, Minjeong Ban, Jiaqi Deng, Nicole Hee-Yeon Kim, Taewon Yun, Hang Su, Jason Cai, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院) AWS AI Labs(AWS人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 34 pages, 6 figures

Journal ref ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 62%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06961 2026-08-10 cs.AI cs.LG 新提交 62%

CAi Copilot: Reducing Operational Workload in Molecular Design through Intent-Driven Agentic Workflows

CAi Copilot:通过意图驱动的智能体工作流减少分子设计中的操作工作量

Zhu Wang, Jiangyu Chen, Yingjun Shang, Yuhui Yao, Laiao Lu, Tianfan Fu, Na Zou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CAi Copilot是面向专家的意图驱动智能体,通过三层架构整合分子设计分散工具,在45项任务中整体性能最优,得分84.59,可将设计意图转化为可追溯工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06501 2026-08-10 cs.AI cs.CL cs.MM 新提交 62%

Can MLLMs Decode the Creative Leap? Introducing C4 for Cross-Concept Understanding

多模态大语言模型(MLLMs)能否解码创造性飞跃?推出面向跨概念理解的C4框架

Ming Wang, Yuqing Zhang, Tingna Xie, Xiangju Li, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) School of Computer Science and Engineering, Shandong University of Science and Technology(山东科技大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出受认知启发的C4成语跨概念创造力评估框架,构建含884个案例的C4-Eval集,评估10款MLLMs发现闭源模型准确率最高达50.7%,揭示当前MLLMs创造性解码能力存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏