arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-27 至 2026-08-27 共收录 408 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 91 篇

2603.29122 2026-08-27 cs.SE 版本更新 82%

ReLog: Execution-Aware Logging with Runtime Feedback for LLM-Oriented Debugging

为LLMs实现人类级日志记录:通过执行和运行时反馈重新思考日志记录

Xin Wang, Yang Feng, Xiaoqian Jiao, Yang Zhang, Zhenhao Li, Zishuo Ding

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出ReLog框架,通过运行时反馈迭代生成日志,提升日志在下游任务中的实用性,实验表明其在缺陷定位和修复任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15857 2026-08-27 cs.AI cs.LG cs.RO 版本更新 81%

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

正则化潜在动态预测是行为基础模型的强基线

Pranaya Jajoo, Harshit Sikchi, Siddhant Agarwal, Amy Zhang, Scott Niekum, Martha White

机构 * Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨零样本强化学习中复杂表征学习目标的必要性,提出正则化潜在动态预测方法,通过正则化保持特征多样性,优于现有方法,并在低覆盖场景中表现优异。

Comments ICLR 2026 Update 08/25/2026: (i) Fixed a typo in eq. 7. (ii) Updated lemma 1 to a stronger bound for RLDP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25244 2026-08-27 cs.SD 新提交 80%

AllMusicCaps: Album Reviews as Complementary Supervision for Music CLAP

AllMusicCaps:将专辑评论作为Music CLAP的补充监督

Pablo Alonso-Jiménez, Xavier Lizarraga-Seijas, Xavier Serra, Dmitry Bogdanov

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究提出AllMusicCaps,利用AllMusic专家专辑评论经LLM预处理构建标题语料库,结合SigReg正则化优化CLAP模型,提升了文本到音乐检索等任务性能并发布相关资源。

Comments Accepted at ISMIR 2026. Code, weights, and data available at https://github.com/MTG/allmusiccaps

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11051 2026-08-27 cs.IR cs.AI cs.CL cs.LG 版本更新 80%

OpenSanctions Pairs: Large-Scale Entity Matching with LLMs

OpenSanctions Pairs:基于大语言模型的大规模实体匹配

Chandler Smith, Magnus Sesodia, Friedrich Lindenberg, Christian Schroeder de Witt

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 OpenSanctions Pairs通过对比LLM与规则基础匹配器,展示了LLM在实体匹配任务中的优越性能,并揭示了规则系统与LLM在失败模式上的互补性,推动了合规流程中更高效的管道组件开发。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25893 2026-08-27 cs.LG 新提交 79%

A General-Purpose Molecular Foundation Model Transfers Across Diverse Olfactory Tasks

可跨多种嗅觉任务迁移的通用分子基础模型

Yikun Han, Yi Wang, Neil Mankodi, Stephen Yang, Ambuj Tewari

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究在单一嗅觉任务上微调的Uni-Mol2能否跨多种机器嗅觉任务迁移,发现其性能与专用基线相当且可稳定迁移,三维表征能区分镜像分子,支持机器嗅觉的跨任务迁移范式。

Comments 18 pages, 6 figures. Supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25148 2026-08-27 cs.CV cs.AI q-bio.QM 新提交 79%

Can You Trust Frozen Hematology Foundation Models under Acquisition Shift?

在采集分布偏移下你能信任冻结的血液学基础模型吗?

Jai Kumar Sharma, Peeyush Tapadiya

机构 * Virginia Tech(弗吉尼亚理工大学) Accenture(埃森哲)

专题命中 评测与基准 :foundation model(title);pretraining(abstract);分类 cs.AI

AI总结 该研究审计15种冻结编码器在采集分布偏移下的鲁棒性,发现跨域性能骤降,提出CBR方法改善部分场景,强调血液学FM基准需同时审计准确率、校准等多维度指标。

Comments Accepted at the HemaRAI 2026 workshop (MICCAI 2026 satellite event), oral presentation; to appear in MICCAI 2026 Satellite Events, LNCS, Springer. 25 pages (10 main incl. references + 15 supplementary), 4 figures. Project page: https://jaishrm07.github.io/hematology-fm-robustness/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25858 2026-08-27 cs.CV cs.LG physics.ao-ph 新提交 79%

Precipitation Downscaling Using Foundation Model-Conditioned Diffusion

基于基础模型条件扩散的降水降尺度方法

Victor Nascimento Ribeiro, Jorge Guevara, Jorge Sebastian Moraga, Chris Lucas, Natalie Lord, Andrew Taylor, Edward Lockhart, Will Trojak, Johannes Schmude, Anne Jones

机构 * IBM Research(IBM研究院) Fathom STFC Hartree Centre(STFC哈特雷中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究针对降水降尺度问题,探究三种扩散模型条件策略,发现交叉注意力条件优于通道拼接,且Prithvi WxC基础模型在数据有限场景下性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-08-27 cs.CR cs.AI 版本更新 79%

APPA: Recoverable Information-Flow Control for Real-World LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments 21 pages, 3 figures. v2: Major revision with updated title, MCP protocol gateway architecture, 3-model empirical benchmark (6,600 episodes), recovery ablations, gradual security typing, and complete formal safety proofs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14480 2026-08-27 cs.CL 版本更新 79%

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators

语言模型评估器在不同语言间存在偏差

Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Language Technology Lab(语言技术实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30865 2026-08-27 cs.LG 版本更新 79%

GlucoFM: A Dual-Stream Foundation Model for Continuous Glucose Monitoring

GlucoFM: 一种用于连续血糖监测的双流基础模型

Zechen Li, Keerthana Natarajan, Weizhi Zhang, Menglian Zhou, Simon A. Lee, Yuwei Zhang, Maxwell A. Xu, Zeinab Esmaeilpour, Flora D. Salim, Mark Malhotra, Lindsey Sunden, Shwetak Patel, Yuzhe Yang, Ahmed A. Metwally

机构 * Google Research(谷歌研究) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 提出GlucoFM,一种轻量级CGM基础模型,通过将血糖动态分解为慢生理状态和瞬态事件流,在7个临床预测任务上平均PR-AUC比最佳CGM专用模型提高4.1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-27 cs.CV 版本更新 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-08-27 cs.CV 版本更新 78%

Lost in Motion: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Elena Merino-Gómez, Pedro Reviriego

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25667 2026-08-27 cs.CR cs.AI 新提交 77%

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

漏洞评估中的AI垃圾内容与幻觉:关于推理失败及可信缓解措施的综述

Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本综述针对LLMs用于漏洞评估时产生的AI垃圾内容与幻觉问题,分析其源于专家演绎推理与LLMs自回归生成的差距,提出神经符号验证等缓解方案及CVE-Bench等评估工具,为AI驱动的安全分诊系统提供路线图。

Comments Accepted to SiMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24910 2026-08-27 cs.HC cs.AI 新提交 77%

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction

从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础

Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25934 2026-08-27 cs.AI cs.LG 新提交 73%

How Robust Are Automated Fact-Checking Systems? A Cross-Benchmark Evaluation

自动事实核查系统的鲁棒性如何?跨基准评估

Aida Usmanova, Zangir Iklassov, Markus Leippold, Ricardo Usbeck

机构 * Leuphana University of Lüneburg(吕讷堡勒芬纳大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究对九种模型在四个跨领域数据集上开展自动事实核查系统的跨基准评估,发现系统性能依赖领域与指标,检索是主要瓶颈,并发布资源支持可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25854 2026-08-27 cs.CL cs.LG 新提交 73%

Key Point Analysis Needs Structure Recovery: Task Definition, Dataset Diagnosis, and a Structure-Aware Benchmark

关键点分析需要结构恢复:任务定义、数据集诊断及结构感知基准

Zhiqiang Shi, Oana Cocarascu

机构 * King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究定义关键点分析(KPA)为结构化预测问题,诊断现有KPA基准缺陷,构建人机协同标注的结构感知基准并发布相关资源,为KPA研究提供支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25741 2026-08-27 cs.LG cs.CL 新提交 73%

Why Does Graph Learning Fail to Fully Benefit from a Text Teacher?

为何图学习无法充分受益于文本教师?

Fumiaki Kimino, Ryoma Sato

机构 * SOKENDAI(总研究大学院大学) National Institute of Informatics(情报学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对结合自监督GNN与交替优化语言模型的多模态图学习模型未充分提升性能的问题,分析了六个关键影响因素并通过分阶段实验验证。

Comments 21 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25569 2026-08-27 cs.CL cs.AI 新提交 73%

Controllable Affective Generation via Latent Vector Steering

基于潜在向量调控的可控情感生成

Xixian Yong, Siyuan Chang, Yingying Zhang, Xian Wu, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐后情感响应平淡的问题,提出轻量框架EmoVec,通过调控潜在向量实现可控情感生成,实验验证其能提升情感显著性且保留语义等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25158 2026-08-27 cs.AI cs.CR cs.LG cs.SE 新提交 73%

FuzzingBrain-Bench V1: Evaluating Open-Ended Bug Discovery by LLMs

FuzzingBrain-Bench V1:评估大语言模型的开放式漏洞发现能力

Ze Sheng, Aleksandar Kezic, Zhicheng Chen, Jeff Huang

机构 * Texas A&M University(得克萨斯农工大学) University of Novi Sad(诺威萨大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FuzzingBrain-Bench V1基准,评估Claude系列大模型的开源软件漏洞发现能力,其中Claude Opus 4.8表现最佳,在77项挑战中60项触发崩溃,得196分。

Comments 21 pages, 12 figures, 7 tables. Ze Sheng and Aleksandar Kezic contributed equally. Benchmark corpus and harnesses: https://github.com/fuzzingbrain/FuzzingBrain-Bench Counts verified against the built PDF and sources: 21 pages, 12 figure environments, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24977 2026-08-27 cs.CR cs.CL cs.LG 新提交 73%

Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation

可检索但不可靠:检索增强生成中的攻击与防御研究综述

Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Hoang D. Nguyen, Thanh Le, Suhang Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本综述针对检索增强生成(RAG)的安全与鲁棒性问题,形式化其各阶段威胁模型,分类攻击目标并梳理各阶段防御及评估方法,为该领域提供统一研究框架。

Comments 24 pages, 6 figures. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Peer-reviewed through ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24937 2026-08-27 cs.LG cs.AI 新提交 73%

Multi-Modal Anomaly Detection: A Survey

多模态异常检测:一项综述

Xudong Mou, Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu, Chunming Hu, Renyu Yang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Shandong Inspur Intelligent Production Technology Co., Ltd(山东浪潮智能生产技术有限公司)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该综述从假设驱动视角梳理多模态异常检测(MMAD),划分两种互补方法范式,探讨基础模型对MMAD的重塑,汇总基准与评估协议并指出未来方向。

Comments Accepted for publication in IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11635 2026-08-27 cs.CY cs.AI cs.CL 版本更新 73%

EduAgentQG: Multi-Agent Personalized Mathematics Question Generation with Explicit Diversity and Objective-Aware Evaluation

EduAgentQG:具有显式多样性和目标感知评估的多智能体个性化数学问题生成

Rui Jia, Min Zhang, Fengrui Liu, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Shanghai Institute of Al for Education(上海人工智能教育研究院) The Chinese University of Hong Kong, Shenzhen School of Data Science(香港中文大学(深圳)数据科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文针对现有数学问题生成方法难以兼顾目标对齐与可控多样性的问题,提出多智能体框架EduAgentQG,构建专属基准并验证其在多项指标上优于COT等基线方法。

Comments Accepted to IPM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22188 2026-08-27 cs.MA 版本更新 71%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnikov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 评测与基准 :LLM(title)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25986 2026-08-27 cs.AI 新提交 70%

Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

面向多模态知识图谱的多粒度上下文增强检索增强生成

Zongyu Wu, Yilong Wang, Xiaochen Wang, Minhua Lin, Zhichao Xu, Fenglong Ma, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Utah(犹他大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有多模态知识图谱RAG方法的语义鸿沟问题,本文提出CEMMKG框架,通过多粒度局部与全局上下文增强,有效提升了多模态GraphRAG的性能与适用性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25775 2026-08-27 cs.AI 新提交 70%

ToST: A Tree-of-Thought Socratic Teaching Framework for Multi-Path Guidance and Parallel Thinking

ToST:用于多路径引导与并行思考的思维树式苏格拉底教学框架

Feng Ling, Heng Yu

机构 * Beijing Normal University(北京师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出ToST框架,采用多路径范式与并行策略,建立MPSG-Bench基准,可提升LLMs苏格拉底教学的引导成功率,助力学生探索多解决方案路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 70%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25466 2026-08-27 cs.NE cs.AI 新提交 70%

Homo-RAG: Homology-Guided Retrieval-Augmented Generation for Cross-Species Gene Function Prediction

Homo-RAG:基于同源性引导检索增强生成的跨物种基因功能预测

Azrin Sultana

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出Homo-RAG框架,整合同源性引导多跳检索与证据感知排序,实现跨物种基因功能预测,在150个查询及7200份文档的评估中表现优异,为未充分研究生物的基因功能注释提供了实用方案。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25398 2026-08-27 cs.CL 新提交 70%

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24903 2026-08-27 cs.HC cs.LG 新提交 70%

Evidence-Grounded Mapping of Multimodal Human Sensing Psychological Transdiagnostic Dimensions

基于证据的多模态人体感知心理跨诊断维度映射

Xiyun Hu, Xiangyuan Xue, Yuting Lyu, Hanya Shao, Jingping Nie

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出临床医生参与的基准,评估LLMs能否从多模态证据生成B-HiTOP条目画像,发现两阶段预测可提升部分证据的兼容性,但语义抽象会成为间接行为传感的信息瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph math.MP 新提交 70%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏