arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-25 至 2026-02-25 共收录 207 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 50 篇

2602.20224 2026-02-25 cs.LG cs.AI cs.CL 86%

Exploring Anti-Aging Literature via ConvexTopics and Large Language Models

通过凸优化和大语言模型探索抗衰老文献

Lana E. Yeganova, Won G. Kim, Shubo Tian, Natalie Xie, Donald C. Comeau, W. John Wilbur, Zhiyong Lu

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于凸优化和大语言模型的抗衰老文献主题建模方法,通过稳定且细粒度的主题发现,提升可解释性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01012 2026-02-25 cs.AI 85%

AutoEDA: Enabling EDA Flow Automation through Microservice-Based LLM Agents

AutoEDA:通过基于微服务的LLM代理实现EDA流程自动化

Yiyi Lu, Hoi Ian Au, Junyao Zhang, Jingyu Pan, Guanglei Zhou, Yiting Wang, Jingwei Sun, Ang Li, Jianyi Zhang, Hai Li, Yiran Chen

机构 * Duke University(杜克大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AutoEDA通过基于微服务的LLM代理实现EDA流程自动化,利用MCP协议提升交互可靠性,并通过本地微调模型和定制评估方法提高准确性与保密性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20683 2026-02-25 eess.SY cs.SY 85%

Grid-Mind: An LLM-Orchestrated Multi-Fidelity Agent for Automated Connection Impact Assessment

Grid-Mind: 一种基于LLM的多保真度代理用于自动化连接影响评估

Mohamed Shamseldein

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Grid-Mind是一种基于LLM的多保真度代理,通过自主协调电力系统模拟,实现自动化连接影响评估,具有高准确率和自我纠正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10385 2026-02-25 cs.CL cs.AI cs.IR cs.LG 85%

Augmenting Lateral Thinking in Language Models with Humor and Riddle Data for the BRAINTEASER Task

通过幽默和谜语数据增强语言模型的横向思维以完成BRAINTEASER任务

Mina Ghashami, Soumya Smruti Mishra

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入幽默和谜语数据增强语言模型,提升其在BRAINTEASER任务中的横向推理能力,提高句子谜题和词语谜题的准确率。

Comments Accepted at SemEval 2024 (Colocated with NAACL 2024)

Journal ref Proceedings of the 18th International Workshop on Semantic Evaluation (SemEval-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 84%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20901 2026-02-25 cs.CV cs.LG 83%

SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models

SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准

Yuechen Xie, Xiaoyan Zhang, Yicheng Shan, Hao Zhu, Rui Tang, Rong Wei, Mingli Song, Yuanyu Wan, Jie Song

机构 * Zhejiang University(浙江大学) The University of Sydney(悉尼大学) ManyCore State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10720 2026-02-25 cs.CV 82%

Ecological mapping with geospatial foundation models

基于地理空间基础模型的生态制图

Craig Mahlasi, Gciniwe S. Baloyi, Zaheed Gaffoor, Levente Klein, Anne Jones, Etienne Vos, Michal Muszynski, Geoffrey Dawson, Campbell Watson

机构 * IBM Research(IBM研究) IBM Sustainability Software(IBM可持续性软件)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究通过微调Prithvi-EO-2.0和TerraMind模型,在生态制图任务中展示了优于ResNet基线的性能,强调了数据对齐和高分辨率输入的重要性。

Comments Revised abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20658 2026-02-25 cs.CV cs.AI cs.HC cs.LG 81%

Vision-Language Models for Ergonomic Assessment of Manual Lifting Tasks: Estimating Horizontal and Vertical Hand Distances from RGB Video

用于手动搬运任务的视觉-语言模型:从RGB视频估计水平和垂直手距

Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim, Maury A. Nussbaum

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用视觉-语言模型从RGB视频中非侵入性估计搬运任务的水平和垂直手距,通过两种多阶段管道验证了该方法的可行性,并展示了分割技术在减少误差方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21143 2026-02-25 cs.AI cs.CL cs.IR cs.LG 80%

A Benchmark for Deep Information Synthesis

深度信息合成的基准测试

Debjit Paul, Daniel Murphy, Milan Gritta, Ronald Cardenas, Victor Prokhorov, Lena Sophia Bolliger, Aysim Toker, Roy Miles, Andreea-Maria Oncescu, Jasivan Alex Sivakumar, Philipp Borchert, Ismail Elezi, Meiru Zhang, Ka Yiu Lee, Guchun Zhang, Jun Wang, Gerasimos Lampouras

机构 * Huawei Noah’s Ark Lab, UK(华为诺亚实验室,英国) Imperial College London(伦敦帝国理工学院) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心) University of Zurich(苏黎世大学) University of Sheffield(谢菲尔德大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DEEPSYNTH是一个评估智能体在复杂任务中信息合成与推理能力的新基准测试,通过多阶段数据收集流程和120个跨7个领域的任务,评估LLM在现实问题中的表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20752 2026-02-25 cs.CV cs.AI 79%

OrthoDiffusion: A Generalizable Multi-Task Diffusion Foundation Model for Musculoskeletal MRI Interpretation

OrthoDiffusion:一种通用的多任务扩散基础模型用于骨科MRI解释

Tian Lan, Lei Xu, Zimu Yuan, Shanggui Liu, Jiajun Liu, Jiaxin Liu, Weilai Xiang, Hongyu Yang, Dong Jiang, Jianxin Yin, Dingyu Wang

机构 * Center for Applied Statistics and School of Statistics(应用统计中心和统计学院) Renmin University of China(中国人民大学) Institute of Sports Medicine of Peking University(北京大学运动医学研究所) Beijing Key Laboratory of Research and Translation for Drugs and Medical Devices in Precision Diagnosis and Treatment of Sports Injuries(北京体育损伤精准诊断与治疗药物与医疗设备研究翻译重点实验室) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 OrthoDiffusion是一种基于扩散的多任务基础模型,通过自监督学习在膝关节MRI上预训练,实现11种结构分割和8种异常检测,具有跨关节的高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22620 2026-02-25 cs.CR cs.AI cs.LG 79%

Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents

打破代理骨干:评估AI代理中骨干LLM的安全性

Julia Bazinska, Max Mathys, Francesco Casucci, Mateo Rojas-Carulla, Xander Davies, Alexandra Souly, Niklas Pfister

机构 * Lakera AI ETH Zürich(苏黎世联邦理工学院) UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML,牛津大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出威胁快照框架,用于评估AI代理中LLM骨干的安全性,通过构建$b^3$基准测试揭示LLM安全性的关键影响因素。

Comments Julia Bazinska and Max Mathys contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03043 2026-02-25 cs.CL cs.AI cs.SD eess.AS 79%

K-Function: Joint Pronunciation Transcription and Feedback for Evaluating Kids Language Function

K-Function:儿童语言功能的联合发音转录与评估反馈

Shuhe Li, Chenxu Guo, Jiachen Lian, Cheol Jun Cho, Wenshuo Zhao, Xiner Xu, Ruiyu Jin, Xiaoyu Shi, Xuanru Zhou, Dingkun Zhou, Sam Wang, Grace Wang, Jingze Yang, Jingyi Xu, Ruohan Bao, Xingrui Chen, Elise Brenner, Brandon In, Francesca Pei, Maria Luisa Gorno-Tempini, Gopala Anumanchipalli

机构 * Zhejiang University(浙江大学) UC Berkeley(加州大学伯克利分校) Duke University(达特茅斯大学) SCUT(上海交通大学) TVT UCSF(加州大学旧金山分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 K-Function通过结合子词转录与LLM评分,提升儿童语音识别精度,实现高效的语言功能评估。

Comments Accepted to 2026 ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-02-25 cs.CV 78%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20873 2026-02-25 cs.CV 75%

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22500 2026-02-25 cs.LG cs.AI cs.CL 75%

Towards Scalable Oversight via Partitioned Human Supervision

通过分区人类监督实现可扩展的监督

Ren Yin, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分区人类监督实现可扩展的监督,利用互补标签评估和训练AI系统。

Comments ICLR 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20867 2026-02-25 cs.CR cs.AI cs.CE cs.ET 74%

SoK: Agentic Skills -- Beyond Tool Use in LLM Agents

SoK: 代理技能——超越LLM代理中的工具使用

Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu

机构 * University of Technology Sydney(悉尼科技大学) CSIRO Data61(CSIRO数据61)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21054 2026-02-25 cs.CV cs.AI cs.CL 73%

VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation

VAUQ:面向LVLM自评估的视觉感知不确定性量化

Seongheon Park, Changdae Oh, Hyeong Kyu Choi, Xuefeng Du, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VAUQ通过引入图像信息分数和核心区域遮蔽策略,实现对LVLM自评估的视觉感知不确定性量化,有效提升模型输出的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 73%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20937 2026-02-25 cs.LG 70%

Extending $μ$P: Spectral Conditions for Feature Learning Across Optimizers

扩展μP:跨优化器的特征学习谱条件

Akshita Gupta, Marieme Ngom, Sam Foreman, Venkatram Vishwanath

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种新的框架,用于推导更广泛优化器类别的μP,实现了跨优化器的零样本学习率转移和深度缩放参数化。

Comments 10 main pages, 16 appendix pages and 17 figures; Amended version of the publication in 17th International OPT Workshop on Optimization for Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12876 2026-02-25 cs.AI 70%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23587 2026-02-25 cs.DB cs.AI 70%

A Survey of Data Agents: Emerging Paradigm or Overstated Hype?

数据代理的综述:新兴范式还是过度炒作?

Yizhang Zhu, Liangwei Wang, Chenyu Yang, Xiaotian Lin, Boyan Li, Wei Zhou, Xinyu Liu, Zhangyang Peng, Tianqi Luo, Yu Li, Chengliang Chai, Chong Chen, Shimin Di, Ju Fan, Ji Sun, Nan Tang, Fugee Tsung, Jiannan Wang, Chenglin Wu, Yanwei Xu, Shaolei Zhang, Yong Zhang, Xuanhe Zhou, Guoliang Li, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Beijing Institute of Technology(北京理工大学) Southeast University(东南大学) Tsinghua University(清华大学) Huawei(华为) DeepWisdom

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统梳理了数据代理的分类与演变,提出分层框架并分析其技术发展与未来方向。

Comments Please refer to our paper list and companion materials at: https://github.com/HKUSTDial/awesome-data-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20813 2026-02-25 cs.AI 70%

Pressure Reveals Character: Behavioural Alignment Evaluation at Depth

压力揭示特性:深度下的行为对齐评估

Nora Petrova, John Burden

机构 * Prolific

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个深度行为对齐评估基准,通过多轮场景揭示模型行为倾向,发现多数模型在多个类别存在弱点,且对齐行为呈现统一构念特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20720 2026-02-25 cs.CR cs.AI 70%

AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs

AdapTools: 面向代理LLM的自适应工具间接提示注入攻击

Che Wang, Jiaming Zhang, Ziqi Zhang, Zijie Wang, Yinghui Wang, Jianbo Gao, Tao Wei, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, Singapore(数据科学,南洋理工大学,新加坡) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AdapTools通过自适应工具和提示生成,提升间接提示注入攻击成功率2.13倍,同时降低系统效用1.78倍,有效应对现代AI代理的快速演变特性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 70%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18701 2026-02-25 cs.CV 67%

UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation

UniGenBench++: 一个统一的语义评估基准用于文本到图像生成

Yibin Wang, Zhimin Li, Yuhang Zang, Jiazi Bu, Yujie Zhou, Yi Xin, Junjun He, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 UniGenBench++ 提出一个统一的语义评估基准,涵盖多样化的现实场景和多语言支持,用于评估文本到图像生成模型的语义一致性。

Comments Project page: codegoat24.github.io/UniGenBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08810 2026-02-25 cs.SE 67%

MigrateLib: a tool for end-to-end Python library migration

MigrateLib: 一种用于端到端Python库迁移的工具

Mohayeminul Islam, Ajay Kumar Jha, May Mahmoud, Sarah Nadi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 MigrateLib利用大型语言模型、静态分析和动态分析,实现端到端的Python库迁移,能准确迁移32%的迁移任务。

Comments arXiv admin note: text overlap with arXiv:2504.13272

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20400 2026-02-25 cs.LG cs.AI 62%

Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation

三个具体挑战和两个希望:对无监督引导的安全性

Callum Canavan, Aditya Shrivastava, Allison Qi, Jonathan Michala, Fabien Roger

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了无监督引导技术在面对特定数据集挑战时的局限性,并提出了未来研究的优先方向。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21046 2026-02-25 cs.LG 57%

PIME: Prototype-based Interpretable MCTS-Enhanced Brain Network Analysis for Disorder Diagnosis

PIME: 基于原型的可解释MCTS增强脑网络分析用于疾病诊断

Kunyu Zhang, Yanwu Yang, Jing Zhang, Xiangjie Shi, Shujian Yu

机构 * Zhengzhou University, Zhengzhou, China(郑州大学) China University of Geosciences, Wuhan, China(中国地质大学(武汉)) University of Science and Technology Beijing, Beijing, China(北京科技大学) Vrije Universiteit Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹自由大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 PIME通过整合原型分类和一致性训练,利用MCTS提取紧凑的最小充分解释子图,实现脑网络分析的可解释性与高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20892 2026-02-25 cs.CL 57%

Exa-PSD: a new Persian sentiment analysis dataset on Twitter

Exa-PSD:一个用于推特的波斯语情感分析新数据集

Seyed Himan Ghaderi, Saeed Sarbazi Azad, Mohammad Mehdi Jaziriyan, Ahmad Akbari

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出Exa-PSD数据集,用于波斯语推特情感分析,包含12,000条推文,通过Pars Bert和Roberta模型评估,达到79.87宏F分数。

Comments This is the original submitted (preprint) version of a paper published in Language Resources and Evaluation. The final published version is available at Springer via DOI: https://doi.org/10.1007/s10579-025-09886-5

Journal ref Lang Resources & Evaluation 60, 6 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20687 2026-02-25 cs.AI 57%

How Foundational Skills Influence VLM-based Embodied Agents:A Native Perspective

基础技能如何影响基于VLM的具身体验代理:一种原生视角

Bo Peng, Pi Bu, Keyu Pan, Xinrun Xu, Yinxiu Zhao, Miao Chen, Yang Du, Lin Li, Jun Song, Tong Xu

机构 * Alibaba-inc(阿里巴巴集团)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出NativeEmbodied基准测试,通过统一的原生低级动作空间评估VLM驱动具身体验代理的综合性能,并揭示基础技能缺陷对高级任务性能的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏