arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 116 篇

2602.02034 2026-02-03 cs.AI 77%

Constrained Process Maps for Multi-Agent Generative AI Workflows

多代理生成AI工作流的约束过程图

Ananya Joshi, Michael Rudow

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01714 2026-02-03 cs.CL 77%

MedAraBench: Large-Scale Arabic Medical Question Answering Dataset and Benchmark

MedAraBench:大规模阿拉伯语医学问答数据集和基准测试

Mouath Abu-Daoud, Leen Kharouf, Omar El Hajj, Dana El Samad, Mariam Al-Omari, Jihad Mallat, Khaled Saleh, Nizar Habash, Farah E. Shamout

机构 * Engineering Division, New York University Abu Dhabi(纽约大学阿布扎克分校工程系) Cleveland Clinic Abu Dhabi(阿布扎克克利夫兰诊所) Science Division, New York University Abu Dhabi(纽约大学阿布扎克分校科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MedAraBench是一个大规模阿拉伯语医学问答数据集,旨在通过提供多样化的医学领域数据来提升大型语言模型的多语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 77%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05064 2026-02-03 cs.LG 77%

WaterDrum: Watermarking for Data-centric Unlearning Metric

WaterDrum:面向数据导向的去学习度量水印

Xinyang Lu, Xinyuan Niu, Gregory Kang Ruey Lau, Bui Thi Cam Nhung, Rachael Hwee Ling Sim, John Russell Himawan, Fanyu Wen, Chuan-Sheng Foo, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 WaterDrum提出了一种数据导向的LLM去学习度量,通过鲁棒文本水印技术解决现有度量在数据相似性和重训练不可行时的不足,并引入了新的基准数据集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09382 2026-02-03 cs.IR cs.AI 77%

Towards Next-Generation Recommender Systems: A Benchmark for Personalized Recommendation Assistant with LLMs

迈向下一代推荐系统:一种用于基于LLM的个性化推荐助手的基准测试

Jiani Huang, Shijie Wang, Liang-bo Ning, Wenqi Fan, Shuaiqiang Wang, Dawei Yin, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RecBench+数据集,用于评估LLM在复杂用户推荐任务中的能力,揭示LLM在处理条件查询时的优势及推理挑战。

Comments Accepted for publication at WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13375 2026-02-03 cs.CL 77%

ALiiCE: Evaluating Positional Fine-grained Citation Generation

ALiiCE:评估位置细粒度引用生成

Yilong Xu, Jinhua Gao, Xiaoming Yu, Baolong Bi, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) Key Lab of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ALiiCE提出了一种自动评估框架,用于评估位置细粒度引用生成,通过依赖树解析句子并引入三个指标评估引用质量。

Comments NAACL 2025 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00948 2026-02-03 physics.soc-ph cs.AI cs.GT cs.MA 77%

FinEvo: From Isolated Backtests to Ecological Market Games for Multi-Agent Financial Strategy Evolution

FinEvo: 从孤立回测到多智能体金融策略进化的生态市场博弈

Mingxi Zou, Jiaxiang Chen, Aotian Luo, Jingyi Dai, Chi Zhang, Dongning Sun, Zenglin Xu

机构 * Fudan University(复旦大学) Tensorpacific Peng Cheng Laboratory(鹏城实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FinEvo通过生态博弈形式化方法研究多智能体金融策略的进化动态,揭示策略在动态市场中的适应与演化机制。

Comments Preprint. Submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00785 2026-02-03 cs.AI 77%

World Models as an Intermediary between Agents and the Real World

世界模型作为智能体与现实世界之间的中介

Sherry Yang

机构 * New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用世界模型作为中介,以解决高成本领域中智能体性能提升的瓶颈问题,通过动态、奖励和任务分布模型克服样本效率低和非策略学习的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00711 2026-02-03 cs.CR cs.AI cs.SE 77%

From Detection to Prevention: Explaining Security-Critical Code to Avoid Vulnerabilities

从检测到预防:解释安全关键代码以避免漏洞

Ranjith Krishnamurthy, Oshando Johnson, Goran Piskachev, Eric Bodden

机构 * Paderborn University \& Fraunhofer IEM Paderborn Germany Amazon Web Services Berlin Germany Paderborn University \& Fraunhofer IEM Amazon Web Services

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过代码级别度量指标和LLM生成预防性解释,以主动预防安全漏洞。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06007 2026-02-03 cs.CL 77%

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

不要破坏缓存:对长周期智能体任务中提示缓存的评估

Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了提示缓存对长周期智能体任务的影响,发现通过策略性缓存控制可显著降低API成本并提升响应速度。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00249 2026-02-03 cs.CV cs.AI 77%

SANEval: Open-Vocabulary Compositional Benchmarks with Failure-mode Diagnosis

SANEval: 开放词汇组合评估基准与失败模式诊断

Rishav Pramanik, Ian E. Nielsen, Jeff Smith, Saurav Pandit, Ravi P. Ramachandran, Zhaozheng Yin

机构 * Stony Brook University(石溪大学) nd Set AI Corp.(第二集AI公司) Rowan University(罗文大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SANEval提出一种开放词汇组合评估基准,结合大型语言模型和增强对象检测器,通过实验展示其在属性绑定、空间关系和数值任务上的评估效果优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02457 2026-02-03 cs.CY 75%

MetaCLASS: Metacognitive Coaching for Learning with Adaptive Self-regulation Support

MetaCLASS:基于自适应自我调节支持的元认知辅导

Naiming Liu, Richard Baraniuk, Shashank Sonkar

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MetaCLASS通过元认知辅导框架提升学习者自我调节能力,验证了传统教学模型在元认知任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19016 2026-02-03 cs.CR 75%

DREAM: Dynamic Red-teaming across Environments for AI Models

DREAM: 为AI模型跨环境动态红队测试

Liming Lu, Xiang Gu, Junyu Huang, Jiawei Du, Xu Zheng, Yunhuai Liu, Yongbin Zhou, Shuchao Pang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DREAM通过动态多阶段攻击测试揭示LLM代理在跨环境安全中的关键漏洞,指出上下文脆弱性和长期恶意意图追踪不足,并提出评估工具以提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00196 2026-02-03 q-fin.ST q-fin.PM 75%

Generative AI for Stock Selection

生成式AI用于股票选择

Keywan Christian Rasekhschaffe

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 生成式AI通过检索增强生成技术,从股票数据中自动发现经济动机特征,提升短期收益预测的夏普比率,展现可解释且高效的特征发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01030 2026-02-03 cs.CL cs.SD eess.AS 74%

Bias in the Ear of the Listener: Assessing Sensitivity in Audio Language Models Across Linguistic, Demographic, and Positional Variations

倾听者之偏见:评估音频语言模型在语言、人口统计和位置变化中的敏感性

Sheng-Lun Wei, Yu-Ling Liao, Yen-Hua Chang, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) Institute of Information Science, Academia Sinica, Taiwan(台湾学术院信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 本研究通过BiasInEar数据集评估音频语言模型在语言、人口统计和位置变化中的敏感性,揭示语音放大结构性偏见的机制,并提出统一的公平性与稳健性评估框架。

Comments Accepted as a long findings paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01689 2026-02-03 cs.AI cs.LG 73%

What LLMs Think When You Don't Tell Them What to Think About?

当你不告诉LLMs该思考什么时,它们会想什么?

Yongchan Kwon, James Zou

机构 * Together AI Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了LLMs在无明确主题输入下生成内容的分布特征,发现不同模型家族存在显著的主题偏好和内容深度差异,并公开了相关数据集和代码。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05711 2026-02-03 cs.AI cs.DL cs.IR cs.LG 73%

Automated Archival Descriptions with Federated Intelligence of LLMs

基于大语言模型联邦智能的自动化档案描述

Jinghua Groppe, Andreas Marquet, Annabel Walz, Sven Groppe

机构 * IFIS, University of Lübeck(IFIS,吕贝克大学) Friedrich-Ebert-Stiftung e.V.(弗里德里希-埃伯特基金会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于大语言模型联邦智能的自动化档案描述系统,通过联邦优化方法提升档案元数据生成的质量和可靠性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09701 2026-02-03 cs.CL cs.LG 73%

Reassessing Active Learning Adoption in Contemporary NLP: A Community Survey

重新评估当代自然语言处理中主动学习的采用情况:一项社区调查

Julia Romberg, Christopher Schröder, Julius Gonsior, Katrin Tomanek, Fredrik Olsson

机构 * GESIS – Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI)(可扩展数据与人工智能研究中心) Dresden/Leipzig, Leipzig University(莱比锡大学) TUD Dresden University of Technology(德累斯顿技术大学) All Ears

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过社区调查重新评估了主动学习在NLP中的应用现状,揭示了数据标注和主动学习的相关性,并提出了缓解设置复杂性、成本不确定性和工具问题的策略。

Comments EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16570 2026-02-03 cs.LG cs.AI cs.CV 73%

Entropy-Lens: Uncovering Decision Strategies in LLMs

熵透镜:揭示大语言模型中的决策策略

Riccardo Ali, Francesco Caso, Christopher Irwin, Pietro Liò

机构 * Department of Computer Science University of Cambridge Cambridge, UK(计算机科学系剑桥大学剑桥英国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 熵透镜通过分析LLM残差流的熵剖面,揭示令牌预测动态及决策策略对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01031 2026-02-03 cs.AI cs.CL 73%

HalluHard: A Hard Multi-Turn Hallucination Benchmark

HalluHard: 一种具有挑战性的多轮 hallucination 评估基准

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01254 2026-02-03 cs.CL cs.AI cs.SD eess.AS 73%

Do Bias Benchmarks Generalise? Evidence from Voice-based Evaluation of Gender Bias in SpeechLLMs

偏见基准能推广吗?基于语音评估的SpeechLLMs性别偏见证据

Shree Harsha Bokkahalli Satish, Gustav Eje Henter, Éva Székely

机构 * Department of Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调SpeechLLMs测试MCQA偏见基准的推广能力,发现其在不同任务间的泛化效果有限,并提出新的评估方法。

Comments 5 pages, 2 Figures, Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00010 2026-02-03 cs.IR cs.AI cs.CL 73%

ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking

ChunkNorris: 一种高性能且低能耗的PDF解析与分块方法

Mathieu Ciancone, Clovis Varangot-Reille, Marion Schaeffer

机构 * Wikit Laboratoire Hubert Curien(Hubert Curien实验室) Université Jean Monnet(Jean Monnet大学) INSA Rouen Normandie(Rouen Normandie国立理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ChunkNorris通过高效启发式方法实现PDF解析与分块的高性能低能耗,优于现有技术,适用于资源受限的检索增强生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23719 2026-02-03 cs.CE cs.AI cs.LG 73%

A Survey of AI Methods for Geometry Preparation and Mesh Generation in Engineering Simulation

工程仿真中几何准备和网格生成的AI方法综述

Steven Owen, Nathan Brown, Nikos Chrisochoides, Rao Garimella, Xianfeng Gu, Franck Ledoux, Na Lei, Roshan Quadros, Navamita Ray, Nicolas Winovich, Yongjie Jessica Zhang

机构 * Sandia National Laboratories(桑迪亚国家实验室) Old Dominion University(旧 Dominion 大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) New York University / Stony Brook University(纽约大学 / 斯通布鲁克大学) CEA(法国原子能委员会) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了AI在工程仿真中用于几何准备和网格生成的方法,涵盖分类分割、质量预测、去特征化及自动化生成技术,强调AI与传统算法的互补作用。

Comments 47 pages, 0 figure, accepted by the International Meshing Roundtable conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02104 2026-02-03 cs.CL 70%

Dicta-LM 3.0: Advancing The Frontier of Hebrew Sovereign LLMs

Dicta-LM 3.0:推进希伯来语主权大语言模型的前沿

Shaltiel Shmidman, Avi Shmidman, Amir DN Cohen, Moshe Koppel

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Dicta-LM 3.0通过开放权重大语言模型推动希伯来语主权模型的发展,提供三种规模的模型及多种变种,支持工具调用,并引入新的评估基准以提升非英语语言的NLP能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02079 2026-02-03 cs.LG cs.SE 70%

AICD Bench: A Challenging Benchmark for AI-Generated Code Detection

AICD Bench: 一个用于AI生成代码检测的挑战性基准

Daniil Orel, Dilshod Azizov, Indraneil Paul, Yuxia Wang, Iryna Gurevych, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎伊德大学人工智能学院) Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science, TU Darmstadt(计算机科学系,图恩大学) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 AICD Bench提出一个全面的AI生成代码检测基准,包含200万例、77个模型及9种编程语言,通过三个现实任务评估检测性能,推动更鲁棒的检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01897 2026-02-03 cs.LG 70%

Internal Flow Signatures for Self-Checking and Refinement in LLMs

用于LLM中自我检查和细化的内部流签名

Sungheon Jeong, Sanggeon Yun, Ryozo Masukawa, Wenjun Haung, Hanning Chen, Mohsen Imani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出内部流签名用于LLM的自我检查和细化,通过深度动态审计和正交运输实现低开销的自我验证和精准定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01779 2026-02-03 cs.AI 70%

LingLanMiDian: Systematic Evaluation of LLMs on TCM Knowledge and Clinical Reasoning

LingLanMiDian: LLMs在中医知识与临床推理上的系统评估

Rui Hua, Yu Wei, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Zeyu Liu, Hui Zhu, Shujie Song, Mingzhong Xiao, Xiaodong Li, Dongmei Jia, Zhuye Gao, Yanyan Meng, Naixuan Zhao, Yu Fu, Haibin Yu, Benman Yu, Yuanyuan Chen, Fei Dong, Zhizhou Meng, Pengcheng Yang, Songxue Zhao, Lijuan Pei, Yunhui Hu, Kan Ding, Jiayuan Duan, Wenmao Yin, Yang Gu, Runshun Zhang, Qiang Zhu, Jian Yu, Jiansheng Li, Baoyan Liu, Wenjia Wang, Xuezhong Zhou

机构 * Department of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(北京交通大学计算机科学与技术学院) Tianjin Tasly Digital Chinese Medicine Technology Co., Ltd.(天津塔斯丽数字中医科技有限公司) Tasly Biopharmaceuticals Co., Ltd.(塔斯丽生物医药有限公司) State Key Laboratory of Chinese Medicine Modernization, Tianjin, China(中药现代化国家工程实验室,天津,中国) Institute of Liver Diseases, Hubei Key Laboratory of the theory and application research of liver and kidney in traditional Chinese medicine, Hubei Provincial Hospital of Traditional Chinese Medicine, Wuhan, China(肝病研究所,湖北省中医肝肾理论与应用研究重点实验室,湖北省中医药研究院,武汉,中国) Affiliated Hospital of Hubei University of Chinese Medicine, Wuhan, China(湖北中医药大学附属医院,武汉,中国) Hubei Province Academy of Traditional Chinese Medicine, Wuhan, China(湖北省中医药研究院,武汉,中国) Department of Gastroenterology, Guang’anmen Hospital, China Academy of Chinese Medical Sciences, Beijing, China(消化内科,广安门医院,中国中医科学院,北京,中国) China Academy of Chinese Medical Sciences, Beijing, China(中国中医科学院,北京,中国) China Institute for History of Medicine and Medical Literature, China Academy of Chinese Medical Sciences, Beijing, China(中国中医科学院中国医学史与医学文献研究所,北京,中国) Beijing Research Institute of Chinese Medicine, Beijing University of Chinese Medicine, Beijing, China(北京中医研究院,北京中医药大学,北京,中国) Beijing University of Chinese Medicine Third Affiliated Hospital, Beijing University of Chinese Medicine, Beijing 100029, China(北京中医药大学第三附属医院,北京中医药大学,北京100029,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LingLan基准测试系统评估了LLMs在中医知识和临床推理上的表现,揭示了当前模型与专家在专门推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15658 2026-02-03 cs.CV cs.AI 70%

GEO-Bench-2: From Performance to Capability, Rethinking Evaluation in Geospatial AI

GEO-Bench-2:从性能到能力,重新思考地理空间AI的评估

Naomi Simumba, Nils Lehmann, Paolo Fraccaro, Hamed Alemohammad, Geeth De Mel, Salman Khan, Manil Maskey, Nicolas Longepe, Xiao Xiang Zhu, Hannah Kerner, Juan Bernabe-Moreno, Alexandre Lacoste

机构 * IBM Research Europe(IBM欧洲研究院) Technical University Munich(慕尼黑技术大学) Clark University(克拉克大学) MBZUAI NASA Impact(NASA影响计划) ESA Φ \Phi -lab(欧洲航天局Φ实验室) Arizona State University(亚利桑那州立大学) ServiceNow AI Research(ServiceNow人工智能研究)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 GEO-Bench-2通过引入能力组和灵活的评估协议,重新评估地理空间AI模型,揭示任务需求和数据模态对模型选择的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08697 2026-02-03 cs.CL 70%

LLMs as Span Annotators: A Comparative Study of LLMs and Humans

大语言模型作为跨度标注器:大语言模型与人类的比较研究

Zdeněk Kasner, Vilém Zouhar, Patrícia Schmidtová, Ivan Kartáč, Kristýna Onderková, Ondřej Plátek, Dimitra Gkatzia, Saad Mahamood, Ondřej Dušek, Simone Balloccu

机构 * Charles University(查理大学) ETH Zurich(苏黎世联邦理工学院) Edinburgh Napier University(爱丁堡纳皮尔大学) trivago N.V.(trivago公司) TU Darmstadt, Germany(德累斯顿理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了大语言模型与人类在跨度标注任务中的表现,发现LLMs在成本和准确性上具有竞争力,且提供了大规模标注数据集。

Comments Accepted to the MME workshop @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00950 2026-02-03 cs.AI 70%

MindGuard: Guardrail Classifiers for Multi-Turn Mental Health Support

MindGuard: 多轮心理健康支持中的防护分类器

António Farinhas, Nuno M. Guerreiro, José Pombal, Pedro Henrique Martins, Laura Melton, Alex Conway, Cara Dochat, Maya D'Eon, Ricardo Rei

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MindGuard通过临床验证的危险分类法,提升多轮心理健康对话中的安全性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏