arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-05 至 2026-02-05 共收录 223 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2602.04056 2026-02-05 eess.SY cs.RO cs.SY 50%

Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World

模块化安全护栏是现实世界中由基础模型赋能的机器人所必需的

Joonkyung Kim, Wenxi Chen, Davood Soleymanzadeh, Yi Ding, Xiangbo Gao, Zhengzhong Tu, Ruqi Zhang, Fan Fei, Sushant Veer, Yiwei Lyu, Minghui Zheng, Yan Gu

机构 * Purdue University(普渡大学) Amazon(亚马逊公司) NVIDIA(英伟达公司)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出模块化安全护栏以解决现实世界中由基础模型赋能的机器人在开放、长尾和随时间适应的环境中的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 48 篇

2410.03198 2026-02-05 cs.CL 89%

PersoBench: Benchmarking Personalized Response Generation in Large Language Models

PersoBench:大型语言模型中个性化响应生成的基准测试

Saleh Afzoon, Zahra Jamali, Usman Naseem, Amin Beheshti

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学) School of Electrical and Computer Engineering, Shiraz University(电气与计算机工程学院,谢里兹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 PersoBench通过结构化流程评估LLMs在零样本设置中生成个性化响应的能力,揭示其在流畅性、个性化和连贯性方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04358 2026-02-05 cs.SE 89%

Generative AI in Systems Engineering: A Framework for Risk Assessment of Large Language Models

生成式AI在系统工程中的应用:大型语言模型风险评估框架

Stefan Otten, Philipp Reis, Philipp Rigoll, Joshua Ransiek, Tobias Schürmann, Jacob Langner, Eric Sax

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于评估大型语言模型在系统工程中应用风险的框架,通过自主性和影响两个维度分类,帮助组织实现安全透明的部署。

Comments Accepted at IEEE SysCon 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02712 2026-02-05 cs.CL cs.AI cs.LG 89%

Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks

时间到不一致:大型语言模型对对抗攻击鲁棒性的生存分析

Yubo Li, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过生存分析方法评估大型语言模型在多轮对话中的鲁棒性,发现语义漂移对不一致风险的影响,并提出轻量级模型用于提前检测失败对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04456 2026-02-05 cs.CY cs.AI cs.CL 86%

Growth First, Care Second? Tracing the Landscape of LLM Value Preferences in Everyday Dilemmas

先成长,再关怀?追踪LLM在日常困境中的价值偏好景观

Zhiyi Chen, Eun Cheol Choi, Yingjia Luo, Xinyi Wang, Yulei Xiao, Aizi Yang, Luca Luceri

机构 * University of Southern California(美国南加州大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示LLM在日常困境中更倾向优先考虑探索与成长的价值,而非关怀与连接,指出AI建议系统可能带来的价值同质化风险。

Comments dataset available at https://github.com/Renesmeeczy/Value-Trade-off-in-Reddit-Dilemmas

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04294 2026-02-05 cs.CL cs.AI cs.CR 86%

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 85%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG 85%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04296 2026-02-05 cs.SE cs.AI 85%

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

ProxyWar: 动态评估LLM代码生成在游戏竞技场中的表现

Wenjun Peng, Xinyu Wang, Qi Wu

机构 * adelaide.edu.au(阿德莱德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProxyWar通过在动态游戏环境中评估LLM代码生成的质量,揭示了基准分数与实际性能之间的差异,为算法发现和自适应问题解决研究提供新视角。

Comments ICSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04487 2026-02-05 cs.HC cs.RO 85%

The Supportiveness-Safety Tradeoff in LLM Well-Being Agents

在LLM福祉代理中的支持性与安全性权衡

Himanshi Lalwani, Hanan Salam

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨了在LLM福祉代理中支持性与安全性之间的权衡,发现适度支持性提示能提升共情和建设性支持,而强烈验证提示则显著降低安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20645 2026-02-05 cs.CL cs.AI cs.LG 85%

Anticipatory Evaluation of Language Models

语言模型的前瞻性评估

Jungsoo Park, Ethan Mendes, Gabriel Stanovsky, Alan Ritter

机构 * Georgia Institute of Technology, Atlanta, Georgia(佐治亚理工学院) The Hebrew University of Jerusalem, Jerusalem, Israel(耶路撒冷希伯来大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过任务描述和实验配置预测语言模型性能,构建PRECOG语料库并展示推理模型在高置信度阈值下的预测能力。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20276 2026-02-05 eess.SY cs.SY 85%

LLM-Driven Transient Stability Assessment: From Automated Simulation to Neural Architecture Design

基于大语言模型的暂态稳定评估:从自动化仿真到神经网络架构设计

Lianzhe Hu, Yu Wang, Bikash Pal

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型驱动的神经网络设计流程,实现电力系统暂态稳定评估的自动化和智能化,提升准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05564 2026-02-05 cs.SD cs.CL cs.HC eess.AS 83%

The ICASSP 2026 HumDial Challenge: Benchmarking Human-like Spoken Dialogue Systems in the LLM Era

ICASSP 2026语音对话挑战:在LLM时代评估类人语音对话系统

Zhixian Zhao, Shuiyuan Wang, Guojian Li, Hongfei Xue, Chengyou Wang, Shuai Wang, Longshuai Xiao, Zihan Zhang, Hui Bu, Xin Xu, Xinsheng Wang, Hexin Liu, Eng Siong Chng, Hung-yi Lee, Lei Xie

机构 * ICASSP 2026

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ICASSP 2026发起HumDial挑战,通过大规模数据集评估语音对话系统在情感智能和全双工交互方面的类人能力。

Comments Official summary paper for the ICASSP 2026 HumDial Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 83%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 82%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02515 2026-02-05 cs.AI cs.CL cs.LG 82%

CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection

CreditAudit: 2维度用于LLM评估与选择

Yiliang Song, Hongjun An, Jiangong Xiao, Haofei Zhao, Jiawei Shao, Xuelong Li

机构 * Northwestern Polytechnical University Institute of Artificial Intelligence (TeleAI), China Telecom(西北工业大学人工智能研究所(TeleAI),中国电信) Dalian Maritime University Institute of Artificial Intelligence (TeleAI), China Telecom(大连海事大学人工智能研究所(TeleAI),中国电信) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Guangxi Normal University Institute of Artificial Intelligence (TeleAI), China Telecom(广西师范大学人工智能研究所(TeleAI),中国电信)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CreditAudit 通过 2D 信用评级框架,提供基于稳定性风险的 LLM 部署评估方法,支持更精确的模型选择与分层部署。

Comments Second update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04064 2026-02-05 cs.CY 82%

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

公民查询基准:一种新的数据集和评估流程,用于衡量LLM在公民查询任务中的性能

Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出CitizenQuery-UK数据集和评估流程,用于评估LLM在公民查询任务中的可信度,发现模型在事实性、回避率和冗余性方面存在差异,强调了可信赖AI的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 81%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02148 2026-02-05 cs.AI cs.LG 81%

OmniCellTOSG: The First Cell Text-Omic Signaling Graphs Dataset for Graph Language Foundation Modeling

OmniCellTOSG: 首个细胞文本-组学信号图谱数据集用于图语言基础建模

Heming Zhang, Tim Xu, Dekang Cao, Shunning Liang, Guntaas Shergill, Nicholas Hadas, Lars Schimmelpfennig, Levi Kaster, Di Huang, Guangfu Li, S. Peter Goedegebuure, David DeNardo, Li Ding, Ryan C. Fields, J Philip Miller, Pirooz Eghtesady, Carlos Cruchaga, William Buchser, Jonathan Cooper, Marco Sardiello, Patricia Dickson, Yixin Chen, Michael Province, Philip Payne, Fuhai Li

机构 * Institute for Informatics, Data Science and Biostatistics(信息学、数据科学与生物统计学研究所) Washington University in St. Louis(华盛顿大学圣路易斯分校) Department of Computer Science(计算机科学系) NeuroGenomics and Informatics Center(神经基因组学与信息学中心) Department of Genetics(遗传学系) Department of Surgery(外科医学系) Siteman Cancer Center(西门癌中心) Department of Medicine(医学系) Department of Pediatrics(儿科医学系) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 OmniCellTOSG通过整合文本、组学和信号网络信息,提出CellTOSG-FM模型,在多种下游任务中超越现有组学基础模型,提供疾病相关靶点和信号通路的可解释分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04863 2026-02-05 cs.LG cs.AI cs.CL stat.ML 80%

Subliminal Effects in Your Data: A General Mechanism via Log-Linearity

数据中的潜意识效应:通过对数线性性的一般机制

Ishaq Aden-Ali, Noah Golowich, Allen Liu, Abhishek Shetty, Ankur Moitra, Nika Haghtalab

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) Courant Institute, New York University(纽约大学Courant研究所) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Logit-Linear-Selection方法,揭示数据集中的隐藏效应机制,通过选择特定子集使模型表现出多样化行为。

Comments Code available at https://github.com/ishaqadenali/logit-linear-selection

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03873 2026-02-05 cs.SD cs.AI eess.AS 79%

Decoding Ambiguous Emotions with Test-Time Scaling in Audio-Language Models

通过测试时间缩放解码模糊情绪在音频-语言模型中

Hong Jia, Weibin Li, Jingyao Wu, Xiaofeng Yu, Yan Gao, Jintao Cheng, Xiaoyu Tang, Feng Xia, Ting Dang

机构 * University of Melbourne(墨尔本大学) University of Auckland(奥克兰大学) South China Normal University(华南师范大学) MIT(麻省理工学院) University of Cambridge(剑桥大学) RMIT(皇家墨尔本理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出首个基于测试时间缩放的音频语言模型模糊情绪识别基准,系统比较了八种ALMs和五种TTS策略,揭示了模型容量与情感模糊性之间的交互挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04750 2026-02-05 cs.CL cs.AI 79%

Exploiting contextual information to improve stance detection in informal political discourse with LLMs

利用上下文信息提升LLMs在非正式政治 discourse中的立场检测

Arman Engin Sucu, Yixiang Zhou, Mario A. Nascimento, Tony Mullen

机构 * Khoury College of Computer Sciences Northeastern University(科里学院计算机科学系东北大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过引入用户资料上下文信息,利用LLMs提升非正式政治讨论中立场检测的准确性,实验表明上下文提示可使准确率提升17.5%-38.5%。

Comments 14 pages, 7 figures

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 4: Student Research Workshop) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04739 2026-02-05 cs.CL cs.AI cs.HC 79%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13893 2026-02-05 cs.CL cs.AI 79%

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

守护护栏:一种基于分类的 Jailbreak 检测方法

Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

机构 * Department of Computer, Control and Management Engineering(计算机、控制与管理工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于分类的 Jailbreak 检测方法,通过构建分层分类体系,分析攻击类型,评估提示引导效果,并建立新的多轮对抗对话数据集,以提升对 Jailbreak 技术的检测能力。

Comments 2nd Conference on International Association for Safe & Ethical AI (IASEAI 2026), 24-26 February 2026, UNESCO House, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03887 2026-02-05 eess.IV cs.CV 78%

To What Extent Do Token-Level Representations from Pathology Foundation Models Improve Dense Prediction?

病理基础模型的标记级表示在密集预测中有多大的提升作用?

Weiming Chen, Xitong Ling, Xidong Wang, Zhenyang Cai, Yijia Guo, Mingxi Fu, Ziyi Zeng, Minxi Ouyang, Jiawen Li, Yizhi Wang, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) Peking University, Beijing, China(北京大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出PFM-DenseBench,通过评估17个病理基础模型在18个数据集上的表现,揭示不同模型和调优策略在异构数据集上的性能差异及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21610 2026-02-05 cs.CV 78%

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23592 2026-02-05 cs.CV 78%

Same or Not? Enhancing Visual Perception in Vision-Language Models

相同还是不同?提升视觉语言模型的视觉感知能力

Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 TWIN通过引入大规模图像对数据集提升视觉语言模型的细粒度视觉感知能力,显著提高在艺术、动物等未见领域识别性能。

Comments Project webpage: https://glab-caltech.github.io/twin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04693 2026-02-05 cs.CL cs.CY 77%

LinGO: A Linguistic Graph Optimization Framework with LLMs for Interpreting Intents of Online Uncivil Discourse

LinGO:一种结合大语言模型的语言图优化框架,用于解释在线不文明言论的意图

Yuan Zhang, Thales Bertaglia

机构 * University of Zurich(苏黎世大学) Utrecht University(乌特雷赫大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LinGO通过多步骤语言组件优化,提升大语言模型对在线不文明言论意图的识别与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04579 2026-02-05 cs.IR cs.CL 77%

AIANO: Enhancing Information Retrieval with AI-Augmented Annotation

AIANO:通过AI增强标注提升信息检索

Sameh Khattab, Marie Bauer, Lukas Heine, Till Rostalski, Jens Kleesiek, Julian Friedrich

机构 * Institute for Artificial Intelligence in Medicine (IKIM), University Hospital Essen (AöR)(人工智能医学研究所(IKIM)、埃森大学医院(AöR))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AIANO通过结合人类专业知识与LLM帮助,提升信息检索数据集的创建效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11589 2026-02-05 cs.SE cs.AI cs.IR 77%

CoSQA+: Pioneering the Multi-Choice Code Search Benchmark with Test-Driven Agents

CoSQA+: 以测试驱动代理开创多选代码搜索基准

Jing Gong, Yanghui Wu, Linxi Liang, Yanlin Wang, Jiachi Chen, Mingwei Liu, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoSQA+通过测试驱动代理开创多选代码搜索基准,利用高质查询与多个合适代码配对,提升代码搜索准确率至93.9%。

Comments Accepted to TSE 2025. We provide the code and data at https://github.com/DeepSoftwareAnalytics/CoSQA_Plus

详情

展开后加载摘要…

URL PDF HTML 收藏