arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32459 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32459 篇

2602.08896 2026-02-10 cs.IR cs.AI 85%

OmniReview: A Large-scale Benchmark and LLM-enhanced Framework for Realistic Reviewer Recommendation

OmniReview: 一个大规模基准和基于LLM的框架,用于现实中的审稿人推荐

Yehua Huang, Penglei Sun, Zebin Chen, Zhenheng Tang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniReview提出了一种基于LLM和多任务学习的框架,通过整合多源数据构建大规模基准,实现更精确的审稿人推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08253 2026-02-10 cs.AI 85%

G-LNS: Generative Large Neighborhood Search for LLM-Based Automatic Heuristic Design

G-LNS:基于生成式大邻域搜索的LLM自动启发式设计

Baoyun Zhao, He Wang, Liang Zeng

机构 * Software College, Northeastern University(东北大学软件学院) International Centre for Theoretical Physics Asia-Pacific, University of Chinese Academy of Sciences(中国科学院大学国际理论物理亚太中心) Taiji Laboratory for Gravitational Wave Universe, University of Chinese Academy of Sciences(中国科学院大学太极引力波宇宙实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 G-LNS通过生成式进化框架,结合LLM共同进化破坏与修复操作符,实现了大邻域搜索操作符的自动化设计,在复杂组合优化问题中表现出更强的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05842 2026-02-10 cs.CL 85%

Reinforcement World Model Learning for LLM-based Agents

基于强化学习的世界模型学习用于基于大语言模型的智能体

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath, Nikhil Singh, Jiangfeng Gao, Zhou Yu

机构 * Columbia University, New York(哥伦比亚大学) Microsoft Research, Redmond(微软研究院) Dartmouth College, Hanover(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于强化学习的世界模型学习方法,用于提升基于大语言模型的智能体在环境动态适应和预测方面的性能。

Comments fixed Nikhil Singh's affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22896 2026-02-10 cs.AI 85%

Game-Theoretic Co-Evolution for LLM-Based Heuristic Discovery

基于博弈论的LLM启发式发现共演化

Xinyi Ke, Kai Li, Junliang Xing, Yifan Zhang, Jian Cheng

机构 * C2DL, Institute of Automation, Chinese Academy of Sciences(C2DL,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ASRO框架,通过博弈论方法实现求解器与实例生成器的共演化,提升启发式发现的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07996 2026-02-10 cs.CL 85%

The Judge Who Never Admits: Hidden Shortcuts in LLM-based Evaluation

从不承认的裁判:基于大语言模型的评估中的隐藏捷径

Arash Marioriyad, Omid Ghahroodi, Ehsaneddin Asgari, Mohammad Hossein Rohban, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(沙菲大学技术学院) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了基于大语言模型的评估中隐藏的捷径问题,指出裁判模型在面对注入提示时缺乏透明度,导致裁决偏移率高但提示识别率低,揭示了评估流程中的可靠性缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07673 2026-02-10 cs.CL 85%

Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation

无人类触感:基于LLM的摘要评估中的重叠偏差

Jiangnan Fang, Cheng-Tse Liu, Hanieh Deilamsalehy, Nesreen K. Ahmed, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究发现LLM在摘要评估中对重叠度敏感,随着重叠减少,LLM更倾向于选择其他LLM生成的摘要,表明需采用更复杂的评判技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07733 2026-02-10 cs.AI 85%

SurveyG: A Multi-Agent LLM Framework with Hierarchical Citation Graph for Automated Survey Generation

SurveyG: 一种基于分层引用图的多智能体LLM框架用于自动化综述生成

Minh-Anh Nguye, Minh-Duc Nguyen, Ha Lan N. T., Kieu Hai Dang, Nguyen Tien Dong, Dung D. Le

机构 * CMC OpenAI, VinUniversity(CMC OpenAI与 VinUniversity) VinUniversity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SurveyG通过分层引用图和多智能体验证生成结构化的综述,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06799 2026-02-09 cs.CL 85%

Visual Word Sense Disambiguation with CLIP through Dual-Channel Text Prompting and Image Augmentations

通过双通道文本提示和图像增强的CLIP实现视觉词义消歧

Shamik Bhattacharya, Daniel Perkins, Yaren Dogan, Vineeth Konjeti, Sudarshan Srinivasan, Edmon Begoli

机构 * 2 The Bredesen Center for Interdisciplinary Research 3 Department of Electrical Engineering \& Computer Science, University of Tennessee, Knoxville, TN 37916 4 Oak Ridge National Laboratory (ORNL), Oak Ridge, TN 37830

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过CLIP和双通道提示与图像增强实现视觉词义消歧,提升MRR和命中率,验证了精确提示的有效性。

Comments 9 pages, 6 figures, pending journal/workshop submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05070 2026-02-09 cs.SE cs.AI 85%

PromptPex: Automatic Test Generation for Language Model Prompts

PromptPex: 语言模型提示的自动测试生成

Reshabh K Sharma, Jonathan De Halleux, Shraddha Barke, Dan Grossman, Benjamin Zorn

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 PromptPex 是一个基于 LLM 的工具,用于自动为语言模型提示生成和评估单元测试,以提高提示的稳健性和可预测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05110 2026-02-06 cs.AI 85%

Understanding LLM Evaluator Behavior: A Structured Multi-Evaluator Framework for Merchant Risk Assessment

理解大语言模型评估者行为:一种结构化多评估者框架用于商户风险评估

Liang Wang, Junpeng Wang, Chin-chia Michael Yeh, Yan Zheng, Jiarui Sun, Xiran Fan, Xin Dai, Yujie Fan, Yiwei Cai

机构 * Visa Research(Visa研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结构化多评估者框架,用于评估LLM在商户风险评估中的推理质量,揭示了不同模型的自我评估偏见差异,并通过真实数据验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 85%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG 85%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04296 2026-02-05 cs.SE cs.AI 85%

ProxyWar: Dynamic Assessment of LLM Code Generation in Game Arenas

ProxyWar: 动态评估LLM代码生成在游戏竞技场中的表现

Wenjun Peng, Xinyu Wang, Qi Wu

机构 * adelaide.edu.au(阿德莱德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProxyWar通过在动态游戏环境中评估LLM代码生成的质量,揭示了基准分数与实际性能之间的差异,为算法发现和自适应问题解决研究提供新视角。

Comments ICSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03128 2026-02-04 cs.AI 85%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02287 2026-02-03 cs.CL 85%

Cross-Lingual Stability of LLM Judges Under Controlled Generation: Evidence from Finno-Ugric Languages

跨语言稳定性研究:在受控生成条件下LLM评判者的稳定性证据:基于芬兰-乌戈里语系语言

Isaac Chung, Linda Freienthal

机构 * Zendesk

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示了在受控生成条件下,LLM评判者在不同芬兰-乌戈里语系语言中的稳定性问题,发现语用判断存在排名不稳定性,需针对特定语言进行校准。

Comments First Workshop on Multilingual Multicultural Evaluation, co-located with EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21448 2026-02-03 cs.AI cs.AR 85%

ChipBench: A Next-Step Benchmark for Evaluating LLM Performance in AI-Aided Chip Design

ChipBench: 用于评估LLM在人工智能辅助芯片设计中的性能的下一步基准

Zhongkai Yu, Chenyang Zhou, Yichen Lin, Hejia Zhang, Haotian Ye, Junxia Cui, Zaifeng Pan, Jishen Zhao, Yufei Ding

机构 * University of California San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChipBench提出了一项全面的基准测试,用于评估LLM在人工智能辅助芯片设计中的性能,揭示了现有模型在关键任务上的显著性能差距,并提供自动化工具箱促进相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16209 2026-02-03 cs.CR cs.CL 85%

PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization

PSM:通过LLM引导的黑盒优化实现提示敏感性最小化

Huseein Jawad, Nicolas Brunel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PSM框架,通过LLM引导的黑盒优化,利用SHIELD层减少系统提示泄露,提升LLM安全性和隐私保护。

Comments accepted at the Trustworthy Agentic AI Workshop @ AAAI 2026 (Singapore, Jan 27, 2026). Workshop PDF: https://trustagenticai.github.io/AAAI2026/AAAI-Workshop/20.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 85%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00204 2026-02-03 cs.CR cs.AI 85%

Semantic-Aware Advanced Persistent Threat Detection Using Autoencoders on LLM-Encoded System Logs

基于语义的高级持续性威胁检测:使用自动编码器对LLM编码的系统日志进行分析

Waleed Khan Mohammed, Zahirul Arief Irfan Bin Shahrul Anuar, Mousa Sufian Mousa Mitani, Hezerul Abdul Karim, Nouar AlDahoul

机构 * Faculty of Artificial Intelligence and Engineering, Multimedia University Cyberjaya, Malaysia(人工智能与工程学院,多媒体大学(Cyberjaya校区)) Centre for Image and Vision Computing, Centre of Excellence for Artificial Intelligence, Faculty of Artificial Intelligence and Engineering, Multimedia University, Cyberjaya, Selangor, Malaysia(图像与视觉计算中心,人工智能卓越中心,人工智能与工程学院,多媒体大学(Cyberjaya校区,Selangor州)) Computer Science, New York University Abu Dhabi, UAE(计算机科学,纽约大学阿布扎克校区)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM生成的语义嵌入和自动编码器,提升对高级持续性威胁的检测能力,实验显示其在复杂威胁场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06749 2026-02-03 cs.AI cs.SE 85%

DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems

DoVer:基于干预的LLM多智能体系统自动调试

Ming Ma, Jue Zhang, Fangkai Yang, Yu Kang, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Institute of Neuroscience, State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences, Shanghai, 200031, China(中国科学院神经科学研究所、脑认知与脑启发智能技术重点实验室、脑科学与智能技术卓越中心、中国科学院、上海) University of Chinese Academy of Sciences, School of Future Technology, Beijing, 100049, China(中国科学院大学、未来技术学院、北京) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DoVer通过干预驱动的调试方法,显著提高了LLM多智能体系统的可靠性,实现了高比例的失败试验修复和任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22759 2026-02-02 cs.HC cs.AI cs.SE 85%

Qualitative Evaluation of LLM-Designed GUI

大型语言模型设计的图形用户界面定性评估

Bartosz Sawicki, Tomasz Les, Dariusz Parzych, Aleksandra Wycisk-Ficek, Pawel Trebacz, Pawel Zawadzki

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了LLM在设计GUI时的可用性和适应性,发现其在结构布局方面有效,但在可访问性和交互功能上存在挑战,需人类干预以确保用户体验。

Comments 12 pages, presented on conference PP-RAI 2025, Katowice-Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22433 2026-02-02 cs.AI cs.SE 85%

When LLM meets Fuzzy-TOPSIS for Personnel Selection through Automated Profile Analysis

当LLM遇见模糊-TOPSIS用于通过自动化资料分析的人事选拔

Shahria Hoque, Ahmed Akib Jawad Karim, Md. Golam Rabiul Alam, Nirjhar Gope

机构 * BRAC University Department of Computer Science and Engineering(布拉克大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究结合LLM与模糊TOPSIS方法,开发自动化人事选拔系统,提升招聘的可扩展性、一致性和公平性。

Comments 10 pages, 8 figures. This paper has been peer-reviewed and published in IEEE Access. The arXiv version corresponds to the accepted author manuscript (AAM)

Journal ref IEEE Access, vol. 14, 2026, Article ID 3658575

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19970 2026-01-29 cs.CR cs.LG 85%

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19899 2026-01-28 cs.CL 85%

Evaluation of Oncotimia: An LLM based system for supporting tumour boards

对Oncotimia的评估:一种基于LLM的系统,用于支持肿瘤板

Luis Lorenzo, Marcos Montana-Mendez, Sergio Figueiras, Miguel Boubeta, Cristobal Bernardo-Castineira

机构 * Innovation Department, Bahía Software SLU(Bahía Software SLU创新部)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Oncotimia通过LLM自动完成肺癌肿瘤板表单,提高了效率并减少了文档负担。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19197 2026-01-28 cs.IR cs.AI 85%

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

HELM:一种面向LLM推荐系统的以人为本的评估框架

Sushant Mehta

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19106 2026-01-28 cs.SE cs.AI 85%

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis

通过确定性AST分析检测和纠正LLM生成的代码中的幻觉

Dipin Khati, Daniel Rodriguez-Cardenas, Paul Pantzer, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。

Comments Accepted to FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18846 2026-01-28 cs.AI cs.NE 85%

LLM Driven Design of Continuous Optimization Problems with Controllable High-level Properties

基于大语言模型的连续优化问题可控高阶属性设计

Urban Skvorc, Niki van Stein, Moritz Seiler, Britta Grimme, Thomas Bäck, Heike Trautmann

机构 * Machine Learning and Optimization, Paderborn University, Germany(机器学习与优化,帕德博恩大学,德国) Leiden Institute of Advanced Computer Science, Leiden University, The Netherlands(莱顿先进计算机科学研究所,莱顿大学,荷兰) Data Management and Biometrics, University of Twente, The Netherlands(数据管理与生物特征,埃因霍温大学,荷兰)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型设计具有可控高阶属性的连续优化问题,通过生成函数并验证其结构特征,扩展了基准测试空间。

Comments 17 pages, accepted at EvoApplications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 85%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18630 2026-01-27 cs.AI cs.HC 85%

Assessing the Quality of Mental Health Support in LLM Responses through Multi-Attribute Human Evaluation

通过多属性人类评估评估LLM响应中的心理健康支持质量

Abeer Badawi, Md Tahmid Rahman Laskar, Elahe Rahimi, Sheri Grach, Lindsay Bertrand, Lames Danok, Frank Rudzicz, Jimmy Huang, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过多属性人类评估方法,评估LLM在心理健康对话中的响应质量,揭示LLMs在认知可靠性与情感一致性方面的差异,并倡导以治疗敏感性为核心的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01289 2026-01-27 cs.AI cs.GR 85%

OntoMetric: An Ontology-Driven LLM-Assisted Framework for Automated ESG Metric Knowledge Graph Generation

OntoMetric: 一种基于本体的LLM辅助框架,用于自动化生成ESG指标知识图谱

Mingqin Yu, Fethi Rabhi, Boming Xia, Zhengyi Yang, Felix Tan, Qinghua Lu

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Sciences, Engineering and Technology, The University of Adelaide(阿德莱德大学科学、工程与技术学院) School of Information Systems and Technology Management, University of New South Wales(新南威尔士大学信息系统与技术管理学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OntoMetric通过基于本体的LLM辅助框架,实现了从监管文件中自动化生成ESG指标知识图谱,显著提升语义准确性和模式合规性,同时降低成本并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏