arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-19 至 2026-02-19 共收录 181 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 33 篇

2602.13521 2026-02-19 cs.DB cs.AI 70%

Arming Data Agents with Tribal Knowledge

赋予数据代理以部落知识

Shubham Agarwal, Asim Biswal, Sepanta Zeighami, Alvin Cheung, Joseph Gonzalez, Aditya G. Parameswaran

机构 * UC Berkeley(伯克利大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Tk-Boost通过积累经验纠正NL2SQL代理的误解,提升其在大规模数据库中的查询准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08177 2026-02-19 cs.CV cs.AI 70%

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhanyu Ma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16702 2026-02-19 cs.CV 67%

Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning

具有显著性意识的多路由思考:重新审视视觉-语言推理

Mingjia Shi, Yinhan He, Yaochen Zhu, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。

Comments preprint 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16106 2026-02-19 cs.SE 67%

Algorithm-Based Pipeline for Reliable and Intent-Preserving Code Translation with LLMs

基于算法的可靠且意图保留的代码翻译管道

Shahriar Rumi Dipto, Saikat Mondal, Chanchal K. Roy

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出一种基于算法的代码翻译管道,通过引入语言中立的中间规范提升翻译准确性和可靠性,实验结果显示其在多个指标上均优于直接翻译方法。

Comments Accepted at 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15242 2026-02-19 cs.CV 67%

Trustworthy and Fair SkinGPT-R1 for Democratizing Dermatological Reasoning across Diverse Ethnicities

可信且公平的SkinGPT-R1:用于在不同种族中普及皮肤病推理

Yuhao Shen, Zhangtianyi Chen, Yuanhao He, Yan Xu, Shuping Zhang, Liyuan Sun, Zijian Wang, Yinghao Zhu, Yuyuan Yang, Jiahe Qian, Ziwen Wang, Xinyuan Zhang, Wenbin Liu, Zongyuan Ge, Tao Lu, Siyuan Yan, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Faculty of Information Technology, Monash University(信息技术学院,莫纳什大学) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(皮肤科,天津整合皮肤科研究所,天津中医研究院附属医院) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(皮肤科,北京安贞医院,首都医科大学) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Dermatology, Beijing Aerospace General Hospital(皮肤科,北京航天总医院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SkinGPT-R1通过公平性意识的专家混合架构实现可解释且公平的皮肤病诊断,提升不同种族间的诊断准确性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21190 2026-02-19 cs.CR 67%

The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning

恶意示例:通过模板填充和不安全推理实现大语言模型的劫持

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok Yan Lam

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 TrojFill通过模板填充和不安全推理漏洞,实现对大语言模型的安全过滤绕过,展示了对齐LLM的系统性弱点。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16085 2026-02-19 cs.CL cs.AI 62%

Language Statistics and False Belief Reasoning: Evidence from 41 Open-Weight LMs

语言统计与虚假信念推理:来自41个开放权重语言模型的证据

Sean Trott, Samuel Taylor, Cameron Jones, James A. Michaelov, Pamela D. Rivière

机构 * Rutgers University - Newark(新泽西罗格斯大学-新布朗斯维尔) UC San Diego(加州大学圣地亚哥分校) Stony Brook University(史泰文斯理工学院) MIT(麻省理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过41个开放权重语言模型测试,发现人类和模型在非事实性动词提示下对虚假信念的归因存在偏差,揭示语言统计学在解释人类认知中的局限性。

Comments 15 pages, 7 figures, submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10265 2026-02-19 cs.AI cs.RO 57%

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

SurgRAW:基于链式推理的多智能体工作流用于机器人手术视频分析

Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR)(生物信息研究所(BII),科技研究局(A*STAR)) Wellcome/EPSRC Centre for Interventional and Surgical Sciences (WEISS) and the Department of Medical Physics and Biomedical Engineering, University College London(Wellcome/EPSRC介入与外科科学中心(WEISS)及伦敦大学学院医学物理与生物医学工程系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 SurgRAW通过基于链式推理的多智能体工作流,在机器人手术视频分析中实现零样本多任务推理,提升准确性和临床相关性。

Journal ref IEEE Robotics and Automation Letters, 2026, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16334 2026-02-19 cs.SD cs.AI 57%

Spatial Audio Question Answering and Reasoning on Dynamic Source Movements

空间音频问答与动态声源运动推理

Arvind Krishna Sridhar, Yinyi Guo, Erik Visser

机构 * Qualcomm Technologies Inc.(高通技术公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16455 2026-02-19 cs.CV 50%

Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing

视觉自校准:一种像素引导的准确图表解析范式

Jinsong Li, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出视觉自校准范式,通过像素引导提升图表解析的准确性,并构建了新的挑战性基准测试ChartP-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16157 2026-02-19 cs.HC 50%

Peeking Ahead of the Field Study: Exploring VLM Personas as Support Tools for Embodied Studies in HCI

提前窥视田野研究:探索VLM人设作为人机交互领域具身研究的支持工具

Xinyue Gui, Ding Xia, Mark Colley, Yuan Li, Vishal Chauhan, Anubhav Anubhav, Zhongyi Zhou, Ehsan Javanmardi, Stela Hanbyeol Seo, Chia-Ming Chang, Manabu Tsukada, Takeo Igarashi

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出利用VLM人设模拟田野研究结果,验证其在具身研究中的应用潜力,发现其在响应模式上接近人类但缺乏多样性。

Comments Accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02669 2026-02-19 cs.CV 50%

MedVLThinker: Simple Baselines for Multimodal Medical Reasoning

MedVLThinker: 多模态医疗推理的简单基线

Xiaoke Huang, Juncheng Wu, Hui Liu, Xianfeng Tang, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) Amazon Research(亚马逊研究院)

专题命中 推理与问题求解 :SFT(abstract)

AI总结 MedVLThinker通过简单基线和RLVR方法,在医疗多模态推理中实现新突破,超越现有开源模型并接近专有模型性能。

Comments Project page: https://ucsc-vlaa.github.io/MedVLThinker/ ; Code: https://github.com/UCSC-VLAA/MedVLThinker ; Model and Data: https://huggingface.co/collections/UCSC-VLAA/medvlthinker-688f52224fb7ff7d965d581d ; Accepted by ML4H'25

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 40 篇

2602.16467 2026-02-19 cs.CL cs.AI 91%

IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models

IndicEval:一种用于大型语言模型的双语印度教育评估框架

Saurabh Bharti, Gaurav Azad, Abhinaw Jagtap, Nachiket Tapas

机构 * Department of Computer Sciencce and Engineering(计算机科学与工程系) Swami Vivekanand Technical University Bhilai, India(斯瓦米·维韦kanand技术大学比哈尔,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 IndicEval提出了一种双语印度教育评估框架,通过真实考试题目评估LLM的推理、领域知识和双语适应性,揭示了跨模型性能差异和多语言退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16191 2026-02-19 cs.AI cs.HC cs.LG 90%

Large Language Models for Water Distribution Systems Modeling and Decision-Making

大型语言模型在水分配系统建模与决策中的应用

Yinon Goldshtein, Gal Perelman, Assaf Schuster, Avi Ostfeld

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。

Comments Accepted to EWRI Congress 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 89%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16201 2026-02-19 cs.CL cs.AI cs.CY 88%

Long-Tail Knowledge in Large Language Models: Taxonomy, Mechanisms, Interventions and Implications

大语言模型中的长尾知识:分类、机制、干预与影响

Sanket Badhe, Deep Shah, Nehal Kathrotia

机构 * Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型中长尾知识的定义、机制、干预及影响,提出统一框架以理解其表现和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16639 2026-02-19 cs.CL 88%

AREG: Adversarial Resource Extraction Game for Evaluating Persuasion and Resistance in Large Language Models

AREG:对抗性资源提取游戏用于评估大型语言模型的说服力与抗性

Adib Sakhawat, Fardeen Sadab

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 AREG通过对抗性资源提取游戏评估大型语言模型的说服与抗性能力,发现两者弱相关且存在系统性防御优势。

Comments 15 pages, 5 figures, 11 tables. Includes appendix with detailed experimental results and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16438 2026-02-19 cs.LG cs.AI 88%

Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment

内在公平动态:定向大语言模型对齐中的偏见溢出效应

Eva Paraschou, Line Harder Clemmensen, Sneha Das

机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学) Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文研究了定向性别对齐对多敏感属性公平性的影响,发现改善某一属性公平性可能加剧其他属性的不平等,强调了多属性、情境感知公平性评估的重要性。

Comments Submitted to the BiAlign CHI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16131 2026-02-19 stat.ML cs.LG 85%

Empirical Cumulative Distribution Function Clustering for LLM-based Agent System Analysis

基于经验累积分布函数的LLM代理系统分析聚类

Chihiro Watanabe, Jingyu Sun

机构 * NTT Computer and Data Science Laboratories(NTT计算机与数据科学实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于经验累积分布函数的LLM代理系统评估方法,通过聚类分析揭示不同配置下的响应质量分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16039 2026-02-19 cs.AI 85%

How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment

评分的不确定性有多大?基于大语言模型的自动评估中不确定性度量的基准测试

Hang Li, Kaiqi Yang, Xianxuan Long, Fedor Filippov, Yucheng Chu, Yasemin Copur-Gencturk, Peng He, Cory Miller, Namsoo Shin, Joseph Krajcik, Hui Liu, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) University of Southern California(南加州大学) Washington State University(华盛顿州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的自动评估中不确定性度量的基准测试,分析了不同方法的优劣及影响因素,旨在提升评分系统的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11348 2026-02-19 cs.AI 85%

AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition

AgentNoiseBench: 在噪声条件下评估工具使用LLM代理的鲁棒性基准测试

Ruipeng Wang, Yuxin Chen, Yukai Wang, Chang Wu, Junfeng Fang, Xiaodong Cai, Qi Gu, Hui Su, An Zhang, Xiang Wang, Xunliang Cai, Tat-Seng Chua

机构 * University of Science(科学大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentNoiseBench通过在噪声环境中评估LLM代理的鲁棒性,揭示了现有模型对现实扰动的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15801 2026-02-19 cs.CL cs.AI 85%

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

VerifyBench: 大型语言模型参考式奖励系统的基准测试

Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Meituan Group(美团集团) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。

Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23350 2026-02-19 cs.SE 82%

Validating Formal Specifications with LLM-generated Test Cases

用LLM生成的测试用例验证形式规范

Alcino Cunha, Nuno Macedo

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文利用GPT-5等大语言模型自动生成测试用例,用于验证形式规范的正确性,有效检测人类编写错误的规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04536 2026-02-19 cs.CL cs.AI cs.LG 82%

Evaluating Language Model Agency through Negotiations

通过谈判评估语言模型的代理能力

Tim R. Davidson, Veniamin Veselovsky, Martin Josifoski, Maxime Peyrard, Antoine Bosselut, Michal Kosinski, Robert West

机构 * EPFL(瑞士联邦理工学院) UGA(普罗万大学) CNRS(法国国家科学研究中心) LIG(里莫恩-盖朗实验室) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过谈判游戏评估语言模型的代理能力,发现封闭源模型更擅长完成任务,合作谈判游戏最具挑战性,且强模型可能输给弱对手。

Comments Accepted to ICLR 2024, code and link to project data are made available at https://github.com/epfl-dlab/LAMEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04072 2026-02-19 cs.CL cs.HC 81%

Toward Beginner-Friendly LLMs for Language Learning: Controlling Difficulty in Conversation

迈向语言学习的初学者友好型LLM:对话中的难度控制

Meiqing Jin, Liam Dugan, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过可控生成技术提升初学者与LLM对话的可理解性,实验表明该方法能显著提高输出清晰度,并引入新的评估指标支持语言学习研究。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16626 2026-02-19 cs.LG cs.AI q-bio.NC 81%

A Systematic Evaluation of Sample-Level Tokenization Strategies for MEG Foundation Models

对MEG基础模型的样本级分词策略系统评估

SungJun Cho, Chetan Gohil, Rukuang Huang, Oiwi Parker Jones, Mark W. Woolrich

机构 * Oxford Centre for Human Brain Activity(牛津人类大脑活动中心) University of Oxford(牛津大学) Nuffield Department of Clinical Neurosciences(努尔菲尔德临床神经科学系) Department of Psychiatry(精神病学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统评估了MEG数据中样本级分词策略对神经基础模型的影响,提出了一种基于自编码器的可学习分词方法,实验表明简单固定分词策略在重建准确性和下游任务性能上表现良好。

Comments 15 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15373 2026-02-19 cs.CL cs.AI 81%

Far Out: Evaluating Language Models on Slang in Australian and Indian English

远在天边:评估语言模型在澳大利亚英语和印度英语俚语上的表现

Deniz Kaya Dilsiz, Dipankar Srirag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估了语言模型在澳大利亚英语和印度英语俚语上的表现,发现印度英语在目标词选择任务中表现更优,揭示了生成与判别能力在俚语理解上的不对称性。

Comments Accepted as a paper at 13th VarDial workshop at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05023 2026-02-19 cs.CR cs.AI 79%

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

视觉-语言模型在位置披露中是否尊重上下文完整性?

Ruixin Yang, Ethan Mendes, Arthur Wang, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。

Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06028 2026-02-19 cs.HC cs.LG 79%

Leveraging Foundation Models for Calibration-Free c-VEP BCIs

利用基础模型实现无需校准的c-VEP脑机接口

Mohammadreza Behboodi, Eli Kinney-Lang, Ali Etemad, Adam Kirton, Hatem Abou-Zeid

机构 * Department of Biomedical Engineering, University of Calgary(生物医学工程系,卡尔加里大学) Department of Electrical and Computer Engineering, Queen’s University(电气与计算机工程系,皇后大学) Department of Pediatric and Clinical Neuroscience, University of Calgary(儿科与临床神经科学系,卡尔加里大学) Department of Electrical and Software Engineering, University of Calgary(电气与软件工程系,卡尔加里大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出基于基础模型的无需校准c-VEP脑机接口方法,通过训练分类头实现即插即用,无需受试者特定数据,实验显示在两个数据集上均取得较高准确率。

Comments 8 Pages, 2 figures, Accepted and Presented at the IEEE SMC Conference 2025

Journal ref 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Vienna, Austria, 2025, pp. 4564-4571

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15848 2026-02-19 cs.CL cs.AI 79%

Can LLMs Assess Personality? Validating Conversational AI for Trait Profiling

LLMs能评估人格吗?验证对话式AI用于特质分析

Andrius Matšenas, Anet Lello, Tõnis Lees, Hans Peep, Kim Lilii Tamm

机构 * University of Tartu(塔尔图大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究验证了LLM在对话中评估人格特质的可行性,发现其在部分人格维度上与传统问卷结果相当,但需进行特定特质校准。

Comments 13 pages, 7 figures, 4 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏