arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2602.02619 2026-02-05 cs.LG cs.AI cs.SE 62%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03704 2026-02-04 cs.CL cs.AI 62%

Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models

具有大语言模型的混合多智能体框架的认知多样性多项选择题生成

Yu Tian, Linh Huynh, Katerina Christhilf, Shubham Chakraborty, Micah Watanabe, Tracy Arner, Danielle McNamara

机构 * Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ReQUESTA通过混合多智能体框架生成认知多样化的多项选择题,提升生成的题目难度、区分度和语义一致性。

Comments This manuscript is under review at Electronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02932 2026-02-04 cs.CL cs.AI 62%

Equal Access, Unequal Interaction: A Counterfactual Audit of LLM Fairness

平等接入,不平等互动:对大语言模型公平性的反事实审计

Alireza Amiri-Margavi, Arshia Gharagozlou, Amin Gholami Davodi, Seyed Pouyan Mousavi Davoudi, Hamidreza Hasani Balyani

机构 * Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡大学) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth分校) Independent Researcher in AI and Statistics(人工智能与统计学独立研究者) Hardware Technology Organization(硬件技术组织)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过反事实提示设计,评估了GPT-4和LLaMA在不同人口身份下的互动质量差异,发现即使接入平等,模型在互动质量上仍存在系统性差异。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02781 2026-02-04 cs.CR cs.AI cs.LG 62%

Evaluating False Alarm and Missing Attacks in CAN IDS

评估CAN入侵检测系统中的误报和遗漏攻击

Nirab Hossain, Pablo Moriano

机构 * Department of Applied Mathematics University of Colorado Boulder(应用数学系科罗拉多大学波德摩尔分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过评估CAN IDS在对抗性攻击下的性能,揭示了其在误报和遗漏攻击方面的脆弱性,强调了对抗鲁棒性在安全关键汽车系统中的重要性。

Comments 8 pages, 2 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19120 2026-02-04 cs.IR cs.AI cs.LG 62%

RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation

RobustExplain: 评估基于LLM的推荐解释代理的鲁棒性

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

机构 * Workday

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 RobustExplain提出首个评估框架,用于衡量LLM生成推荐解释的鲁棒性,揭示当前模型鲁棒性较低,较大模型稳定性更高。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02455 2026-02-03 cs.AI cs.CL cs.SE 62%

Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction

Drift-Bench: 通过多轮交互诊断LLM代理在输入故障下的合作破裂

Han Bao, Zheyuan Zhang, Pengcheng Jing, Zhengqing Yuan, Kaiwen Shi, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Drift-Bench通过多轮交互评估LLM代理在输入故障下的合作破裂,采用角色驱动的用户模拟器和Rise评估协议,揭示澄清效果随用户角色和故障类型的变化,推动代理安全评估。

Comments 65 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01937 2026-02-03 cs.LG cs.AI 62%

T-LLM: Teaching Large Language Models to Forecast Time Series via Temporal Distillation

T-LLM:通过时间蒸馏教大语言模型进行时间序列预测

Suhan Guo, Bingxu Wang, Shaodan Zhang, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 T-LLM通过时间蒸馏框架,使通用大语言模型具备时间序列预测能力,实验显示其在多种设置下均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01614 2026-02-03 cs.LG cs.AI 62%

AgroFlux: A Spatial-Temporal Benchmark for Carbon and Nitrogen Flux Prediction in Agricultural Ecosystems

AgroFlux:农业生态系统碳和氮通量预测的空间-时间基准

Qi Cheng, Licheng Liu, Yao Zhang, Mu Hong, Yiqun Xie, Xiaowei Jia

机构 * University of Pittsburgh(匹兹堡大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校) Colorado State University(科罗拉多州立大学) University of Maryland(马里兰大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 AgroFlux 提出一个空间-时间基准数据集,整合物理模型与现实观测,评估深度学习模型在农业生态系统碳氮通量预测中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00769 2026-02-03 cs.CL cs.AI 62%

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

通过经济游戏 eliciting 大语言模型的信任度先验

Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

机构 * University of Hong Kong(香港大学) The University of Hong Kong(香港大学) Peking University(北京大学) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康重点实验室) IDG/McGovern Institute for Brain Research, Peking University(北京大学脑科学研究院) Peking-Tsinghua Center for Life Sciences, Peking University(北京大学-清华大学生命科学中心) Key Laboratory of Machine Perception, Ministry of Education, China(教育部机器感知重点实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 通过经济游戏实验,研究如何通过行为博弈论中的信任游戏获取大语言模型的信任度先验,并揭示其与人类信任差异及刻板印象模型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00547 2026-02-03 cs.LG cs.AI 62%

Contrastive Domain Generalization for Cross-Instrument Molecular Identification in Mass Spectrometry

对比域泛化用于质谱中跨仪器分子识别

Seunghyun Yoo, Sanghong Kim, Namkyung Yoon, Hwangnam Kim

机构 * School of Electrical Engineering, Korea University, Seoul 02841, Korea(韩国大学电气工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种跨模态对齐框架,通过将质谱直接映射到预训练化学语言模型的分子结构嵌入空间,提升跨仪器分子识别的泛化能力。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01661 2026-02-03 cs.CL cs.AI 62%

Learning the Boundary of Solvability: Aligning LLMs to Detect Unsolvable Problems

学习可解性的边界:对齐大语言模型以检测不可解的问题

Dengyun Peng, Qiguang Chen, Bofei Liu, Jiannan Guan, Libo Qin, Zheng Yan, Jinhao Liu, Jianshu Zhang, Wanxiang Che

机构 * LARG, Research Center for Social Computing and Interactive Robotics, HIT(LARG,社会计算与交互机器人研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) iFLYTEK

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UnsolvableQA数据集和UnsolvableRL框架,通过逆向构建引入逻辑矛盾,提升LLM对不可解问题的检测能力,并在Qwen3-4B-Instruct上提升可解推理准确率至69.4%。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13853 2026-02-03 cs.CL cs.AI cs.DB cs.HC 62%

BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation

BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统

Fabian Wenz, Omar Bouattour, Devin Yang, Justin Choi, Cecil Gregg, Nesime Tatbul, Çağatay Demiralp

机构 * TU Munich(慕尼黑技术大学) MIT(麻省理工学院) Intel Labs(英特尔实验室) AWS AI Labs(亚马逊AI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。

Comments CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15746 2026-02-03 cs.CL cs.AI cs.CV 62%

End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning

端到端代理RAG系统训练用于可追溯的诊断推理

Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, Weidi Xie

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 Deep-DxSearch通过端到端强化学习训练代理RAG系统,实现可追溯的诊断推理,显著提升诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03194 2026-02-03 cs.CV cs.AI cs.LG 62%

HueManity: Probing Fine-Grained Visual Perception in MLLMs

HueManity: 探索 MLLMs 中的细粒度视觉感知

Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

机构 * Google(谷歌) Waymo

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。

Journal ref ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00393 2026-02-03 cs.CV cs.CL cs.LG 62%

Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset

巴西葡萄牙语图像描述生成:跨原生翻译数据集研究

Gabriel Bromonschenkel, Alessandro L. Koerich, Thiago M. Paixão, Hilário Tomaz Alves de Oliveira

机构 * Instituto Federal do Espírito Santo (IFES)(巴西联邦大学埃斯皮里图圣安东尼奥理工学院) École de Technologie Supérieure (ÉTS)(加拿大超技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过跨原生翻译数据集评估Transformer模型在巴西葡萄牙语图像描述生成中的表现,发现Swin-DistilBERTimbau表现优异,GPT-4在CLIP-Score上表现最佳,同时揭示了模型中的系统性偏见。

Comments Accepted to JBCS. 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00046 2026-02-03 cs.LG cs.CL 62%

Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy

将Beacon扩展到印地语:文化适应驱动跨语言趋炎附势

Sarthak Sattigeri

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究通过文化适应提示评估语言模型在印地语中的趋炎附势现象,发现文化因素对跨语言对齐行为有显著影响。

Comments First Hindi sycophancy benchmark using a three-condition design separating language and cultural effects, with empirical evaluation across four instruction-tuned models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00011 2026-02-03 cs.IR cs.AI cs.CL 62%

Chained Prompting for Better Systematic Review Search Strategies

链式提示法提升系统综述搜索策略

Fatima Nasser, Fouad Trad, Ammar Mohanna, Ghada El-Hajj Fuleihan, Ali Chehab

机构 * Electrical and Computer Engineering(电气与计算机工程系) American University of Beirut(贝鲁特美国大学) Department of Internal Medicine(内科系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的链式提示框架,用于自动化生成系统综述的高召回率搜索策略,通过分解目标、提取PICO要素等方法提升检索效果。

Comments Accepted in the 3rd International Conference on Foundation and Large Language Models (FLLM2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23719 2026-02-03 cs.CE cs.AI cs.LG 62%

A Survey of AI Methods for Geometry Preparation and Mesh Generation in Engineering Simulation

工程仿真中几何准备和网格生成的AI方法综述

Steven Owen, Nathan Brown, Nikos Chrisochoides, Rao Garimella, Xianfeng Gu, Franck Ledoux, Na Lei, Roshan Quadros, Navamita Ray, Nicolas Winovich, Yongjie Jessica Zhang

机构 * Sandia National Laboratories(桑迪亚国家实验室) Old Dominion University(旧 Dominion 大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) New York University / Stony Brook University(纽约大学 / 斯通布鲁克大学) CEA(法国原子能委员会) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了AI在工程仿真中用于几何准备和网格生成的方法,涵盖分类分割、质量预测、去特征化及自动化生成技术,强调AI与传统算法的互补作用。

Comments 47 pages, 0 figure, accepted by the International Meshing Roundtable conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22769 2026-02-02 cs.CY cs.AI 62%

Beyond Abstract Compliance: Operationalising trust in AI as a moral relationship

超越抽象合规:将人工智能中的信任视为一种道德关系

Lameck Mbangula Amugongo, Tutaleni Asino, Nicola J Bidwell

机构 * Boehringer Ingelheim Pharma GmbH \& Co. KG Birkendorfer Str. 65 Biberach an der Riss Germany 88400 Carnegie Mellon University Pittsburgh, PA USA Rhodes University Makhanda South Africa International University of Management Namibia Charles Darwin University Australia Boehringer Ingelheim Pharma GmbH \& Co. KG Carnegie Mellon University Rhodes University International University of Management Charles Darwin University

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于非洲关系伦理的信任原则,通过医疗和教育案例,探讨如何将AI信任视为动态关系,促进公平和情境敏感的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14038 2026-01-30 cs.AI cs.CL cs.IR 62%

OAEI-LLM: A Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM:用于理解本体匹配中大语言模型幻觉的基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University, School of Computing(澳大利亚国立大学,计算机学院) Monash University, Faculty of Information Technology(墨尔本大学,信息技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 OAEI-LLM数据集旨在通过评估本体匹配任务中大语言模型的幻觉现象,为理解LLM幻觉提供基准支持。

Comments 5 pages, 1 figure, 1 table, 1 code snippet

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21742 2026-01-30 cs.AI cs.CL cs.MA 62%

Epistemic Context Learning: Building Trust the Right Way in LLM-Based Multi-Agent Systems

知识上下文学习:在基于大语言模型的多智能体系统中以正确方式建立信任

Ruiwen Zhou, Maojia Song, Xiaobao Wu, Sitao Cheng, Xunjian Yin, Yuxi Xie, Zhuoqun Hao, Wenyue Hua, Liangming Pan, Soujanya Poria, Min-Yen Kan

机构 * National University of Singapore(国立新加坡大学) Singapore University of Technology(新加坡科技学院) Nanyang Technological University(南洋理工大学) Duke University(杜克大学) University of Waterloo(滑铁卢大学) Microsoft(微软公司) Peking University(北京大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Epistemic Context Learning(ECL),通过历史交互构建同伴资料以提升多智能体系统中信任建模的准确性,使小型模型在性能上超越大模型,并在多种配置中表现出良好的泛化能力。

Comments Codes and data are available at https://github.com/skyriver-2000/epistemic-context-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21192 2026-01-30 cs.AI cs.CL 62%

Do Reasoning Models Enhance Embedding Models?

推理模型能增强嵌入模型吗?

Wun Yu Chan, Shaojin Chen, Huihao Jing, Kwun Hang Lau, Elton Chun-Chai Li, Zihao Wang, Haoran Li, Yangqiu Song

机构 * CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理模型是否能提升嵌入模型的性能,发现其初始化对对比学习效果无显著影响,并提出HRSA框架揭示流形重新对齐现象。

Comments 10 main pages, 18 appendix pages, 13 figures, 11 tables, 4 prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21157 2026-01-30 cs.AI cs.CL 62%

Bridging the Arithmetic Gap: The Cognitive Complexity Benchmark and Financial-PoT for Robust Financial Reasoning

弥合算术鸿沟:认知复杂性基准与金融-PoT用于稳健的金融推理

Boxiang Zhao, Qince Li, Zhonghao Wang, Yi Wang, Peng Cheng, Bo Lin

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出认知复杂性基准和金融-PoT框架,通过架构解耦提升金融推理的鲁棒性,使Qwen3-235B模型在复杂任务中的准确率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 62%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20913 2026-01-30 cs.LG cs.AI cs.CV 62%

Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges

噪声但有效:通过不完美的裁判者对LLM进行稳健的统计评估

Chen Feng, Minghe Shen, Ananth Balashankar, Carsten Gerner-Beuerle, Miguel R. D. Rodrigues

机构 * Queen’s University Belfast(女王大学贝尔法斯特分校) University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种稳健的LLM统计评估框架,通过建模不完美裁判行为,理论保证有限样本的一类错误控制,并验证了在不完美裁判设定下的评估有效性。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24906 2026-01-30 cs.AI cs.CL 62%

Neural network embeddings recover value dimensions from psychometric survey items on par with human data

神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当

Max Pellert, Clemens M. Lechner, Indira Sen, Markus Strohmaier

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Jam Technologies GmbH University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SQuID通过神经网络嵌入从心理测量调查项目中恢复价值维度,与人类数据相当,具有成本低、可扩展性强的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03147 2026-01-30 cs.HC cs.CL cs.LG cs.SD eess.AS 62%

A conversational gesture synthesis system based on emotions and semantics

基于情感和语义的对话手势合成系统

Thanh Hoang-Minh

机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19337 2026-01-28 cs.AI cs.LG cs.SE 62%

SETA: Statistical Fault Attribution for Compound AI Systems

SETA:复合人工智能系统的统计故障归因

Sayak Chowdhury, Meenakshi D'Souza

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SETA提出了一种模块化鲁棒性测试框架,用于分析复合人工智能系统的故障归因,通过组件级分析和错误传播推理,实现细粒度的鲁棒性评估。

Comments Accepted to CAIN 2026 co-hosted with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18706 2026-01-27 cs.AI cs.LG 62%

Health-SCORE: Towards Scalable Rubrics for Improving Health-LLMs

Health-SCORE: 向提升健康大语言模型的可扩展评分标准迈进

Zhichao Yang, Sepehr Janghorbani, Dongxu Zhang, Jun Han, Qian Qian, Andrew Ressler, Gregory D. Lyng, Sanjit Singh Batra, Robert E. Tillman

机构 * Optum AI

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Health-SCORE是一种通用且可扩展的基于评分标准的训练和评估框架,通过降低开发成本和提升响应质量,使医疗领域的大语言模型评估和训练更加可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18200 2026-01-27 cs.LG cs.AI 62%

HeterCSI: Channel-Adaptive Heterogeneous CSI Pretraining Framework for Generalized Wireless Foundation Models

HeterCSI:面向通用无线基础模型的通道自适应异构CSI预训练框架

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(中国移动网络技术国家工程研究中心,北京邮电大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理重点实验室,中央民族大学) China Telecom Corporation Limited Gansu Branch(中国电信集团甘肃分公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 HeterCSI通过解决CSI尺度异质性和场景多样性问题,提出一种通道自适应的异构CSI预训练框架,提升无线基础模型的泛化能力和效率。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏