arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-16 至 2026-01-16 共收录 186 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2601.10421 2026-01-16 cs.CL cs.AI 81%

Are Language Models Models?

语言模型是模型吗?

Philip Resnik

专题命中 评测与基准 :language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文质疑语言模型是否应被视为认知模型,指出其在不同层次上的不足,并强调其作为工具的适用性而非认知模型的合理性。

Comments 5 pages. This is an invited commentary under review at Behavioral and Brain Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09713 2026-01-16 cs.CL 79%

LLM-Driven Preference Data Synthesis for Proactive Prediction of the Next User Utterance in Human-Machine Dialogue

基于大语言模型的偏好数据合成用于人机对话中下一用户话语的前瞻性预测

Jinqiang Wang, Huansheng Ning, Jianguo Ding, Tao Zhu, Liming Chen, Chris Nugent

机构 * School of Computer & Communication Engineering, University of Science and Technology Beijing(计算机与通信工程学院,北京科技大学) Department of Computer Science, Blekinge institute of Technology(计算机科学系,布莱金厄理工大学) School of Computer Science, University of South China(计算机科学学院,南方大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学) School of Computing, Ulster University(计算机科学学院,乌斯特大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 ProUtt通过意图树建模和偏好数据合成,提升人机对话中下一次用户发言的预测精度。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21357 2026-01-16 cs.CV cs.LG 79%

AgriFM: A Multi-source Temporal Remote Sensing Foundation Model for Agriculture Mapping

AgriFM:一种多源时序遥感基础模型用于农业制图

Wenyuan Li, Shunlin Liang, Keyan Chen, Yongzhe Chen, Han Ma, Jianglei Xu, Yichuan Ma, Shikang Guan, Husheng Fang, Zhenwei Shi

机构 * Jockey Club STEM Lab of Quantitative Remote Sensing, Department of Geography, The University of Hong Kong, Hong Kong, China(香港大学地理系金钟STEM实验室) Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University, Beijing, China(北航航天智能科学与技术学院) School of Remote Sensing and Information Engineering, Wuhan University, China(武汉大学遥感与信息工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 AgriFM是一种多源时序遥感基础模型,通过改进的Video Swin Transformer架构实现多尺度时空特征提取,提升农业制图的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16821 2026-01-16 cs.NI cs.LG eess.SP 79%

LLM-Based Emulation of the Radio Resource Control Layer: Towards AI-Native RAN Protocols

基于大语言模型的无线资源控制层仿真:迈向AI原生的无线接入网络协议

Ziming Liu, Bryan Liu, Alvaro Valcarce, Xiaoli Chu

机构 * School of Electrical and Electronic Engineering, The University of Sheffield(电子与电气工程学院,谢菲尔德大学) Nokia Bell Labs(诺基亚贝尔实验室)

专题命中 评测与基准 :LLM(title);prompting(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型的RRC层仿真方法,通过参数高效适应和模式受限提示,实现高精度协议仿真,展示了AI原生RAN协议的可行性。

Comments This work has been submitted to the IEEE for possible publication. Focuses on applying LLMs to 5G RRC protocol generation; primary: cs.NI; cross-list: eess.SP, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08355 2026-01-16 cs.CV 78%

Semantic Misalignment in Vision-Language Models under Perceptual Degradation

视觉-语言模型在感知退化下的语义错位

Guo Cheng

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究探讨了视觉-语言模型在感知退化下的语义错位问题,发现传统分割指标的下降并未影响下游行为,揭示了像素鲁棒性与多模态语义可靠性之间的脱节。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10589 2026-01-16 cs.CR cs.CL 77%

Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay

做自己的红队:通过自play和反思经验回放实现安全对齐

Hao Wang, Yanting Wang, Hao Li, Rui Li, Lei Sha

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过自play和反思经验回放机制,使模型自主进化防御能力,提升安全对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10496 2026-01-16 cs.SE cs.AI 77%

Model See, Model Do? Exposure-Aware Evaluation of Bug-vs-Fix Preference in Code LLMs

模型看见,模型做?基于暴露的bug-修复偏好评估

Ali Al-Kaswan, Claudio Spiess, Prem Devanbu, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California at Davis(加州大学戴维斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现LLM在生成代码时更倾向于重复bug而非修复,暴露于bug的示例加剧了这一倾向,而修复暴露则仅有微小改进,揭示了LLM可能传播记忆错误的风险。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10033 2026-01-16 cs.CL 77%

EmplifAI: a Fine-grained Dataset for Japanese Empathetic Medical Dialogues in 28 Emotion Labels

EmplifAI:一个用于日语共情医疗对话的细粒度数据集,包含28种情绪标签

Wan Jou She, Lis Kanashiro Pereira, Fei Cheng, Sakiko Yahata, Panote Siriaraya, Eiji Aramaki

机构 * Kyoto Institute of Technology, Japan(京都技术大学) National Institute of Information and Communications Technology (NICT), Japan(信息通信技术国家研究所) Kyoto University, Japan(京都大学) Nara Institute of Science and Technology, Japan(奈良科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EmplifAI是一个用于日语共情医疗对话的细粒度数据集,包含28种情绪标签,通过微调提升了日本LLM的流畅性和共情能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09883 2026-01-16 cs.AI 77%

Beyond Rule-Based Workflows: An Information-Flow-Orchestrated Multi-Agents Paradigm via Agent-to-Agent Communication from CORAL

超越基于规则的工作流:通过CORAL的agent-to-agent通信实现的信息流协调多智能体范式

Xinxing Ren, Quagmire Zang, Caelum Forder, Suman Deb, Ahsen Tahir, Roman J. Georgio, Peter Carroll, Zekun Guo

机构 * Coral Protocol(Coral协议) Brunel University of London(伦敦布鲁内尔大学) Universitéit Lëtzebuerg(列日大学) University of Hull(霍尔姆大学) National University of Computer and Emerging Sciences(国家计算机与新兴科学大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于信息流协调的多智能体范式,通过agent-to-agent通信替代传统工作流,提升任务处理的灵活性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02737 2026-01-16 cs.CV 75%

Unveiling and Bridging the Functional Perception Gap in MLLMs: Atomic Visual Alignment and Hierarchical Evaluation via PET-Bench

揭示和弥合MLLMs中的功能感知差距:通过PET-Bench实现原子视觉对齐和分层评估

Zanting Ye, Xiaolong Niu, Xuanbin Wu, Xu Han, Shengyuan Liu, Jing Hao, Zhihao Peng, Hao Sun, Jieqin Lv, Fanghu Wang, Yanchao Huang, Hubing Wu, Yixuan Yuan, Habib Zaidi, Arman Rahmim, Yefeng Zheng, Lijun Lu

机构 * School of Biomedical Engineering, Southern Medical University(生物医学工程学院,南方医科大学) School of Biomedical Engineering, Shanghai Jiaotong University(生物医学工程学院,上海交通大学) Department of Electronic Engineering, Chinese University of Hong Kong(电子工程系,中国香港大学) Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) Department of Nuclear Medicine, The Second Affiliated Hospital of Guangzhou University of Chinese Medicine(核医学科,广州中医药大学第二附属医院) PET Center, Department of Nuclear Medicine, Guangdong Provincial People’s Hospital, Southern Medical University(PET中心,核医学科,广东省人民医院,南方医科大学) Department of Nuclear Medicine, Nanfang Hospital, Southern Medical University(核医学科,南芳医院,南方医科大学) Division of Nuclear Medicine and Molecular Imaging, Geneva University Hospitals(核医学与分子影像学部,日内瓦大学医院) Departments of Radiology, Physics, and Biomedical Engineering, The University of British Columbia(放射学、物理和生物医学工程系,不列颠哥伦比亚大学) Medical Artificial Intelligence Laboratory, Westlake University(医学人工智能实验室,西湖大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出AVA方法,通过原子视觉对齐解决MLLMs在功能成像中的感知差距,提升诊断准确性14.83%。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04675 2026-01-16 cs.AI cs.CL cs.LG 75%

Scalable Oversight for Superhuman AI via Recursive Self-Critiquing

通过递归自我批评实现超人类AI的可扩展监督

Xueru Wen, Jie Lou, Xinyu Lu, Junjie Yang, Yanjiang Liu, Yaojie Lu, Debing Zhang, Xing Yu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :SFT(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过递归自我批评实现超人类AI的可扩展监督,探索批评的批评比直接批评更容易,并验证递归批评在AI监督中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10524 2026-01-16 cs.AI 70%

Diagnosing Generalization Failures in Fine-Tuned LLMs: A Cross-Architectural Study on Phishing Detection

在微调大语言模型中诊断泛化失败: phishing检测的跨架构研究

Frank Bobe, Gregory D. Vetaw, Chase Pavlick, Darshan Bryner, Matthew Cook, Jose Salas-Vernis

机构 * Naval Surface Warfare Center Panama City Division(海军水面 warfare 中心巴拿马城分部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过跨架构研究,揭示了微调大语言模型在钓鱼检测任务中泛化失败的原因,发现架构与数据多样性协同作用、架构依赖性及某些架构固有泛化能力。

Comments 16 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10323 2026-01-16 cs.CV cs.CL 70%

ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding

ROMA: 实时多模态助手与交互式流式理解

Xueyun Tian, Wei Li, Bingbing Xu, Heng Dong, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。

Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13142 2026-01-16 cs.AI cs.HC 70%

Can LLMs Understand What We Cannot Say? Measuring Multilevel Alignment Through Abortion Stigma Across Cognitive, Interpersonal, and Structural Levels

LLMs能否理解我们无法表达的内容?通过堕胎污名的多层级对齐进行测量

Anika Sharma, Malavika Mampally, Chidaksh Ravuru, Kandyce Brennan, Neil Gaikwad

机构 * Society-Centered AI Lab(以社会为中心的人工智能实验室) School of Nursing(护理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现LLMs在认知、人际和结构性层面对堕胎污名的理解不一致,缺乏对多维度心理构造的 coherent 理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00010 2026-01-16 cs.CL 70%

PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization

PlotCraft: 推动大语言模型在复杂和交互式数据可视化中的极限

Jiajun Zhang, Jianke Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Binyuan Hui, Qiang Liu, Zilei Wang, Liang Wang, Junyang Lin

机构 * USTC(University of Science and Technology of China) THU(Tsinghua University) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(State Key Laboratory of Information Security)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PlotCraft 提出了一种新的基准和数据集,用于评估大语言模型在复杂和交互式数据可视化任务中的性能,展示了 PlotCraftor 在复杂任务中的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01667 2026-01-16 cs.CL 70%

Testing Low-Resource Language Support in LLMs Using Language Proficiency Exams: the Case of Luxembourgish

通过语言能力考试测试大语言模型对低资源语言的支持:以卢森堡语为例

Cedric Lothritz, Jordi Cabot, Laura Bernardy

机构 * Luxembourg Institute of Science and Technology(卢森堡科学与技术研究所) University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过语言能力考试评估大语言模型对卢森堡语的支持,发现大型模型表现优异,而小型模型表现较弱,且考试成绩可预测其他NLP任务表现。

Comments 24pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10165 2026-01-16 cs.CV 67%

Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method

推动自适应多阶段视频异常推理:一个基准数据集和方法

Chao Huang, Benfeng Wang, Wei Wang, Jie Wen, Li Shen, Wenqi Ren, Yong Xu, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学计算机科学与技术学院(深圳校区)) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出视频异常推理任务及相应数据集,通过结构化思维链和自适应策略优化,提升多阶段视频异常推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10338 2026-01-16 cs.CR cs.AI cs.CL cs.SE 62%

Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

真实世界中的智能体技能:大规模安全漏洞实证研究

Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang

机构 * Tianjin University(天津大学) Southern Cross University(南方十字大学) School of Cybersecurity, Tianjin University(安全学院,天津大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了智能体技能中普遍存在的安全漏洞,提出了一种多阶段检测框架,并展示了技能捆绑执行脚本与漏洞之间的显著关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08847 2026-01-16 cs.CL cs.AI 62%

Scalable and Reliable Evaluation of AI Knowledge Retrieval Systems: RIKER and the Coherent Simulated Universe

可扩展且可靠的AI知识检索系统评估:RIKER和一致性模拟宇宙

JV Roig

机构 * Kamiwaza AI

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 RIKER通过生成文档而非提取地面真实,提供了一种可扩展且抗污染的AI知识检索系统评估方法,揭示了上下文长度、跨文档聚合和事实基础能力等关键问题。

Comments 26 pages, 17 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06336 2026-01-16 cs.LG cs.AI 62%

Future-as-Label: Scalable Supervision from Real-World Outcomes

未来作为标签:从现实结果中获取可扩展的监督

Benjamin Turtel, Paul Wilczewski, Danny Franklin, Kris Skothiem

机构 * Lightning Rod Labs(闪电棒实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 通过利用现实结果作为监督信号,Qwen3-32B在现实预测任务中实现了显著的性能提升,其Brier评分提高27%,校准误差减半,并在多个基准测试中超越了参数更大的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13975 2026-01-16 cs.CL cs.LG 62%

Classifying and Addressing the Diversity of Errors in Retrieval-Augmented Generation Systems

对检索增强生成系统中错误多样性的分类与解决

Kin Kwan Leung, Mouloud Belbahri, Yi Sui, Alex Labach, Xueying Zhang, Stephen Anthony Rose, Jesse C. Cresswell

机构 * Layer 6 AI

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文对检索增强生成系统中的错误类型进行分类,并提出解决方法和数据集,以提升系统的鲁棒性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10580 2026-01-16 cs.CL 57%

Form and Meaning in Intrinsic Multilingual Evaluations

形式与意义在内在多语言评估中的体现

Wessel Poelman, Miryam de Lhoneux

机构 * NLP, Department of Computer Science, KU Leuven(自然语言处理、计算机科学系,鲁文大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究探讨了内在多语言评估中形式与意义的矛盾,发现现有度量在多语言环境下不可比,并通过形式-意义辩论解释其原因。

Comments EACL 2026: Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 57%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10406 2026-01-16 cs.AI 57%

ErrEval: Error-Aware Evaluation for Question Generation through Explicit Diagnostics

ErrEval: 通过显式诊断实现的问题生成的误差感知评估

Weiping Fu, Bifan Wei, Jingyi Hao, Yushun Zhang, Jian Zhang, Jiaxin Wang, Bo Li, Yu He, Lingling Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) School of Continuing Education, Xi’an Jiaotong University(继续教育学院,西安交通大学) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, Xi’an(陕西省大数据知识工程重点实验室,西安) Test center, National University of Defense Technology(测试中心,国防科技大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 ErrEval通过显式诊断机制改进问题生成评估,有效识别并纠正事实性幻觉和答案不匹配等缺陷,提升评估与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10031 2026-01-16 cs.AI 57%

FilDeep: Learning Large Deformations of Elastic-Plastic Solids with Multi-Fidelity Data

FilDeep:利用多保真数据学习弹性-塑性固体的大变形

Jianheng Tang, Shilong Tao, Zhe Feng, Haonan Sun, Menglu Wang, Zhanxing Zhu, Yunhuai Liu

机构 * Peking University(北京大学) University of Southampton(南安普顿大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 FilDeep通过结合低保真度和高保真度数据,解决大变形问题中数据数量与精度的矛盾,实现高效且精确的弹性-塑性固体大变形模拟。

Comments Accepted in Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1 (KDD '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07662 2026-01-16 cs.CL cs.CY 57%

Textual Entailment is not a Better Bias Metric than Token Probability

文本蕴含不是比标记概率更好的偏见度量标准

Virginia K. Felkner, Allison Lim, Jonathan May

机构 * Information Sciences Institute University of Southern California(信息科学研究所 美国南加州大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文通过实验表明,自然语言推理(NLI)与标记概率(TP)在评估语言模型偏见时表现不同,NLI更不稳定且对刻板印象句子更敏感,因此不推荐作为TP的替代方案。

Comments 12 pages, 1 figure. Substantial revisions following October 2025 ARR Cycle. Currently under review in January 2026 ARR Cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14432 2026-01-16 eess.IV cs.CV 50%

A large-scale heterogeneous 3D magnetic resonance brain imaging dataset for self-supervised learning

一种大规模异构三维磁共振脑成像数据集用于自监督学习

Stefano Cerri, Asbjørn Munk, Jakob Ambsdorf, Julia Machnio, Sebastian Nørgaard Llambias, Vardan Nersesjan, Christian Hedeager Krag, Peirong Liu, Pablo Rocamora García, Mostafa Mehdipour Ghazi, Mikael Boesen, Michael Eriksen Benros, Juan Eugenio Iglesias, Mads Nielsen

机构 * Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学) Pioneer Centre For AI(人工智能先锋中心) Copenhagen Research Centre for Biological and Precision Psychiatry(哥本哈根生物与精准精神病学研究中心) Mental Health Centre Copenhagen(哥本哈根心理健康中心) Copenhagen University Hospital(哥本哈根大学医院) Rigshospitalet(皇家医院) Radiological AI Testcenter(放射学AI测试中心) Athinoula A. Martinos Center for Biomedical Imaging(Athinoula A. Martinos生物医学成像中心) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :pretraining(abstract)

AI总结 FOMO300K是一个大规模异构三维磁共振脑成像数据集,旨在支持自监督学习在医学影像中的发展和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09942 2026-01-16 cs.SI cs.CY 50%

How Diplomacy Reshapes Online Discourse:Asymmetric Persistence in Online Framing of North Korea

外交如何重塑在线讨论:在线对朝叙事中的不对称持续性

Hunjun Shin, Hoonbae Moon, Mohit Singhal

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究探讨了高风险外交峰会如何影响在线讨论中对手的叙事方式,发现外交成功可对在线叙事产生短期但持久的影响,即使后续谈判失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05943 2026-01-16 math.OC 50%

Global Optimization for Combinatorial Geometry Problems Revisited in the Era of LLMs

在LLM时代重新审视组合几何问题的全局优化

Timo Berthold, Dominik Kamp, Gioni Mexi, Sebastian Pokutta, Imre Pólik

专题命中 评测与基准 :LLM(abstract)

AI总结 在LLM时代,研究发现通用NLP求解器能有效解决复杂几何问题,并超越LLM驱动算法的最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21817 2026-01-16 cs.CR cs.SE 50%

Out of Distribution, Out of Luck: How Well Can LLMs Trained on Vulnerability Datasets Detect Top 25 CWE Weaknesses?

分布外,运气不足:LLMs在训练于漏洞数据集上的检测Top 25 CWE弱点的能力如何?

Yikun Li, Ngoc Tan Bui, Ting Zhang, Chengran Yang, Xin Zhou, Martin Weyssow, Jinfeng Jiang, Junkai Chen, Huihui Huang, Huu Hung Nguyen, Chiok Yew Ho, Jie Tan, Ruiyin Li, Yide Yin, Han Wei Ang, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 评测与基准 :LLM(abstract)

AI总结 本研究提出BenchVul和TitanVul数据集及RVG流程,评估LLMs在检测Top 25 CWE弱点时的ID与OOD性能差异。

Comments Accepted for publication at ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏