arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 299 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 51 篇

2601.06276 2026-02-04 cs.SE cs.CR 89%

Automated Generation of Accurate Privacy Captions From Android Source Code Using Large Language Models

基于大语言模型的Android源代码中准确隐私描述的自动化生成

Vijayanta Jain, Sepideh Ghanavati, Sai Teja Peddinti, Collin McMillan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出PCapGen方法,利用大语言模型自动从Android源代码生成准确、简洁的隐私描述,有效解决现有方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07020 2026-02-04 cs.CL cs.AI 88%

TurkBench: A Benchmark for Evaluating Turkish Large Language Models

TurkBench:评估土耳其大型语言模型的基准测试

Çağrı Toraman, Ahmet Kaan Sever, Ayse Aysu Cengiz, Elif Ecem Arslan, Görkem Sevinç, Mete Mert Birdal, Yusuf Faruk Güldemir, Ali Buğra Kanburoğlu, Sezen Felekoğlu, Osman Gürlek, Sarp Kantar, Birsen Şahin Kütük, Büşra Tufan, Elif Genç, Serkan Coşkun, Gupse Ekin Demir, Muhammed Emin Arayıcı, Olgun Dursun, Onur Gungor, Susan Üsküdarlı, Abdullah Topraksoy, Esra Darıcı

机构 * Computer Sci. Dpt., Bilkent Uni.(计算机科学系,比尔肯特大学) Mathematics Dpt., Middle East Technical University(数学系,中东部技术大学) Turkcell AI(Turkcell人工智能) Sociology Dpt., Hacettepe University(社会学系,哈恰塔尔佩大学) Computer Engineering Dpt., Bogazici University(计算机工程系,博资基大学) Linguistics Dpt., Istanbul University(语言学系,伊斯坦布尔大学) Turkish Lang. Dpt., Middle East Technical University(土耳其语言系,中东部技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 TurkBench是一个用于评估土耳其大型语言模型能力的综合基准测试,包含21个子任务和6大类别,旨在帮助研究人员改进模型性能。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02738 2026-02-04 cs.SD cs.AI 88%

When Noise Lowers The Loss: Rethinking Likelihood-Based Evaluation in Music Large Language Models

噪声降低损失:重新思考音乐大语言模型中的基于似然的评估

Xiaosha Li, Chun Liu, Ziyu Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance Inc.(字节跳动公司) Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学研究所) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出通过损失曲线形状而非绝对值来评估音乐生成质量,揭示模型对局部破坏的敏感性,为更有效的训练目标和基准提供新思路。

Comments Accepted by IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02519 2026-02-04 cs.CY cs.AI 88%

Evaluation of Large Language Models' educational feedback in Higher Education: potential, limitations and implications for educational practice

对高等教育中大语言模型教育反馈的评估:潜力、限制及对教育实践的影响

Daniele Agostini, Federica Picasso

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在高等教育中的教育反馈潜力,发现其能生成结构良好的反馈,但需明确指导以提升教育实践效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22244 2026-02-04 econ.GN q-fin.EC 88%

Valuing Time in Silicon: Can Large Language Models Replicate Human Value of Travel Time

硅中的时间价值:大语言模型能否复制人类的旅行时间价值

Yingnan Yan, Tianming Liu, Yafeng Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过分析三种大语言模型的旅行时间价值,发现其行为与人类高度相似,但存在模型间敏感度差异,为LLMs作为人类旅行者代理提供了基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10415 2026-02-04 cs.SE cs.AI 87%

How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation

如何欺骗你的AI助教:对LLM代码评估中学术劫持的系统研究

Devanshu Sahoo, Vasudev Majhi, Arjun Neekhra, Yash Sinha, Murari Mandal, Dhruv Kumar

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了学术情境中针对LLM代码评估器的劫持攻击,提出了一种新的攻击类型,并通过实验揭示了LLM在面对此类攻击时的脆弱性。

Comments This manuscript has been withdrawn by the authors because the methodology and results have been superseded by a more rigorous framework (SPACI and AST-ASIP). The corrected and expanded findings are now available in arXiv:2601.21360. Please cite the new manuscript instead

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03551 2026-02-04 cs.CL 86%

Assessing the Impact of Typological Features on Multilingual Machine Translation in the Age of Large Language Models

评估大规模语言模型时代语言类型特征对多语言机器翻译的影响

Vitalii Hirak, Jaap Jumelet, Arianna Bisazza

机构 * Data & Knowledge Engineering, Heinrich Heine University(海因里希·海因大学数据与知识工程系) Center for Language and Cognition (CLCG), University of Groningen(格罗宁根大学语言与认知中心)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文研究了语言类型特征对多语言机器翻译质量的影响,通过分析两种先进模型发现目标语言类型显著影响翻译效果,并提出了细粒度的语言类型属性以促进进一步研究。

Comments 19 pages, 11 figures, EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 86%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02724 2026-02-04 cs.NE 86%

Automatic Design of Optimization Test Problems with Large Language Models

利用大语言模型自动设计优化测试问题

Wojciech Achtelik, Hubert Guzowski, Maciej Smołka, Jacek Mańdziuk

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 EoTF利用大语言模型自动设计优化测试问题,通过生成与目标ELA特征向量匹配的连续优化函数,提高基准测试的可扩展性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03128 2026-02-04 cs.AI 85%

Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis

理解多智能体大语言模型框架:一个统一的基准测试和实验分析

Abdelghny Orogat, Ana Rostam, Essam Mansour

机构 * Concordia University(康科迪亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MAFBench统一评估套件,系统比较多智能体LLM框架,揭示架构设计对性能的显著影响。

Comments 25 pages, 9 figures and 13 tables; introduces MAFBench unified multi-agent evaluation suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03712 2026-02-04 cs.SE 85%

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14943 2026-02-04 cs.HC 85%

State of the Art of LLM-Enabled Interaction with Visualization

大语言模型赋能的可视化交互现状

Mathis Brossier, Tobias Isenberg, Konrad Schönborn, Jonas Unger, Mario Romero, Johanna Björklund, Anders Ynnerman, Lonni Besançon

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。

Comments Submitted to STARs of EuroVis'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02932 2026-02-04 cs.CL cs.AI 84%

Equal Access, Unequal Interaction: A Counterfactual Audit of LLM Fairness

平等接入,不平等互动:对大语言模型公平性的反事实审计

Alireza Amiri-Margavi, Arshia Gharagozlou, Amin Gholami Davodi, Seyed Pouyan Mousavi Davoudi, Hamidreza Hasani Balyani

机构 * Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡大学) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth分校) Independent Researcher in AI and Statistics(人工智能与统计学独立研究者) Hardware Technology Organization(硬件技术组织)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过反事实提示设计,评估了GPT-4和LLaMA在不同人口身份下的互动质量差异,发现即使接入平等,模型在互动质量上仍存在系统性差异。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03794 2026-02-04 cs.AI cs.LG 81%

Understanding Agent Scaling in LLM-Based Multi-Agent Systems via Diversity

通过多样性理解基于大语言模型的多智能体系统中的智能体扩展

Yingxuan Yang, Chengrui Qu, Muning Wen, Laixi Shi, Ying Wen, Weinan Zhang, Adam Wierman, Shangding Gu

机构 * Shanghai Jiao Tong University(上海交通大学) California Institute of Technology(加州理工学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过引入K*指标,揭示了基于大语言模型的多智能体系统中,异质性智能体配置比同质配置更有效,且性能受任务不确定性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03678 2026-02-04 cs.LG cs.AI 81%

ContraLog: Log File Anomaly Detection with Contrastive Learning and Masked Language Modeling

ContraLog:基于对比学习和掩码语言模型的日志文件异常检测

Simon Dietz, Kai Klede, An Nguyen, Bjoern M Eskofier

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ContraLog通过对比学习和掩码语言模型实现日志文件异常检测,无需解析器即可预测连续消息嵌入,有效应对复杂日志数据。

Comments 26 pages with 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02510 2026-02-04 cs.CY cs.AI cs.CL cs.CV 81%

Beyond Translation: Cross-Cultural Meme Transcreation with Vision-Language Models

超越翻译:基于视觉-语言模型的跨文化表情包再创作

Yuming Zhao, Peiyi Zhang, Oana Ignat

机构 * Santa Clara University(圣克拉拉大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于视觉-语言模型的跨文化表情包再创作框架,通过大规模数据集和多维度评估,揭示了跨文化再创作中的方向性差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14103 2026-02-04 cs.CR cs.AI cs.LG cs.SD eess.AS 81%

AudioJailbreak: Jailbreak Attacks against End-to-End Large Audio-Language Models

AudioJailbreak: 对端到端大音频-语言模型的攻击

Guangke Chen, Fu Song, Zhe Zhao, Xiaojun Jia, Yang Liu, Yanchen Qiao, Weizhe Zhang, Weiping Tu, Yuhong Yang, Bo Du

机构 * Wuhan University(武汉大学) Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) State Key Laboratory of Cryptology(密码学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Nanjing Institute of Software Technology(南京软件技术研究所) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 AUDIOJAILBREAK 提出了一种针对端到端大音频-语言模型的新型音频攻击方法,具备非同步性、通用性、隐蔽性和空中鲁棒性,适用于弱攻击者场景。

Comments Accepted by IEEE Transactions on Dependable and Secure Computing (TDSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02162 2026-02-04 cs.CV cs.AI cs.RO 79%

Mapping the Unseen: Unified Promptable Panoptic Mapping with Dynamic Labeling using Foundation Models

映射未知:利用基础模型的动态标签统一提示式全景映射

Mohamad Al Mdfaa, Raghad Salameh, Geesara Kulathunga, Sergey Zagoruyko, Gonzalo Ferrer

机构 * 1 Applied AI Institute, Moscow 121205 , Russia (R.S.) 2 School of Computer Science, University of Lincoln, Lincoln LN6 7TS , UK 3 Independent Researcher, Dubai 500001, United Arab Emirates

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 UPPM通过基础模型引入动态描述符,实现开放式词汇与统一结构的协调,提升全景地图的几何和语义准确性。

Journal ref Robotics, vol. 15, no. 2, article 31, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03302 2026-02-04 cs.CV cs.AI 79%

Full end-to-end diagnostic workflow automation of 3D OCT via foundation model-driven AI for retinal diseases

通过基于基础模型的AI实现3D OCT的全流程诊断工作流程自动化用于视网膜疾病

Jinze Zhang, Jian Zhong, Li Lin, Jiaxiong Li, Ke Ma, Naiyang Li, Meng Li, Yuan Pan, Zeyu Meng, Mengyun Zhou, Shang Huang, Shilong Yu, Zhengyu Duan, Sutong Li, Honghui Xia, Juping Liu, Dan Liang, Yantao Wei, Xiaoying Tang, Jin Yuan, Peng Xiao

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 FOCUS通过基于基础模型的AI实现3D OCT视网膜疾病诊断的端到端自动化,提高了诊断效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI 79%

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11338 2026-02-04 cs.CL 79%

Surprisal from Larger Transformer-based Language Models Predicts fMRI Data More Poorly

基于更大变换器语言模型的惊奇值对fMRI数据的预测效果更差

Yi-Chien Lin, William Schuler

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本研究使用17个预训练语言模型对两个fMRI数据集进行评估,发现模型每词估计概率与拟合程度呈反比关系,表明反比现象不局限于延迟数据。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03633 2026-02-04 cs.CL cs.AI cs.DB 79%

BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish

BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应

Burak Aktaş, Mehmet Can Baytekin, Süha Kağan Köse, Ömer İlbilgi, Elif Özge Yılmaz, Çağrı Toraman, Bilge Kaan Görür

专题命中 评测与基准 :LLM(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03053 2026-02-04 cs.AI cs.CL cs.MA 79%

MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

MAS-ProVe: 理解多智能体系统的进程验证

Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Austin Xu, Xiaoxiao He, Yingbo Zhou, Semih Yavuz, Hao Wang, Shafiq Joty

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MAS-ProVe研究多智能体系统进程验证的有效性,发现LLM作为法官表现优于奖励方法,但验证过程仍面临上下文长度与性能的权衡问题。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02888 2026-02-04 cs.CL cs.AI 79%

HALT: Hallucination Assessment via Log-probs as Time series

HALT:通过log-prob作为时间序列进行幻觉评估

Ahmad Shapiro, Karan Taneja, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HALT通过log-prob时间序列检测幻觉,比Lettuce更高效且兼容专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03137 2026-02-04 cs.CV 78%

FSOD-VFM: Few-Shot Object Detection with Vision Foundation Models and Graph Diffusion

基于视觉基础模型和图扩散的少样本目标检测:FSOD-VFM

Chen-Bin Feng, Youyang Sha, Longfei Liu, Yongjun Yu, Chi Man Vong, Xuanlong Yu, Xi Shen

机构 * University of Macau(澳门大学) Intellindust AI Lab(Intellindust AI实验室)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 FSOD-VFM通过结合视觉基础模型和图扩散技术,有效解决少样本目标检测中的边界框碎片化问题,提升检测精度和效率。

Comments Accepted by ICLR 2026. Code is available at: \url{https://intellindust-ai-lab.github.io/projects/FSOD-VFM}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03076 2026-02-04 cs.CV 78%

A generalizable large-scale foundation model for musculoskeletal radiographs

一种通用的大规模肌骨放射影像基础模型

Shinn Kim, Soobin Lee, Kyoungseob Shin, Han-Soo Kim, Yongsung Kim, Minsu Kim, Juhong Nam, Somang Ko, Daeheon Kwon, Wook Huh, Ilkyu Han, Sunghoon Kwon

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 SKELEX是一种基于大规模肌骨放射影像训练的通用基础模型,通过自监督学习实现跨疾病和解剖区域的泛化,展示了零样本异常定位能力,并用于骨肿瘤预测的可解释模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00880 2026-02-04 cs.HC 78%

Sensing What Surveys Miss: Understanding and Personalizing Proactive LLM Support by User Modeling

感知调查所遗漏的:通过用户建模理解并个性化主动LLM支持

Ailin Liu, Yesmine Karoui, Fiona Draxler, Frauke Kreuter, Francesco Chiossi

专题命中 评测与基准 :LLM(title,abstract)

AI总结 通过用户建模实现主动LLM支持,提升在线调查的响应准确性和用户满意度。

Comments This manuscript has been accepted to CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03709 2026-02-04 cs.CL 77%

No Shortcuts to Culture: Indonesian Multi-hop Question Answering for Complex Cultural Understanding

没有捷径的文化:印尼多跳问答用于复杂文化理解

Vynska Amalia Permadi, Xingwei Tan, Nafise Sadat Moosavi, Nikos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ID-MoCQA是一个基于印尼传统的多跳问答数据集,旨在评估大型语言模型的文化理解能力,揭示模型在文化推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07180 2026-02-04 cs.SE cs.AI 77%

Code2Bench: Scaling Source and Rigor for Dynamic Benchmark Construction

Code2Bench: 通过动态基准构建实现源代码和严谨性扩展

Zhe Zhang, Runlin Liu, Aishan Liu, Xingyu Liu, Xiang Gao, Hailong Sun

机构 * Beihang University(北航大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Code2Bench通过动态扩展问题源和严谨性测试,构建了首个支持Python和Java的基准套件,揭示了LLM在代码生成任务中的性能差异和语言生态影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03340 2026-02-04 cs.AI 77%

MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis

MentalSeek-Dx: 向现实世界精神病诊断的渐进性假说-演绎推理迈进

Xiao Sun, Yuming Yang, Junnan Zhu, Jiang Zhong, Xinyu Zhou, Kaiwen Wei

机构 * School of Computer Science Chongqing University(重庆大学计算机学院) MAIS Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MentalSeek-Dx通过监督轨迹构建和课程强化学习,实现了在现实世界精神病诊断中的渐进性假说-演绎推理,以提升临床诊断的可靠性。

Comments 36 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏