arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2605.12507 2026-05-14 cs.SI cs.AI cs.MA 87%

Can LLM Agents Simulate Dynamic Networks? A Case Study on Email Networks with Phishing Synthesis

大语言模型代理能否模拟动态网络?基于钓鱼合成的邮件网络案例研究

Siqi Miao, Ziyang Chen, Yuhong Luo, Hans Hao-Hsun Hsu, Mufei Li, Kaiqing Zhang, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学 College Park 分校) Rutgers University(罗格斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型多代理系统在模拟动态网络中的能力,提出两种扩展方法以提升网络仿真精度,通过钓鱼合成案例验证了其在建模信息传播和网络安全威胁中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11738 2026-05-13 cs.AI 87%

OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling

OptArgus:一种多智能体系统用于检测基于大语言模型的优化建模中的幻觉

Zhong Li, Zihan Guo, Xiaohan Lu, Juntao Wang, Jie Song, Chao Shen, Jiageng Wu, Mingyang Sun

机构 * Great Bay University(大湾大学) Peking University(北京大学) Jilin University(吉林大学) Zhejiang University(浙江大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出OptArgus多智能体系统,通过细粒度幻觉分类法检测优化建模中的错误,通过三部分基准测试验证其在清洁、控制和自然生成 artifact 上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11330 2026-05-13 cs.AI 87%

Rethinking Evaluation for LLM Hallucination Detection: A Desiderata, A New RAG-based Benchmark, New Insights

重新思考LLM幻觉检测的评估:一种需求清单,一个新的基于RAG的基准,新的见解

Wenbo Chen, Veena Padmanabhan, Tootiya Giyahchi, Elaine Wong, Leman Akoglu

机构 * Amazon(亚马逊公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出了一种基于RAG的新型基准T RIVIA+,填补了现有基准在长上下文和噪声标签方面的空白,并通过实验揭示了当前检测器在RAG基准上的改进空间。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11026 2026-05-13 cs.CR cs.CL 87%

AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents

AgentShield:基于欺骗的工具使用LLM代理 compromise 检测

Yassin H. Rassul, Tarik A. Rashid

机构 * Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系) Engineering Department, School of Science(科学学院工程系) Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院) Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 AgentShield 通过在代理工具接口中设置三层陷阱(假工具、假凭证、允许参数)来检测间接提示注入攻击,利用高精度标签训练自监督分类器,实现高准确率的实时检测与无误报的下游检测训练。

Comments 20 pages, 5 figures. Code: https://github.com/Yassin-H-Rassul/AgentShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09518 2026-05-12 cs.LG 87%

LLM-Driven Performance-Space Augmentation for Meta-Learning-Based Algorithm Selection

基于大语言模型的性能空间增强用于基于元学习的算法选择

Darren Zhu, Daren Ler

机构 * Department of Statistics and Data Science(统计与数据科学系) National University of Singapore(新加坡国立大学) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过大语言模型生成合成回归数据来增强元数据集,以提升元学习在算法选择中的性能,发现均匀采样策略在多个指标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08533 2026-05-12 cs.AI 87%

Human-LLM Dialogue Improves Diagnostic Accuracy in Emergency Care

人类与大语言模型对话提高急诊护理的诊断准确性

Burcu Sayin, Ngoc Vo Hong, Ipek Baris Schlicht, Jacopo Staiano, Pasquale Minervini, Sara Allievi, Nicola Susca, Nicola Osti, Alberto Maino, Vito Racanelli, Andrea Passerini

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Department of Medicine, Azienda Sanitaria Universitaria Integrata del Trentino (ASUIT)(特伦托大学整合卫生机构医学部) Center for Medical Sciences (CISMed), University of Trento(特伦托大学医学科学中心) Universitat Politècnica de València(瓦伦西亚理工大学) The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究探讨人类与大语言模型对话在急诊护理中的应用,通过对比基线和AI辅助会话,发现住院医师在复杂病例中的诊断准确性显著提升,且交互式LLM支持显著增强了诊断推理能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22868 2026-05-12 cs.CR cs.AI 87%

Agent-Sentry: Bounding LLM Agents via Execution Provenance

Agent-Sentry: 通过执行溯源界定了LLM代理

Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

机构 * University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Agent Sentry,通过学习代理良性执行的边界来检测恶意行为,有效阻止注入攻击,同时允许良性执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07830 2026-05-11 cs.CR cs.AI 87%

CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

CyBiasBench:用于网络攻击场景的LLM代理偏见基准测试

Taein Lim, Seongyong Ju, Munhyeok Kim, Hyunjun Kim, Hoki Kim

机构 * Chung-Ang University(Chung-Ang大学) Myongji University(Myongji大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CyBiasBench,通过630次会话评估五个代理在三种目标和四种提示条件下的攻击偏见,揭示代理在攻击家族分配上的差异及偏见动量效应。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02379 2026-05-08 cs.LG cs.CV 87%

Teaching Metric Distance to Discrete Autoregressive Language Models

向离散自回归语言模型传授度量距离

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院) Seoul National University(首尔国立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 本文提出DIST2Loss,通过奖励加权分布替代one-hot目标,提升离散自回归模型的数据效率和跨领域表现,应用于视觉 grounding、机器人操控、奖励建模和向量量化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05842 2026-05-08 cs.AI 87%

Taklif.AI: LLM-Powered Platform for Interest-Based Personalized College Assignments

Taklif.AI:基于大语言模型的基于兴趣的个性化大学作业平台

Zaki Kurdya, Mohammed Zuqlam, Salem Amassi, Shady Telbany, Motaz Saad

机构 * Faculty of Information Technology(信息科技学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Taklif.AI利用大语言模型生成个性化作业,结合学生兴趣和文化背景,提升学生参与度,减少抄袭风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05725 2026-05-08 cs.AI 87%

Detecting Time Series Anomalies Like an Expert: A Multi-Agent LLM Framework with Specialized Analyzers

像专家一样检测时间序列异常:一种多智能体LLM框架与专用分析器

Hyeongwon Kang, Jeongseob Kim, Jinwoo Park, Pilsung Kang

机构 * Department of Industrial and Management Engineering(工业与管理工程系) Korea University(韩国大学) Department of Industrial Engineering(工业工程系) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAGE框架,通过四个专用分析器检测单变量时间序列的异常,结合数值工具和可视化生成证据,提升异常检测的可靠性与实用性。

Comments Preprint. 9 pages main text, 29 pages total, 8 figures, 9 tables, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05241 2026-05-08 cs.RO cs.LG 87%

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

DexSim2Real: 基于基础模型的仿真到现实迁移用于通用的灵巧操作

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学) UCSI University(UCSI大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本文提出DexSim2Real框架,结合基础模型引导的域随机化、触觉视觉交叉注意力策略和渐进技能课程,提升灵巧操作的仿真到现实迁移性能,实验表明其在现实世界中的成功率达到78.2%。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01582 2026-05-05 cs.IR cs.AI 87%

KG-First, LLM-Fallback: A Hybrid Microservice for Grounded Skill Search and Explanation

基于知识图谱与大语言模型的混合微服务:面向 grounded skill search 和解释的 hybrid 方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * UTC(UTC大学) LPNHE(LPNHE研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 SkillGraph-Service 微服务,通过统一权威能力框架资源构建知识图谱,结合符号严谨与子符号灵活,实现教育者查询中的词汇不匹配处理,并利用大语言模型进行约束排序和受众感知解释,实验证明其在多语言数据集上具有高检索效果和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01449 2026-05-05 cs.CR cs.AI 87%

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

VisInject:破坏≠注入——对视觉-语言模型中通用对抗攻击的双维度评估

Pang Liu, Yingjie Lao

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文通过双维度评估揭示视觉-语言模型中通用对抗攻击的脆弱性,发现攻击成功与精确注入存在显著差异,揭示了模型在微小扰动下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20965 2026-05-01 q-fin.TR cs.AI cs.MA q-fin.CP q-fin.ST 87%

Learning to Aggregate Zero-Shot LLM Agents for Corporate Disclosure Classification

学习聚合零样本大语言模型代理以进行企业披露分类

Kemal Kirtac

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过聚合零样本大语言模型输出提升企业披露分类性能,发现监督聚合优于零样本投票,尤其在混合信号披露中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27421 2026-05-01 cs.IR cs.CL 87%

A Reproducibility Study of LLM-Based Query Reformulation

基于大语言模型的查询改写可重复性研究

Amin Bigdeli, Radin Hamidi Rad, Hai Son Le, Mert Incesu, Negar Arabzadeh, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) Mila – Quebec AI Institute(魁北克AI研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of Toronto(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文在统一框架下系统评估了十种代表性大语言模型查询改写方法,发现检索范式对改写效果有显著影响,且大模型并不总能提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22971 2026-04-28 cs.CY cs.AI cs.MA 87%

Peer Identity Bias in Multi-Agent LLM Evaluation: An Empirical Study Using the TRUST Democratic Discourse Analysis Pipeline

多智能体大语言模型评估中的同伴身份偏差:使用TRUST民主话语分析流水线的实证研究

Juergen Dietrich

机构 * TRUST Project(TRUST项目)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过TRUST民主话语分析流水线评估多智能体大语言模型的同伴身份偏差,发现单一通道匿名化几乎无偏差,而完整流水线匿名化揭示了同质化集合体放大身份驱动的阿谀行为,异质化生产配置则相反。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22273 2026-04-27 cs.AI 87%

When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention

当大语言模型自我纠正有助于什么?一种控制论马尔可夫诊断和先验证干预

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文通过控制论马尔可夫模型分析自我纠正的条件,发现近零误差阈值决定其有效性,并通过实验验证先验证提示能有效减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19645 2026-04-22 cs.CL 87%

The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text

信号即是上限:从开放式调查文本中LLM预测经验评分的测量限制

Andrew Hong, Jason Potteiger, Luis E. Zapata

机构 * Dimension Labs(Dimension实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了提示设计和模型选择对LLM预测经验评分的影响,发现文本本身的语言特征对准确性影响更大,提示工程只能在特定范围内提升性能。

Comments 42 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 87%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17842 2026-04-21 cs.CL 87%

QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks

QuickScope:动态LLM基准测试中验证难题问题

Taylor Lundy, Narun K. Raman, Kevin Leyton-Brown

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出QuickScope方法,通过改进的COUP算法高效识别动态基准测试中的难题问题,减少误报并提升样本效率。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16120 2026-04-21 cs.CL 87%

Language Models Don't Know What You Want: Evaluating Personalization in Deep Research Needs Real Users

语言模型不知道你想要什么:评估深度研究中个性化需求需要真实用户

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Eunsol Choi, Jordan Lee Boyd-Graber, Aakanksha Naik

机构 * University of Maryland(马里兰大学) Allen Institute for Artificial Intelligence(人工智能研究院) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 本文提出MyScholarQA系统,通过用户兴趣分析、个性化查询响应和报告生成,评估深度研究中个性化需求,发现LLM评估存在不足,需真实用户参与以实现有效个性化。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17191 2026-04-21 cs.LG 87%

Do LLM-derived graph priors improve multi-agent coordination?

基于大语言模型的图先验是否能提升多智能体协调?

Nikunj Gupta, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(美国陆军研究办公室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨大语言模型能否通过少量自然语言描述推断出多智能体协调的图先验,以提升动态环境中的协调与适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16337 2026-04-21 cs.IR cs.AI cs.CY 87%

HR-Agents: Using Multiple LLM-based Agents to Improve Q&A about Brazilian Labor Legislation

HR-Agents:利用多个基于大语言模型的代理提高关于巴西劳动立法的问题解答

Abriel K. Moraes, Gabriel S. M. Dias, Vitor L. Fabris, Lucas D. Gessoni, Leonardo R. do Nascimento, Charles S. Oliveira, Vitor G. C. B. de Farias, Fabiana C. Q. de O. Marucci, Matheus H. R. Vicente, Gabriel U. Talasso, Erik Soares, Amparo Munoz, Sildolfo Gomes, Maria L. A. de S. Cruvinel, Leonardo T. dos Santos, Renata De Paris, Wandemberg Gibaut

机构 * Eldorado Institute of Research(埃洛多研究 institute)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用多代理系统提升巴西劳动立法问题解答的准确性与效率,通过整合检索增强生成技术,改进HR专业人员的合规性与操作效率。

Comments Paper presented on: July 2025 Conference: XVII Simpósio Brasileiro de Automação Inteligente (SBAI) At: São João del-Rei

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16318 2026-04-21 cs.IR cs.CL 87%

Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations

诊断基于大语言模型的重排器在冷启动推荐系统中的表现:覆盖、曝光与实际缓解措施

Ekaterina Lemdiasova, Nikita Zmanovskii

机构 * V. A. Trapeznikov ICS RAS Russian Biotechnological University (ROSBIOTECH)(Trapeznikov ICS 俄罗斯科学院俄罗斯生物技术大学) Russian Biotechnological University (ROSBIOTECH)(俄罗斯生物技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Serendipity-2018数据集研究冷启动电影推荐中交叉编码器重排器的表现,发现检索覆盖不足、曝光偏差和评分区分度低三大问题,并提出混合检索策略、候选池优化和评分校准等缓解措施。

Comments 12 pages, 7 figures. Code and data available at https://github.com/nikita-zmanovskiy/cold-start-algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16304 2026-04-21 cs.SE cs.AI cs.HC 87%

Results-Actionability Gap: Understanding How Practitioners Evaluate LLM Products in the Wild

结果-可行动性差距:理解从业者如何在实际中评估大语言模型产品

Willem van der Maden, Malak Sadek, Ziang Xiao, Aske Mottelson, Q. Vera Liao, Jichen Zhu

机构 * HCI \& Design Section IT University of Copenhagen Copenhagen Denmark Centre for Human-Inspired Artificial Intelligence, Cambridge University Cambridge United Kingdom Computer Science Johns Hopkins University Baltimore Maryland United States Engineering University of Michigan Ann Arbor Michigan United States IT University of Copenhagen Centre for Human-Inspired Artificial Intelligence, Cambridge University Johns Hopkins University University of Michigan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨从业者如何评估大语言模型产品,发现'结果-可行动性差距'问题,提出策略帮助从业者从非正式评估转向系统化评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15001 2026-04-20 cs.AI 87%

COEVO: Co-Evolutionary Framework for Joint Functional Correctness and PPA Optimization in LLM-Based RTL Generation

COEVO:用于LLM基于RTL生成中功能正确性与PPA优化的联合进化框架

Heng Ping, Peiyu Zhang, Shixuan Li, Wei Yang, Anzhe Cheng, Shukai Duan, Xiaole Zhang, Paul Bogdan

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出COEVO框架,通过联合优化功能正确性与PPA,在单个进化循环中统一两者目标,提升RTL生成效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16761 2026-04-17 cs.CL 87%

Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions

基于扩展调查数据的语言模型微调以预测公众意见分布

Joseph Suh, Erfan Jahanparast, Suhong Moon, Minwoo Kang, Serina Chang

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文通过微调大型语言模型,利用调查数据的结构特性提升对公众意见分布的预测能力,实验显示在多种子群体中模型预测与人类响应的匹配度显著提高,且能泛化到未见过的调查和子群体。

Comments ACL 2025 Long Main (https://aclanthology.org/2025.acl-long.1028/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09152 2026-04-15 cs.AI 87%

PrivacyReasoner: Can LLM Emulate a Human-like Privacy Mind?

PrivacyReasoner: LLM能否模拟出类似人类的隐私思维?

Yiwen Tu, Xuan Liu, Lianhui Qin, Haojian Jin

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出PrivacyReasoner,通过构建基于三个核心理念的代理架构,模拟人类隐私思维,评估结果显示其在预测个人隐私关切和跨领域泛化方面优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12191 2026-04-15 cs.AI 87%

Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities

超越分数:通过细粒度能力进行诊断LLM评估

Xu Zhang, Xudong Gong, Jiacheng Qin, Qiang Wang, JiaQi Liao, Zhe Wang, Dawei Feng, Bo Ding

机构 * College of Computer Science Technology, National University of Defense Technology, Changsha, Hunan, China State Key Laboratory of Complex \& Critical Software Environment, Changsha, Hunan, China National Key Laboratory of Parallel School of Humanities Social Sciences, School of Public Administration, Beihang University, Beijing, China

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于细粒度能力的诊断框架,通过多维项目反应理论估计模型能力,实现对不同任务的精准评估,提升模型改进和任务选择的针对性。

详情

展开后加载摘要…

URL PDF HTML 收藏