arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2607.29085 2026-08-03 cs.CY 新提交 88%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15846 2026-07-30 cs.CV 版本更新 88%

A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

多模态大语言模型时代的动态场景图生成研究

Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14249 2026-07-29 cs.LG cs.AI cs.CL 88%

Humanity's Last Exam

人类最后的考试

Long Phan, Alice Gatti, Ziwen Han, Nathaniel Li, Josephina Hu, Hugh Zhang, Chen Bo Calvin Zhang, Mohamed Shaaban, John Ling, Sean Shi, Michael Choi, Anish Agrawal, Arnav Chopra, Adam Khoja, Ryan Kim, Richard Ren, Jason Hausenloy, Oliver Zhang, Mantas Mazeika, Dmitry Dodonov, Tung Nguyen, Jaeho Lee, Daron Anderson, Mikhail Doroshenko, Alun Cennyth Stokes, Mobeen Mahmood, Oleksandr Pokutnyi, Oleg Iskra, Jessica P. Wang, John-Clark Levin, Mstyslav Kazakov, Fiona Feng, Steven Y. Feng, Haoran Zhao, Michael Yu, Varun Gangal, Chelsea Zou, Zihan Wang, Serguei Popov, Robert Gerbicz, Geoff Galgon, Johannes Schmitt, Will Yeadon, Yongki Lee, Scott Sauers, Alvaro Sanchez, Fabian Giska, Marc Roth, Søren Riis, Saiteja Utpala, Noah Burns, Gashaw M. Goshu, Mohinder Maheshbhai Naiya, Chidozie Agu, Zachary Giboney, Antrell Cheatom, Francesco Fournier-Facio, Sarah-Jane Crowson, Lennart Finke, Zerui Cheng, Jennifer Zampese, Ryan G. Hoerr, Mark Nandor, Hyunwoo Park, Tim Gehrunger, Jiaqi Cai, Ben McCarty, Alexis C Garretson, Edwin Taylor, Damien Sileo, Qiuyu Ren, Usman Qazi, Lianghui Li, Jungbae Nam, John B. Wydallis, Pavel Arkhipov, Jack Wei Lun Shi, Aras Bacho, Chris G. Willcocks, Hangrui Cao, Sumeet Motwani, Emily de Oliveira Santos, Johannes Veith, Edward Vendrow, Doru Cojoc, Kengo Zenitani, Joshua Robinson, Longke Tang, Yuqi Li, Joshua Vendrow, Natanael Wildner Fraga, Vladyslav Kuchkin, Andrey Pupasov Maksimov, Pierre Marion, Denis Efremov, Jayson Lynch, Kaiqu Liang, Aleksandar Mikov, Andrew Gritsevskiy, Julien Guillod, Gözdenur Demir, Dakotah Martinez, Ben Pageler, Kevin Zhou, Saeed Soori, Ori Press, Henry Tang, Paolo Rissone, Sean R. Green, Lina Brüssel, Moon Twayana, Aymeric Dieuleveut, Joseph Marvin Imperial, Ameya Prabhu, Jinzhou Yang, Nick Crispino, Arun Rao, Dimitri Zvonkine, Gabriel Loiseau, Mikhail Kalinin, Marco Lukas, Ciprian Manolescu, Nate Stambaugh, Subrata Mishra, Tad Hogg, Carlo Bosio, Brian P Coppola, Julian Salazar, Jaehyeok Jin, Rafael Sayous, Stefan Ivanov, Philippe Schwaller, Shaipranesh Senthilkuma, Andres M Bran, Andres Algaba, Kelsey Van den Houte, Lynn Van Der Sypt, Brecht Verbeken, David Noever, Alexei Kopylov, Benjamin Myklebust, Bikun Li, Lisa Schut, Evgenii Zheltonozhskii, Qiaochu Yuan, Derek Lim, Richard Stanley, Tong Yang, John Maar, Julian Wykowski, Martí Oller, Anmol Sahu, Cesare Giulio Ardito, Yuzheng Hu, Ariel Ghislain Kemogne Kamdoum, Alvin Jin, Tobias Garcia Vilchis, Yuexuan Zu, Martin Lackner, James Koppel, Gongbo Sun, Daniil S. Antonenko, Steffi Chern, Bingchen Zhao, Pierrot Arsene, Joseph M Cavanagh, Daofeng Li, Jiawei Shen, Donato Crisostomi, Wenjin Zhang, Ali Dehghan, Sergey Ivanov, David Perrella, Nurdin Kaparov, Allen Zang, Ilia Sucholutsky, Arina Kharlamova, Daniil Orel, Vladislav Poritski, Shalev Ben-David, Zachary Berger, Parker Whitfill, Michael Foster, Daniel Munro, Linh Ho, Shankar Sivarajan, Dan Bar Hava, Aleksey Kuchkin, David Holmes, Alexandra Rodriguez-Romero, Frank Sommerhage, Anji Zhang, Richard Moat, Keith Schneider, Zakayo Kazibwe, Don Clarke, Dae Hyun Kim, Felipe Meneguitti Dias, Sara Fish, Veit Elser, Tobias Kreiman, Victor Efren Guadarrama Vilchis, Immo Klose, Ujjwala Anantheswaran, Adam Zweiger, Kaivalya Rawal, Jeffery Li, Jeremy Nguyen, Nicolas Daans, Haline Heidinger, Maksim Radionov, Václav Rozhoň, Vincent Ginis, Christian Stump, Niv Cohen, Rafał Poświata, Josef Tkadlec, Alan Goldfarb, Chenguang Wang, Piotr Padlewski, Stanislaw Barzowski, Kyle Montgomery, Ryan Stendall, Jamie Tucker-Foltz, Jack Stade, T. Ryan Rogers, Tom Goertzen, Declan Grabb, Abhishek Shukla, Alan Givré, John Arnold Ambay, Archan Sen, Muhammad Fayez Aziz, Mark H Inlow, Hao He, Ling Zhang, Younesse Kaddar, Ivar Ängquist, Yanxu Chen, Harrison K Wang, Kalyan Ramakrishnan, Elliott Thornley, Antonio Terpin, Hailey Schoelkopf, Eric Zheng, Avishy Carmi, Ethan D. L. Brown, Kelin Zhu, Max Bartolo, Richard Wheeler, Martin Stehberger, Peter Bradshaw, JP Heimonen, Kaustubh Sridhar, Ido Akov, Jennifer Sandlin, Yury Makarychev, Joanna Tam, Hieu Hoang, David M. Cunningham, Vladimir Goryachev, Demosthenes Patramanis, Michael Krause, Andrew Redenti, David Aldous, Jesyin Lai, Shannon Coleman, Jiangnan Xu, Sangwon Lee, Ilias Magoulas, Sandy Zhao, Ning Tang, Michael K. Cohen, Orr Paradise, Jan Hendrik Kirchner, Maksym Ovchynnikov, Jason O. Matos, Adithya Shenoy, Michael Wang, Yuzhou Nie, Anna Sztyber-Betley, Paolo Faraboschi, Robin Riblet, Jonathan Crozier, Shiv Halasyamani, Shreyas Verma, Prashant Joshi, Eli Meril, Ziqiao Ma, Jérémy Andréoletti, Raghav Singhal, Jacob Platnick, Volodymyr Nevirkovets, Luke Basler, Alexander Ivanov, Seri Khoury, Nils Gustafsson, Marco Piccardo, Hamid Mostaghimi, Qijia Chen, Virendra Singh, Tran Quoc Khánh, Paul Rosu, Hannah Szlyk, Zachary Brown, Himanshu Narayan, Aline Menezes, Jonathan Roberts, William Alley, Kunyang Sun, Arkil Patel, Max Lamparth, Anka Reuel, Linwei Xin, Hanmeng Xu, Jacob Loader, Freddie Martin, Zixuan Wang, Andrea Achilleos, Thomas Preu, Tomek Korbak, Ida Bosio, Fereshteh Kazemi, Ziye Chen, Biró Bálint, Eve J. Y. Lo, Jiaqi Wang, Maria Inês S. Nunes, Jeremiah Milbauer, M Saiful Bari, Zihao Wang, Behzad Ansarinejad, Yewen Sun, Stephane Durand, Hossam Elgnainy, Guillaume Douville, Daniel Tordera, George Balabanian, Hew Wolff, Lynna Kvistad, Hsiaoyun Milliron, Ahmad Sakor, Murat Eron, Andrew Favre D. O., Shailesh Shah, Xiaoxiang Zhou, Firuz Kamalov, Sherwin Abdoli, Tim Santens, Shaul Barkan, Allison Tee, Robin Zhang, Alessandro Tomasiello, G. Bruno De Luca, Shi-Zhuo Looi, Vinh-Kha Le, Noam Kolt, Jiayi Pan, Emma Rodman, Jacob Drori, Carl J Fossum, Niklas Muennighoff, Milind Jagota, Ronak Pradeep, Honglu Fan, Jonathan Eicher, Michael Chen, Kushal Thaman, William Merrill, Moritz Firsching, Carter Harris, Stefan Ciobâcă, Jason Gross, Rohan Pandey, Ilya Gusev, Adam Jones, Shashank Agnihotri, Pavel Zhelnov, Mohammadreza Mofayezi, Alexander Piperski, David K. Zhang, Kostiantyn Dobarskyi, Roman Leventov, Ignat Soroko, Joshua Duersch, Vage Taamazyan, Andrew Ho, Wenjie Ma, William Held, Ruicheng Xian, Armel Randy Zebaze, Mohanad Mohamed, Julian Noah Leser, Michelle X Yuan, Laila Yacar, Johannes Lengler, Katarzyna Olszewska, Claudio Di Fratta, Edson Oliveira, Joseph W. Jackson, Andy Zou, Muthu Chidambaram, Timothy Manik, Hector Haffenden, Dashiell Stander, Ali Dasouqi, Alexander Shen, Bita Golshani, David Stap, Egor Kretov, Mikalai Uzhou, Alina Borisovna Zhidkovskaya, Nick Winter, Miguel Orbegozo Rodriguez, Robert Lauff, Dustin Wehr, Colin Tang, Zaki Hossain, Shaun Phillips, Fortuna Samuele, Fredrik Ekström, Angela Hammon, Oam Patel, Faraz Farhidi, George Medley, Forough Mohammadzadeh, Madellene Peñaflor, Haile Kassahun, Alena Friedrich, Rayner Hernandez Perez, Daniel Pyda, Taom Sakal, Omkar Dhamane, Ali Khajegili Mirabadi, Eric Hallman, Kenchi Okutsu, Mike Battaglia, Mohammad Maghsoudimehrabani, Alon Amit, Dave Hulbert, Roberto Pereira, Simon Weber, Handoko, Anton Peristyy, Stephen Malina, Mustafa Mehkary, Rami Aly, Frank Reidegeld, Anna-Katharina Dick, Cary Friday, Mukhwinder Singh, Hassan Shapourian, Wanyoung Kim, Mariana Costa, Hubeyb Gurdogan, Harsh Kumar, Chiara Ceconello, Chao Zhuang, Haon Park, Micah Carroll, Andrew R. Tawfeek, Stefan Steinerberger, Daattavya Aggarwal, Michael Kirchhof, Linjie Dai, Evan Kim, Johan Ferret, Jainam Shah, Yuzhou Wang, Minghao Yan, Krzysztof Burdzy, Lixin Zhang, Antonio Franca, Diana T. Pham, Kang Yong Loh, Joshua Robinson, Abram Jackson, Paolo Giordano, Philipp Petersen, Adrian Cosma, Jesus Colino, Colin White, Jacob Votava, Vladimir Vinnikov, Ethan Delaney, Petr Spelda, Vit Stritecky, Syed M. Shahid, Jean-Christophe Mourrat, Lavr Vetoshkin, Koen Sponselee, Renas Bacho, Zheng-Xin Yong, Florencia de la Rosa, Nathan Cho, Xiuyu Li, Guillaume Malod, Orion Weller, Guglielmo Albani, Leon Lang, Julien Laurendeau, Dmitry Kazakov, Fatimah Adesanya, Julien Portier, Lawrence Hollom, Victor Souza, Yuchen Anna Zhou, Julien Degorre, Yiğit Yalın, Gbenga Daniel Obikoya, Rai, Filippo Bigi, M. C. Boscá, Oleg Shumar, Kaniuar Bacho, Gabriel Recchia, Mara Popescu, Nikita Shulga, Ngefor Mildred Tanwie, Thomas C. H. Lux, Ben Rank, Colin Ni, Matthew Brooks, Alesia Yakimchyk, Huanxu, Liu, Stefano Cavalleri, Olle Häggström, Emil Verkama, Joshua Newbould, Hans Gundlach, Leonor Brito-Santana, Brian Amaro, Vivek Vajipey, Rynaa Grover, Ting Wang, Yosi Kratish, Wen-Ding Li, Sivakanth Gopi, Andrea Caciolai, Christian Schroeder de Witt, Pablo Hernández-Cámara, Emanuele Rodolà, Jules Robins, Dominic Williamson, Vincent Cheng, Brad Raynor, Hao Qi, Ben Segev, Jingxuan Fan, Sarah Martinson, Erik Y. Wang, Kaylie Hausknecht, Michael P. Brenner, Mao Mao, Christoph Demian, Peyman Kassani, Xinyu Zhang, David Avagian, Eshawn Jessica Scipio, Alon Ragoler, Justin Tan, Blake Sims, Rebeka Plecnik, Aaron Kirtland, Omer Faruk Bodur, D. P. Shinde, Yan Carlos Leyva Labrador, Zahra Adoul, Mohamed Zekry, Ali Karakoc, Tania C. B. Santos, Samir Shamseldeen, Loukmane Karim, Anna Liakhovitskaia, Nate Resman, Nicholas Farina, Juan Carlos Gonzalez, Gabe Maayan, Earth Anderson, Rodrigo De Oliveira Pena, Elizabeth Kelley, Hodjat Mariji, Rasoul Pouriamanesh, Wentao Wu, Ross Finocchio, Ismail Alarab, Joshua Cole, Danyelle Ferreira, Bryan Johnson, Mohammad Safdari, Liangti Dai, Siriphan Arthornthurasuk, Isaac C. McAlister, Alejandro José Moyano, Alexey Pronin, Jing Fan, Angel Ramirez-Trinidad, Yana Malysheva, Daphiny Pottmaier, Omid Taheri, Stanley Stepanic, Samuel Perry, Luke Askew, Raúl Adrián Huerta Rodríguez, Ali M. R. Minissi, Ricardo Lorena, Krishnamurthy Iyer, Arshad Anil Fasiludeen, Ronald Clark, Josh Ducey, Matheus Piza, Maja Somrak, Eric Vergo, Juehang Qin, Benjámin Borbás, Eric Chu, Jack Lindsey, Antoine Jallon, I. M. J. McInnis, Evan Chen, Avi Semler, Luk Gloor, Tej Shah, Marc Carauleanu, Pascal Lauer, Tran Đuc Huy, Hossein Shahrtash, Emilien Duc, Lukas Lewark, Assaf Brown, Samuel Albanie, Brian Weber, Warren S. Vaz, Pierre Clavier, Yiyang Fan, Gabriel Poesia Reis e Silva, Long, Lian, Marcus Abramovitch, Xi Jiang, Sandra Mendoza, Murat Islam, Juan Gonzalez, Vasilios Mavroudis, Justin Xu, Pawan Kumar, Laxman Prasad Goswami, Daniel Bugas, Nasser Heydari, Ferenc Jeanplong, Thorben Jansen, Antonella Pinto, Archimedes Apronti, Abdallah Galal, Ng Ze-An, Ankit Singh, Tong Jiang, Joan of Arc Xavier, Kanu Priya Agarwal, Mohammed Berkani, Gang Zhang, Zhehang Du, Benedito Alves de Oliveira Junior, Dmitry Malishev, Nicolas Remy, Taylor D. Hartman, Tim Tarver, Stephen Mensah, Gautier Abou Loume, Wiktor Morak, Farzad Habibi, Sarah Hoback, Will Cai, Javier Gimenez, Roselynn Grace Montecillo, Jakub Łucki, Russell Campbell, Asankhaya Sharma, Khalida Meer, Shreen Gul, Daniel Espinosa Gonzalez, Xavier Alapont, Alex Hoover, Gunjan Chhablani, Freddie Vargus, Arunim Agarwal, Yibo Jiang, Deepakkumar Patil, David Outevsky, Kevin Joseph Scaria, Rajat Maheshwari, Abdelkader Dendane, Priti Shukla, Ashley Cartwright, Sergei Bogdanov, Niels Mündler, Sören Möller, Luca Arnaboldi, Kunvar Thaman, Muhammad Rehan Siddiqi, Prajvi Saxena, Himanshu Gupta, Tony Fruhauff, Glen Sherman, Mátyás Vincze, Siranut Usawasutsakorn, Dylan Ler, Anil Radhakrishnan, Innocent Enyekwe, Sk Md Salauddin, Jiang Muzhen, Aleksandr Maksapetyan, Vivien Rossbach, Chris Harjadi, Mohsen Bahaloohoreh, Claire Sparrow, Jasdeep Sidhu, Sam Ali, Song Bian, John Lai, Eric Singer, Justine Leon Uro, Greg Bateman, Mohamed Sayed, Ahmed Menshawy, Darling Duclosel, Dario Bezzi, Yashaswini Jain, Ashley Aaron, Murat Tiryakioglu, Sheeshram Siddh, Keith Krenek, Imad Ali Shah, Jun Jin, Scott Creighton, Denis Peskoff, Zienab EL-Wasif, Ragavendran P, Michael Richmond, Joseph McGowan, Tejal Patwardhan, Hao-Yu Sun, Ting Sun, Nikola Zubić, Samuele Sala, Stephen Ebert, Jean Kaddour, Manuel Schottdorf, Dianzhuo Wang, Gerol Petruzella, Alex Meiburg, Tilen Medved, Ali ElSheikh, S Ashwin Hebbar, Lorenzo Vaquero, Xianjun Yang, Jason Poulos, Vilém Zouhar, Sergey Bogdanik, Mingfang Zhang, Jorge Sanz-Ros, David Anugraha, Yinwei Dai, Anh N. Nhu, Xue Wang, Ali Anil Demircali, Zhibai Jia, Yuyin Zhou, Juncheng Wu, Mike He, Nitin Chandok, Aarush Sinha, Gaoxiang Luo, Long Le, Mickaël Noyé, Michał Perełkiewicz, Ioannis Pantidis, Tianbo Qi, Soham Sachin Purohit, Letitia Parcalabescu, Thai-Hoa Nguyen, Genta Indra Winata, Edoardo M. Ponti, Hanchen Li, Kaustubh Dhole, Jongee Park, Dario Abbondanza, Yuanli Wang, Anupam Nayak, Diogo M. Caetano, Antonio A. W. L. Wong, Maria del Rio-Chanona, Dániel Kondor, Pieter Francois, Ed Chalstrey, Jakob Zsambok, Dan Hoyer, Jenny Reddish, Jakob Hauser, Francisco-Javier Rodrigo-Ginés, Suchandra Datta, Maxwell Shepherd, Thom Kamphuis, Qizheng Zhang, Hyunjun Kim, Ruiji Sun, Jianzhu Yao, Franck Dernoncourt, Satyapriya Krishna, Sina Rismanchian, Bonan Pu, Francesco Pinto, Yingheng Wang, Kumar Shridhar, Kalon J. Overholt, Glib Briia, Hieu Nguyen, David, Soler Bartomeu, Tony CY Pang, Adam Wecker, Yifan Xiong, Fanfei Li, Lukas S. Huber, Joshua Jaeger, Romano De Maddalena, Xing Han Lù, Yuhui Zhang, Claas Beger, Patrick Tser Jern Kon, Sean Li, Vivek Sanker, Ming Yin, Yihao Liang, Xinlu Zhang, Ankit Agrawal, Li S. Yifei, Zechen Zhang, Mu Cai, Yasin Sonmez, Costin Cozianu, Changhao Li, Alex Slen, Shoubin Yu, Hyun Kyu Park, Gabriele Sarti, Marcin Briański, Alessandro Stolfo, Truong An Nguyen, Mike Zhang, Yotam Perlitz, Jose Hernandez-Orallo, Runjia Li, Amin Shabani, Felix Juefei-Xu, Shikhar Dhingra, Orr Zohar, My Chiffon Nguyen, Alexander Pondaven, Abdurrahim Yilmaz, Xuandong Zhao, Chuanyang Jin, Muyan Jiang, Stefan Todoran, Xinyao Han, Jules Kreuer, Brian Rabern, Anna Plassart, Martino Maggetti, Luther Yap, Robert Geirhos, Jonathon Kean, Dingsu Wang, Sina Mollaei, Chenkai Sun, Yifan Yin, Shiqi Wang, Rui Li, Yaowen Chang, Anjiang Wei, Alice Bizeul, Xiaohan Wang, Alexandre Oliveira Arrais, Kushin Mukherjee, Jorge Chamorro-Padial, Jiachen Liu, Xingyu Qu, Junyi Guan, Adam Bouyamourn, Shuyu Wu, Martyna Plomecka, Junda Chen, Mengze Tang, Jiaqi Deng, Shreyas Subramanian, Haocheng Xi, Haoxuan Chen, Weizhi Zhang, Yinuo Ren, Haoqin Tu, Sejong Kim, Yushun Chen, Sara Vera Marjanović, Junwoo Ha, Grzegorz Luczyna, Jeff J. Ma, Zewen Shen, Dawn Song, Cedegao E. Zhang, Zhun Wang, Gaël Gendron, Yunze Xiao, Leo Smucker, Erica Weng, Kwok Hao Lee, Zhe Ye, Stefano Ermon, Ignacio D. Lopez-Miguel, Theo Knights, Anthony Gitter, Namkyu Park, Boyi Wei, Hongzheng Chen, Kunal Pai, Ahmed Elkhanany, Han Lin, Philipp D. Siedler, Jichao Fang, Ritwik Mishra, Károly Zsolnai-Fehér, Xilin Jiang, Shadab Khan, Jun Yuan, Rishab Kumar Jain, Xi Lin, Mike Peterson, Zhe Wang, Aditya Malusare, Maosen Tang, Isha Gupta, Ivan Fosin, Timothy Kang, Barbara Dworakowska, Kazuki Matsumoto, Guangyao Zheng, Gerben Sewuster, Jorge Pretel Villanueva, Ivan Rannev, Igor Chernyavsky, Jiale Chen, Deepayan Banik, Ben Racz, Wenchao Dong, Jianxin Wang, Laila Bashmal, Duarte V. Gonçalves, Wei Hu, Kaushik Bar, Ondrej Bohdal, Atharv Singh Patlan, Shehzaad Dhuliawala, Caroline Geirhos, Julien Wist, Yuval Kansal, Bingsen Chen, Kutay Tire, Atak Talay Yücel, Brandon Christof, Veerupaksh Singla, Zijian Song, Sanxing Chen, Jiaxin Ge, Kaustubh Ponkshe, Isaac Park, Tianneng Shi, Martin Q. Ma, Joshua Mak, Sherwin Lai, Antoine Moulin, Zhuo Cheng, Zhanda Zhu, Ziyi Zhang, Vaidehi Patil, Ketan Jha, Qiutong Men, Jiaxuan Wu, Tianchi Zhang, Bruno Hebling Vieira, Alham Fikri Aji, Jae-Won Chung, Mohammed Mahfoud, Ha Thi Hoang, Marc Sperzel, Wei Hao, Kristof Meding, Sihan Xu, Vassilis Kostakos, Davide Manini, Yueying Liu, Christopher Toukmaji, Jay Paek, Eunmi Yu, Arif Engin Demircali, Zhiyi Sun, Ivan Dewerpe, Hongsen Qin, Roman Pflugfelder, James Bailey, Johnathan Morris, Ville Heilala, Sybille Rosset, Zishun Yu, Peter E. Chen, Woongyeong Yeo, Eeshaan Jain, Ryan Yang, Sreekar Chigurupati, Julia Chernyavsky, Sai Prajwal Reddy, Subhashini Venugopalan, Hunar Batra, Core Francisco Park, Hieu Tran, Guilherme Maximiano, Genghan Zhang, Yizhuo Liang, Hu Shiyu, Rongwu Xu, Rui Pan, Siddharth Suresh, Ziqi Liu, Samaksh Gulati, Songyang Zhang, Peter Turchin, Christopher W. Bartlett, Christopher R. Scotese, Phuong M. Cao, Ben Wu, Jacek Karwowski, Davide Scaramuzza, Aakaash Nattanmai, Gordon McKellips, Anish Cheraku, Asim Suhail, Ethan Luo, Marvin Deng, Jason Luo, Ashley Zhang, Kavin Jindel, Jay Paek, Kasper Halevy, Allen Baranov, Michael Liu, Advaith Avadhanam, David Zhang, Vincent Cheng, Brad Ma, Evan Fu, Liam Do, Joshua Lass, Hubert Yang, Surya Sunkari, Vishruth Bharath, Violet Ai, James Leung, Rishit Agrawal, Alan Zhou, Kevin Chen, Tejas Kalpathi, Ziqi Xu, Gavin Wang, Tyler Xiao, Erik Maung, Sam Lee, Ryan Yang, Roy Yue, Ben Zhao, Julia Yoon, Sunny Sun, Aryan Singh, Ethan Luo, Clark Peng, Tyler Osbey, Taozhi Wang, Daryl Echeazu, Hubert Yang, Timothy Wu, Spandan Patel, Vidhi Kulkarni, Vijaykaarti Sundarapandiyan, Ashley Zhang, Andrew Le, Zafir Nasim, Srikar Yalam, Ritesh Kasamsetty, Soham Samal, Hubert Yang, David Sun, Nihar Shah, Abhijeet Saha, Alex Zhang, Leon Nguyen, Laasya Nagumalli, Kaixin Wang, Alan Zhou, Aidan Wu, Jason Luo, Anwith Telluri, Steven Dillmann, Zhengxiang Wang, Junyu Luo, Hugo Lunn, Artem Gazizov, Haitz Sáez de Ocáriz Borde, Ivan Trus, Morgan Hervault, Zheyu Zhang, Bo Chen, Yuchen Wu, Christopher J. Cordier, Gün Kaynar, Cansin Ayvaz, Polina Avdiunina, Johannes Brust, Xingjian Diao, K. D. Meaney, Yifan Gu, Chenyu Wang, Chenzhuo Dong, William Wright, Simon Brave, Owen Root, Jiayuan Liu, Chow Chun Lok, Tianqin Li, Shiyi Du, Dailan He, Lufeiya Liu, Sina Jamalzadegan, Anil Ramakrishna, Xuanqing Xu, Xin Qing, Xin Luo, Wenkai Li, Shi Bo, Filipp Gusev, Maximos Skandalis, Desheng Ma, Chunhui Zhang, Haoran Qiu, Allen G Hart, Rickard Brüel Gabrielsson, Ido Akov, Artem Lukoianov, Summer Yue, Alexandr Wang, Dan Hendrycks

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 人类最后的考试(HLE)是一个多模态基准测试,旨在通过广泛覆盖的学科问题评估LLM在封闭式学术问题上的能力,揭示当前LLM与人类专家之间的差距。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21344 2026-07-28 cs.CL cs.AI cs.CV cs.LG cs.MA 88%

Beyond Single Plots: A Benchmark for Question Answering on Multi-Charts

超越单图:多图表问答的基准测试

Azher Ahmed Efat, Seok Hwan Song, Wallapak Tavanapong

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PolyChartQA数据集,用于评估多图表问答性能,通过九种先进多模态语言模型测试,发现人类生成问题的LLM准确率下降27.4%,而本文提出的提示方法提升了5.39%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 88%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16648 2026-07-21 cs.CR cs.IT math.IT 新提交 88%

Synchronization-Free Algebraic Fingerprints for Large Language Models: From Autoregressive to Diffusion Models

大语言模型的无同步代数指纹:从自回归模型到扩散模型

Jaroslaw Janas, Josef Pieprzyk, Pawel Morawiecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型水印需求,提出无同步水印方案,由相邻令牌生成二元同余作水印,从代数角度分析恢复问题,讨论解码算法,该方法能抗多种操作,避免同步问题,为嵌入不同长度秘密身份提供灵活框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07196 2026-07-21 cs.HC 88%

Large Language Models for Wearable Sensor-Based Human Activity Recognition, Health Monitoring, and Behavioral Modeling: A Survey of Early Trends, Datasets, and Challenges

基于可穿戴传感器的人类活动识别、健康监测与行为建模的大型语言模型:早期趋势、数据集和挑战的综述

Emilio Ferrara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在可穿戴传感器数据中的应用,探讨了其在人类活动识别、健康监测和行为建模中的早期趋势、数据集及挑战。

Journal ref Sensors, 24(15), 5045, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13934 2026-07-16 cs.MA 新提交 88%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 88%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01117 2026-07-15 cs.CV 版本更新 88%

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

MoHallBench: 视频大语言模型中运动幻觉的基准测试

Sihan Chen, Jiale Li, Jianghang Lin, Mengyuan Liu

机构 * Xiamen University(厦门大学) South China University of Technology(华南理工大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出MoHallBench基准,系统评估视频大语言模型中的运动幻觉,涵盖共现先验、顺序推理和相似混淆三类来源,揭示动作识别与幻觉抵抗的解耦现象。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06012 2026-07-08 cs.CV 新提交 88%

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

使用聚类、分类和大语言模型从房地产文档中提取结构化数据

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

机构 * Robert Gordon University(罗伯特·戈登大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何从房地产问卷文档中提取结构化数据,提出端到端管道,先分类文档,再用大语言模型提取属性,应用于3965份文档,成功处理2781份,得到2766条记录,验证了数据质量,证明该提取方法可行可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06371 2026-07-07 cs.CY 版本更新 88%

Bilingual Bias in Large Language Models: A Taiwan Sovereignty Benchmark Study

大语言模型中的双语偏差:一项台湾主权基准研究

Ju-Chun Ko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究大语言模型在多语言环境下对政治敏感话题的语言一致性,通过对17个模型进行双语基准测试,发现显著语言偏差,提出量化指标并开源框架。

Comments 19 pages, 4 tables, benchmark code available at https://github.com/dAAAb/ai-taiwan-sovereignty-benchmark-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17329 2026-07-07 cs.CR 版本更新 88%

Risk Assessment and Security Analysis of Large Language Models

大语言模型的风险评估与安全分析

Xiaoyan Zhang, Dongyang Lyu, Xiaoqi Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型在关键应用场景的安全问题,设计动态风险评估系统与分层防御系统,用熵加权计算多指标,结合多种技术,能识别隐蔽攻击并快速评估风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新 88%

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02325 2026-07-03 cs.HC 新提交 88%

Personality Without Persons? A Psychometric Critique of Big Five Testing in Large Language Models

无人格的人格?大语言模型中大五人格测试的心理测量学批判

Kim Zierahn, Cristina Cachero, Anna Korhonen, Nuria Oliver

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 通过心理测量学评估大语言模型的大五人格测试,发现其不适用于LLMs,无法捕捉模型间差异且因子结构失效,建议开发针对LLMs的评估框架。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25420 2026-07-02 cs.SE cs.HC 88%

Recommending Usability Improvements with Multimodal Large Language Models

利用多模态大语言模型推荐可用性改进

Sebastian Lubos, Alexander Felfernig, Damian Garber, Viet-Man Le, Manuel Henrich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种利用多模态大语言模型自动识别和推荐用户界面可用性改进的方法,通过分析有限的应用上下文和用户交互屏幕记录,基于尼尔森可用性启发式方法生成优先级排序的改进建议,验证了其在软件工程中的实用性。

Comments Accepted for publication at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 88%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25747 2026-07-01 cs.SE 新提交 88%

CodeChat-Eval: Evaluating Large Language Models in Multi-Turn Code Refinement Dialogues

CodeChat-Eval:在多轮代码优化对话中评估大型语言模型

Guoxiang Guo, Kla Tantithamthavorn, Neelofar Neelofar, Yuanyuan Qi, Aldeida Aleti

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出CodeChat-Eval框架,通过动态指令选择算法构建多轮代码优化对话评估会话,发现LLMs在多轮优化中功能正确性显著下降(19.2%-69.2%),逻辑级优化和新增请求导致最大下降。

Comments Accepted by ICSME26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30610 2026-06-30 cs.SE 88%

PyMETA: A Benchmark Dataset for Hierarchical Student Code Error Classification with Python-Interpreter-Based Labels

PyMETA: 基于Python解释器标签的层次化学生代码错误分类基准数据集

Chuyue Li, Ziqi Tang, Jingyi Wang, Yu Wu, Kazuma Hashimoto, Lingyu Gao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出PyMETA数据集,包含48,646份学生提交的Python代码,采用三层层次化错误分类体系,并评估了微调模型和LLM在多级分类任务上的性能。

Comments 23 pages, 15 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26927 2026-06-26 cs.SE 新提交 88%

Are LLMs Ready for Anti-Pattern Detection in Microservice Architectures?

LLM 是否准备好检测微服务架构中的反模式?

Marco De Luca, Domenico Amalfitano, Porfirio Tramontana, Anna Rita Fasolino

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究大型语言模型(LLM)通过提示分析微服务仓库静态制品来检测16种架构反模式的能力,与静态分析工具MARS对比,发现LLM在局部、异构或语义丰富的反模式上表现有竞争力,但在需要结构或跨服务依赖证据时受限,可作为补充工具。

Comments accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09982 2026-06-26 cs.CY 版本更新 88%

Application of Large Language Models in Automated Question Generation: A Case Study on ChatGLM's Structured Questions for National Teacher Certification Exams

大语言模型在自动问题生成中的应用:以ChatGLM生成国家教师资格考试结构化问题为例

Ling He, Yanxin Chen, Xiaoqiang Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究探索ChatGLM在自动生成国家教师资格考试结构化问题中的应用,通过提示工程生成模拟题并与真题对比,专家评估显示其合理性与实用性高,但多标准考量存在局限。

Comments We are withdrawing this version as the submission was made prior to the completion of full internal coordination among all co-authors. To ensure consistency and avoid any potential misinterpretation, we have decided to withdraw the manuscript and leave it archived as a preprint record only

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 88%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24166 2026-06-24 cs.NE 新提交 88%

Distributed Quality-Diversity Search for Toxicity in Large Language Models

大型语言模型中毒性检测的分布式质量-多样性搜索

Onkar Shelar, Travis Desell

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ToxSearch-S方法,通过增量式物种形成和MPI并行化,在有限预算下实现与基线相当的峰值毒性,同时降低累积搜索压力,并利用分布式计算显著加速搜索。

Comments 40 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23704 2026-06-24 cs.AR 新提交 88%

PCB-QA: Evaluating LLMs over the First Printed Circuit Board Design Question-Answer Dataset

PCB-QA:首个印刷电路板设计问答数据集评估大语言模型

Sahana Srinivasan, Benjamin Tan, Benjamin Turnbull, Hammond Pearce

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对大语言模型在PCB设计应用中缺乏文本数据集和评估方法的问题,提出PCB-QA数据集(480个问答对),通过不同文件格式提示LLM,发现基于JSON的文本格式使Gemini 3 Flash Preview达到93%准确率。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17094 2026-06-17 cs.SE 新提交 88%

LogCopilot: Automating Log Aggregation Analysis through Large Language Models

LogCopilot: 通过大型语言模型自动化日志聚合分析

Senyu Xie, Chenxi Zhang, Tong Zhou, Jiacheng Liu, Xiaoyu Hong, Qingshan Li, Xin Peng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出LogCopilot框架,利用大型语言模型,通过自然语言指令、知识检索和工具调用自动生成LogQL查询,实现日志聚合分析,平均准确率76.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14607 2026-06-15 cs.SE cs.DC 新提交 88%

Empowering Student Debugging in Parallel Programming with Execution Traces and Large Language Models

利用执行轨迹和大语言模型增强学生在并行编程中的调试能力

God'salvation F. Oguibe, Vinodh Kumaran Jayakumar, Tongping Liu, Andrew Lan, Wei Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出ParaView工具,通过执行记录与可视化帮助学生调试并发程序,结合大语言模型分析错误,实验表明调试成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-06-04 cs.HC 88%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11283 2026-06-02 cs.CV 88%

Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey

多模态大语言模型驱动的视频翻译:面向角色的综述

Bingzheng Qu, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文通过面向角色的分类法,系统综述了多模态大语言模型在视频翻译中的应用,将其分为语义推理器、表达执行器和视觉合成器三个功能角色,并总结了数据集、基准和评估指标,指出了端到端视频翻译的挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18008 2026-06-02 cs.LG cs.AI cs.CL 88%

Are LLMs Ready for Neural-integrated Mechanistic Modeling? A Benchmark and Agentic Framework

LLM 是否准备好进行神经集成机制建模?一个基准测试与智能体框架

Zihan Guan, Rituparna Datta, Mengxuan Hu, Shunshun Liu, Aiying Zhang, Prasanna Balachandran, Sheng Li, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出神经集成机制建模(NIMM)基准测试,评估大语言模型在三个科学领域构建神经集成机制模型的能力,并设计树引导的智能体框架 NIMMGen,通过分支级搜索和原子模型细化显著提升搜索稳定性和解质量。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30219 2026-05-29 cs.AI cs.CL cs.LG 88%

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

模型何时应改变想法?大语言模型中的上下文信念管理

Haoming Xu, Weihong Xu, Zongrui Li, Mengru Wang, Yunzhi Yao, Chiyu Wu, Jin Shang, Yu Gong, Shumin Deng

机构 * Zhejiang University(浙江大学) HomologyAI

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出上下文信念管理(CBM)框架,通过引入BeliefTrack基准和信念状态奖励的强化学习,将大语言模型在长程交互中的信念更新失败率平均降低70.9%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏