Código QR

Context matching is not reasoning when performing generalized clinical evaluation of generative language models

Abstract Current discussion surrounding the clinical capabilities of generative language models(GLMs) predominantly centers around multiple-choice question-answer(MCQA) benchmarks derived from clinical licensing examinations. While accepted for human examinees, characteristics unique to GLMs bring i...

Descripción completa

Guardado en:
Detalles Bibliográficos
Autores principales: Andrew Wen, Qiuhao Lu, Yu-Neng Chuang, Guanchu Wang, Jiayi Yuan, Jiamu Zhang, Liwei Wang, Sunyang Fu, Kurt D. Miller, Heling Jia, Steven D. Bedrick, William R. Hersh, Kirk E. Roberts, Xia Hu, Hongfang Liu
Formato: Artigo
Lenguaje:Inglês
Publicado: Nature Portfolio 2025-12-01
Colección:npj Digital Medicine
Acceso en línea:https://doi.org/10.1038/s41746-025-02253-2
Etiquetas: Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!