Context matching is not reasoning when performing generalized clinical evaluation of generative language models
Abstract Current discussion surrounding the clinical capabilities of generative language models(GLMs) predominantly centers around multiple-choice question-answer(MCQA) benchmarks derived from clinical licensing examinations. While accepted for human examinees, characteristics unique to GLMs bring i...
Guardado en:
| Autores principales: | , , , , , , , , , , , , , , |
|---|---|
| Formato: | Artigo |
| Lenguaje: | Inglês |
| Publicado: |
Nature Portfolio
2025-12-01
|
| Colección: | npj Digital Medicine |
| Acceso en línea: | https://doi.org/10.1038/s41746-025-02253-2 |
| Etiquetas: |
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
