Re-evaluating the role of personal statements in pediatric residency admissions in the era of artificial intelligence: comparing faculty ratings of human and AI-generated statements

  • Curry B
  • Kirpalani A
  • Remington M
  • et al.
N/ACitations
Citations of this article
8Readers
Mendeley users who have this article in their library.

Abstract

Background: Personal statements play a large role in pediatric residency applications, providing insights into candidates’ motivations, experiences, and fit for the program. With large language models (LLMs) such as Chat Generative Pre-trained Transformer (ChatGPT), concerns have arisen regarding how this may influence the authenticity of statements in evaluating candidates. This study investigates the efficacy and perceived authenticity of LLM-generated personal statements compared to human-generated statements in residency applications. Methods: We conducted a blinded study comparing 30 ChatGPT-generated personal statements with 30 human-written statements. Four pediatric faculty raters assessed each statement using a standardized 10-point rubric. We analyzed the data using linear mixed-effects models, a chi-square sensitivity analysis, an evaluation of rater accuracy in identifying statement origin as well as consistency of scores amongst raters using intraclass correlation coefficients (ICC). Results: There was no significant difference in mean scores between AI and human-written statements. Raters could only identify the source of a letter (AI or human) with 59% accuracy. There was considerable disagreement in scores between raters as indicated by negative ICCs. Conclusions: AI-generated statements were rated similarly to human-authored statements and were indistinguishable by reviewers, highlighting the sophistication of these LLM models and the challenge in detecting their use. Furthermore, scores varied substantially between reviewers. As AI becomes increasingly used in application processes, it is imperative to examine its implications in the overall evaluation of applicants.Contexte : Les lettres de motivation jouent un rôle crucial dans les candidatures aux résidences en pédiatrie, car elles permettent de mieux comprendre les motivations, l’expérience et l’adéquation des candidats au programme. L’utilisation de grands modèles de langage (GML), tels que ChatGPT (Chat Generative Pre-trained Transformer), a soulevé des interrogations quant à l’authenticité des lettres lors de l’évaluation des candidats. Cette étude examine l’efficacité et l’authenticité perçue des lettres de motivation générées par un GML par rapport à celles rédigées par des humains dans le cadre des candidatures aux résidences. Méthodes : Nous avons mené une étude en aveugle comparant 30 lettres générées par ChatGPT à 30 lettres rédigées par des humains. Quatre membres du corps professoral en pédiatrie ont évalué chaque lettre à l’aide d’une grille d’évaluation standardisée sur 10 points. Les données ont été analysées à l’aide de modèles linéaires mixtes, d’une analyse de sensibilité par le test du χ², d’une évaluation de la précision des évaluateurs quant à l’identification de l’origine des lettres, ainsi que de la cohérence des scores entre évaluateurs à l’aide des coefficients de corrélation intraclasse (CCI). Résultats : Aucune différence significative n’a été observée entre les scores moyens des lettres générées par l’IA et ceux des lettres rédigées par des humains. Les évaluateurs n’ont pu identifier la source d’une lettre (IA ou humain) qu’avec une précision de 59 %. Un désaccord considérable a été constaté entre les évaluateurs concernant les scores, comme l’indiquent les CCI négatifs. Conclusions : Les lettres générées par l’IA ont été évaluées de manière similaire à celles rédigées par des humains et étaient indiscernables pour les évaluateurs, ce qui souligne la sophistication de ces modèles GML et la difficulté à détecter leur utilisation. De plus, les scores variaient considérablement d’un évaluateur à l’autre. À mesure que l’IA se généralise dans les processus de candidature, il est impératif d’examiner ses implications dans l’évaluation globale des candidats.

Cite

CITATION STYLE

APA

Curry, B., Kirpalani, A., Remington, M., Van Hooren, T., Shen, Y., & Peebles, E. (2025). Re-evaluating the role of personal statements in pediatric residency admissions in the era of artificial intelligence: comparing faculty ratings of human and AI-generated statements. Canadian Medical Education Journal, 16(6), 21–24. https://doi.org/10.36834/cmej.81345

Register to see more suggestions

Mendeley helps you to discover research relevant for your work.

Already have an account?

Save time finding and organizing research with Mendeley

Sign up for free