Human-Edited Generative AI-Assisted Multiple-Choice Questions in Postgraduate Family Medicine: Blinded Cross-Sectional Comparative Psychometric Study.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Generative artificial intelligence (GenAI) is increasingly used to draft multiple-choice questions (MCQs) for health professions education, but much evidence concerns raw model outputs, expert ratings, or item difficulty alone. Educators edit GenAI drafts before use, and whether such items are psychometrically ready for postgraduate assessment remains unclear. OBJECTIVE: This study aimed to compare human-edited GenAI-assisted and educator-crafted MCQs for postgraduate Family Medicine Applied Knowledge Test-level assessment, examining difficulty, discrimination, reliability, distractor functioning, and participant perceptions. METHODS: We conducted a blinded cross-sectional, within-participant comparative psychometric evaluation in Singapore. Sixty best-of-five single-best-answer MCQs were evaluated, 30 human-edited GenAI-assisted items and 30 educator-crafted items, topic-matched across postgraduate FM domains and randomized across 2 assessment sets. Eligible participants were postgraduate doctors enrolled in FM residency or postgraduate family medicine programs, preparing for the Applied Knowledge Test, and blinded to item origin; incomplete paired responses were excluded. Outcomes included paired total scores, score correlation and agreement, Kuder-Richardson Formula 20 reliability, item difficulty index, corrected point-biserial discrimination, distractor functioning, and perceived difficulty, clarity, and relevance. Analyses used paired-sample tests, Pearson correlation, Fisher exact tests, and item-level psychometric statistics, with α=.05 and Bonferroni correction within comparison families. RESULTS: Of 74 participants, 73 completed both item sets and were included in the analysis. The final sample comprised 36 graduate diploma in FM trainees, 5 MMed FM trainees, and 32 FM residents. Paired-sample testing showed lower scores on GenAI-assisted than educator-crafted items (mean 19.12, SD 2.83 vs mean 21.10, SD 3.42 out of 30; mean difference -1.97, 95% CI -2.72 to -1.23; P<.001; Cohen d=0.62), indicating that GenAI-assisted items were not easier. Scores were positively correlated (r=0.49, 95% CI 0.30-0.64; P<.001), but Bland-Altman analysis indicated limited agreement. Kuder-Richardson Formula 20 reliability was lower for GenAI-assisted items (0.38 vs 0.60). Mean difficulty index did not differ significantly (0.64 vs 0.70; mean difference -0.07, 95% CI -0.19 to 0.06; P=.29), and more GenAI-assisted items fell within the acceptable difficulty range (18/30, 60.0% vs 13/30, 43.3%). However, mean corrected point-biserial discrimination was lower for GenAI-assisted items (0.09 vs 0.18; mean difference -0.08, 95% CI -0.16 to -0.01; P=.04), and negative discrimination was more common (6/30, 20% vs 3/30, 10%). GenAI-assisted items also had more nonfunctioning and negatively discriminating distractors, although these differences were not statistically significant. Participant ratings of perceived difficulty, clarity, and practice relevance did not differ by origin. CONCLUSIONS: Human-edited GenAI-assisted MCQs can achieve plausible difficulty, but difficulty and surface acceptability did not ensure assessment readiness. Using trainee response data, this study extends work on raw outputs or expert opinion. GenAI should be used as a drafting adjunct within educator-led workflows prioritizing key verification, distractor engineering, pilot testing, empirical item analysis, and repair before item-bank or summative use.
نتیجه فارسی
این مطالعه مقایسهای روانسنجی سوالات چندگزینهای تکبهبهترینِ کمکشده با هوش مصنوعی تولیدکننده (GenAI) ویرایششده توسط انسان را با سوالات ساخته شده توسط معلمان در پزشکی خانواده پسدوزمانی انجام داد. نتایج نشان داد که سوالات GenAI سادهتر نبودند، اما پایایی و تفکیک آنها پایینتر بود. معلمان باید قبل از استفاده نهایی، این سوالات را به طور دقیق بررسی و اصلاح کنند.
- سوالات کمکشده با GenAI سادهتر از سوالات ساخته شده توسط معلمان نبودند.
- پایایی فرمول ۲۰ کودر-ریچاردسون برای سوالات GenAI پایینتر بود.
- تفکیک نقطه-دوگانه اصلاحشده برای سوالات GenAI پایینتر بود.
- گزینههای گمراهکننده غیرفعال در سوالات GenAI بیشتر بود.
- معلمان باید قبل از استفاده نهایی، این سوالات را به طور دقیق بررسی و اصلاح کنند.
ترجمه فارسی چکیده
پیشزمینه: هوش مصنوعی تولیدکننده (GenAI) به طور فزایندهای برای تدوین سوالات چندگزینهای (MCQ) در آموزش حرفههای سلامت استفاده میشود، اما شواهد زیادی مربوط به خروجی خام مدل، رتبهبندی متخصصان یا سختی سوالات به تنهایی است. معلمان ویرایش پیشنویسهای GenAI قبل از استفاده انجام میدهند، اما اینکه آیا این سوالات آمادگی روانسنجی برای ارزیابی پسدوزمانی را دارند، روشن نیست. هدف: این مطالعه مقایسه سوالات چندگزینهای تکبهبهترینِ کمکشده با GenAI ویرایششده توسط انسان و سوالات ساخته شده توسط معلمان را برای ارزیابی سطح آزمون دانش کاربردی پزشکی خانواده پسدوزمانی، با بررسی سختی، تفکیک، پایایی، عملکرد گزینههای گمراهکننده و دیدگاه شرکتکنندگان انجام داد. روشها: ما یک ارزیابی روانسنجی مقایسهای مقطعی و کور دروننفرانه در سنگاپور انجام دادیم. شصت سوال چندگزینهای تکبهبهترینِ بهترین از پنج مورد ارزیابی شد، ۳۰ مورد ویرایششده توسط انسان و ۳۰ مورد ساخته شده توسط معلمان، با موضوع همخوان در حوزههای پزشکی خانواده پسدوزمانی و تصادفیسازی در دو مجموعه ارزیابی. شرکتکنندگان واجد شرایط پزشکان پسدوزمانی ثبتنامشده در تمرین پزشکی خانواده یا برنامههای پسدوزمانی بودند که برای آزمون دانش کاربردی آماده میشدند و نسبت به منبع سوال کور بودند؛ پاسخهای جفت ناقص حذف شدند. نتایج شامل امتیازهای کل جفت، همبستگی و توافق امتیاز، پایایی فرمول ۲۰ کودر-ریچاردسون، شاخص سختی سوال، تفکیک نقطه-دوگانه اصلاحشده، عملکرد گزینههای گمراهکننده و سختی، شفافیت و مرتبط بودن درکشده بود. تحلیلها از آزمونهای نمونه جفت، همبستگی پیرسون، آزمونهای دقیق فیشر و آمارهای روانسنجی سطح سوال استفاده کردند، با α=.۰۵ و اصلاح Bonferroni در خانوادههای مقایسهای. نتایج: از ۷۴ شرکتکننده، ۷۳ مورد هر دو مجموعه سوال را تکمیل کردند و در تحلیل گنجانده شدند. نمونه نهایی شامل ۳۶ دانشجوی دیپلم پزشکی خانواده، ۵ دانشجوی MMed پزشکی خانواده و ۳۲ تمرینکننده پزشکی خانواده بود. آزمون نمونه جفت نشان داد امتیازات پایینتری در سوالات کمکشده با GenAI نسبت به سوالات ساخته شده توسط معلمان (میانگین ۱۹.۱۲، انحراف معیار ۲.۸۳ در برابر میانگین ۲۱.۱۰، انحراف معیار ۳.۴۲ از ۳۰؛ اختلاف میانگین -۱.۹۷، ۹۵٪ CI -۲.۷۲ تا -۱.۲۳؛ P<.۰۰۱؛ Cohen d=۰.۶۲)، که نشان میدهد سوالات کمکشده با GenAI سادهتر نبودند. امتیازات به صورت مثبت همبستگی داشتند (r=۰.۴۹، ۹۵٪ CI ۰.۳۰-۰.۶۴؛ P<.۰۰۱)، اما تحلیل Bland-Altman نشاندهنده توافق محدود بود. پایایی فرمول ۲۰ کودر-ریچاردسون برای سوالات کمکشده با GenAI پایینتر بود (۰.۳۸ در برابر ۰.۶۰). شاخص سختی میانگین تفاوت معناداری نداشت (۰.۶۴ در برابر ۰.۷۰؛ اختلاف میانگین -۰.۰۷، ۹۵٪ CI -۰.۱۹ تا ۰.۰۶؛ P=.۲۹) و بیشتر سوالات کمکشده با GenAI در محدوده سختی قابل قبول قرار داشتند (۱۸/۳۰، ۶۰.۰٪ در برابر ۱۳/۳۰، ۴۳.۳٪). با این حال، تفکیک نقطه-دوگانه اصلاحشده میانگین برای سوالات کمکشده با GenAI پایینتر بود (۰.۰۹ در برابر ۰.۱۸؛ اختلاف میانگین -۰.۰۸، ۹۵٪ CI -۰.۱۶ تا -۰.۰۱؛ P=.۰۴) و تفکیک منفی بیشتر رایج بود (۶/۳۰، ۲۰٪ در برابر ۳/۳۰، ۱۰٪). سوالات کمکشده با GenAI همچنین گزینههای گمراهکننده غیرفعال و تفکیک منفی بیشتری داشتند، اگرچه این تفاوتها آماری معنادار نبودند. رتبهبندیهای شرکتکنندگان از سختی، شفافیت و مرتبط بودن عملی درکشده تفاوتی با منبع نداشتند. نتیجهگیری: سوالات چندگزینهای تکبهبهترینِ کمکشده با GenAI ویرایششده توسط انسان میتوانند سختی قابل قبولی را به دست آورند، اما سختی و پذیرش سطحی تضمین آمادگی ارزیابی را نکردند. با استفاده از دادههای پاسخ دانشجویان، این مطالعه کار را بر روی خروجی خام یا نظر متخصصان گسترش میدهد. GenAI باید به عنوان یک مکمل تدوین در جریانهای کاری رهبری شده توسط معلمان با اولویتدهی به تأیید کلیدی، مهندسی گزینههای گمراهکننده، آزمایش اولیه، تحلیل آماری سوال و تعمیر قبل از استفاده از بانک سوال یا ارزیابی جمعی استفاده شود.
روش پژوهش
این مطالعه یک ارزیابی روانسنجی مقایسهای کور و مقطعی دروننفرانه در سنگاپور بود. شصت سوال چندگزینهای تکبهبهترینِ بهترین از پنج مورد شامل ۳۰ مورد ویرایششده توسط انسان و ۳۰ مورد ساخته شده توسط معلمان بود که با موضوع همخوان و تصادفیسازی در دو مجموعه ارزیابی قرار گرفتند. تحلیلها از آزمونهای نمونه جفت، همبستگی پیرسون و آزمونهای دقیق فیشر استفاده کردند.
محدودیتها
محدودیتهای گزارش شده شامل حذف پاسخهای جفت ناقص و تمرکز بر سوالات پزشکی خانواده پسدوزمانی است. نتایج ممکن است به طور خاصی به سوالات چندگزینهای تکبهبهترینِ بهترین از پنج و به محیط آموزشی سنگاپور اعمال نشود.
نمای PICO و پیامدها
- جمعیت
- پزشکان پسدوزمانی ثبتنامشده در تمرین پزشکی خانواده یا برنامههای پسدوزمانی که برای آزمون دانش کاربردی آماده میشدند.
- مداخله/مواجهه
- سوالات چندگزینهای تکبهبهترینِ کمکشده با GenAI ویرایششده توسط انسان.
- مقایسه
- سوالات چندگزینهای تکبهبهترینِ ساخته شده توسط معلمان.
- حجم نمونه
- ۷۳ شرکتکننده (۳۶ دانشجوی دیپلم پزشکی خانواده، ۵ دانشجوی MMed پزشکی خانواده و ۳۲ تمرینکننده پزشکی خانواده).
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل