PubMed دسترسی آزاد

Human-Edited Generative AI-Assisted Multiple-Choice Questions in Postgraduate Family Medicine: Blinded Cross-Sectional Comparative Psychometric Study.

استودیوی صوتی مقاله

پخش حرفه‌ای فارسی و انگلیسی

در حال بررسی نسخه‌های صوتی ذخیره‌شده…

صوت تولیدشده با هوش مصنوعی است. برای کاربرد علمی یا درمانی، متن و منبع اصلی را بررسی کنید.
خواندن هوشمند فارسی و انگلیسی در حال آماده‌سازی صداهای مرورگر…
تنظیم صدای طبیعی و سرعت

صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده می‌شود معمولاً طبیعی‌ترند. انتخاب صدا به صداهای نصب‌شده در ویندوز و مرورگر شما بستگی دارد.

چکیده اصلی

BACKGROUND: Generative artificial intelligence (GenAI) is increasingly used to draft multiple-choice questions (MCQs) for health professions education, but much evidence concerns raw model outputs, expert ratings, or item difficulty alone. Educators edit GenAI drafts before use, and whether such items are psychometrically ready for postgraduate assessment remains unclear. OBJECTIVE: This study aimed to compare human-edited GenAI-assisted and educator-crafted MCQs for postgraduate Family Medicine Applied Knowledge Test-level assessment, examining difficulty, discrimination, reliability, distractor functioning, and participant perceptions. METHODS: We conducted a blinded cross-sectional, within-participant comparative psychometric evaluation in Singapore. Sixty best-of-five single-best-answer MCQs were evaluated, 30 human-edited GenAI-assisted items and 30 educator-crafted items, topic-matched across postgraduate FM domains and randomized across 2 assessment sets. Eligible participants were postgraduate doctors enrolled in FM residency or postgraduate family medicine programs, preparing for the Applied Knowledge Test, and blinded to item origin; incomplete paired responses were excluded. Outcomes included paired total scores, score correlation and agreement, Kuder-Richardson Formula 20 reliability, item difficulty index, corrected point-biserial discrimination, distractor functioning, and perceived difficulty, clarity, and relevance. Analyses used paired-sample tests, Pearson correlation, Fisher exact tests, and item-level psychometric statistics, with α=.05 and Bonferroni correction within comparison families. RESULTS: Of 74 participants, 73 completed both item sets and were included in the analysis. The final sample comprised 36 graduate diploma in FM trainees, 5 MMed FM trainees, and 32 FM residents. Paired-sample testing showed lower scores on GenAI-assisted than educator-crafted items (mean 19.12, SD 2.83 vs mean 21.10, SD 3.42 out of 30; mean difference -1.97, 95% CI -2.72 to -1.23; P<.001; Cohen d=0.62), indicating that GenAI-assisted items were not easier. Scores were positively correlated (r=0.49, 95% CI 0.30-0.64; P<.001), but Bland-Altman analysis indicated limited agreement. Kuder-Richardson Formula 20 reliability was lower for GenAI-assisted items (0.38 vs 0.60). Mean difficulty index did not differ significantly (0.64 vs 0.70; mean difference -0.07, 95% CI -0.19 to 0.06; P=.29), and more GenAI-assisted items fell within the acceptable difficulty range (18/30, 60.0% vs 13/30, 43.3%). However, mean corrected point-biserial discrimination was lower for GenAI-assisted items (0.09 vs 0.18; mean difference -0.08, 95% CI -0.16 to -0.01; P=.04), and negative discrimination was more common (6/30, 20% vs 3/30, 10%). GenAI-assisted items also had more nonfunctioning and negatively discriminating distractors, although these differences were not statistically significant. Participant ratings of perceived difficulty, clarity, and practice relevance did not differ by origin. CONCLUSIONS: Human-edited GenAI-assisted MCQs can achieve plausible difficulty, but difficulty and surface acceptability did not ensure assessment readiness. Using trainee response data, this study extends work on raw outputs or expert opinion. GenAI should be used as a drafting adjunct within educator-led workflows prioritizing key verification, distractor engineering, pilot testing, empirical item analysis, and repair before item-bank or summative use.

نتیجه فارسی

این مطالعه مقایسه‌ای روان‌سنجی سوالات چندگزینه‌ای تک‌به‌به‌ترینِ کمک‌شده با هوش مصنوعی تولیدکننده (GenAI) ویرایش‌شده توسط انسان را با سوالات ساخته شده توسط معلمان در پزشکی خانواده پس‌دوزمانی انجام داد. نتایج نشان داد که سوالات GenAI ساده‌تر نبودند، اما پایایی و تفکیک آن‌ها پایین‌تر بود. معلمان باید قبل از استفاده نهایی، این سوالات را به طور دقیق بررسی و اصلاح کنند.

  • سوالات کمک‌شده با GenAI ساده‌تر از سوالات ساخته شده توسط معلمان نبودند.
  • پایایی فرمول ۲۰ کودر-ریچاردسون برای سوالات GenAI پایین‌تر بود.
  • تفکیک نقطه-دوگانه اصلاح‌شده برای سوالات GenAI پایین‌تر بود.
  • گزینه‌های گمراه‌کننده غیرفعال در سوالات GenAI بیشتر بود.
  • معلمان باید قبل از استفاده نهایی، این سوالات را به طور دقیق بررسی و اصلاح کنند.

ترجمه فارسی چکیده

پیش‌زمینه: هوش مصنوعی تولیدکننده (GenAI) به طور فزاینده‌ای برای تدوین سوالات چندگزینه‌ای (MCQ) در آموزش حرفه‌های سلامت استفاده می‌شود، اما شواهد زیادی مربوط به خروجی خام مدل، رتبه‌بندی متخصصان یا سختی سوالات به تنهایی است. معلمان ویرایش پیش‌نویس‌های GenAI قبل از استفاده انجام می‌دهند، اما اینکه آیا این سوالات آمادگی روان‌سنجی برای ارزیابی پس‌دوزمانی را دارند، روشن نیست. هدف: این مطالعه مقایسه سوالات چندگزینه‌ای تک‌به‌به‌ترینِ کمک‌شده با GenAI ویرایش‌شده توسط انسان و سوالات ساخته شده توسط معلمان را برای ارزیابی سطح آزمون دانش کاربردی پزشکی خانواده پس‌دوزمانی، با بررسی سختی، تفکیک، پایایی، عملکرد گزینه‌های گمراه‌کننده و دیدگاه شرکت‌کنندگان انجام داد. روش‌ها: ما یک ارزیابی روان‌سنجی مقایسه‌ای مقطعی و کور درون‌نفرانه در سنگاپور انجام دادیم. شصت سوال چندگزینه‌ای تک‌به‌به‌ترینِ بهترین از پنج مورد ارزیابی شد، ۳۰ مورد ویرایش‌شده توسط انسان و ۳۰ مورد ساخته شده توسط معلمان، با موضوع هم‌خوان در حوزه‌های پزشکی خانواده پس‌دوزمانی و تصادفی‌سازی در دو مجموعه ارزیابی. شرکت‌کنندگان واجد شرایط پزشکان پس‌دوزمانی ثبت‌نام‌شده در تمرین پزشکی خانواده یا برنامه‌های پس‌دوزمانی بودند که برای آزمون دانش کاربردی آماده می‌شدند و نسبت به منبع سوال کور بودند؛ پاسخ‌های جفت ناقص حذف شدند. نتایج شامل امتیازهای کل جفت، همبستگی و توافق امتیاز، پایایی فرمول ۲۰ کودر-ریچاردسون، شاخص سختی سوال، تفکیک نقطه-دوگانه اصلاح‌شده، عملکرد گزینه‌های گمراه‌کننده و سختی، شفافیت و مرتبط بودن درک‌شده بود. تحلیل‌ها از آزمون‌های نمونه جفت، همبستگی پیرسون، آزمون‌های دقیق فیشر و آمارهای روان‌سنجی سطح سوال استفاده کردند، با α=.۰۵ و اصلاح Bonferroni در خانواده‌های مقایسه‌ای. نتایج: از ۷۴ شرکت‌کننده، ۷۳ مورد هر دو مجموعه سوال را تکمیل کردند و در تحلیل گنجانده شدند. نمونه نهایی شامل ۳۶ دانشجوی دیپلم پزشکی خانواده، ۵ دانشجوی MMed پزشکی خانواده و ۳۲ تمرین‌کننده پزشکی خانواده بود. آزمون نمونه جفت نشان داد امتیازات پایین‌تری در سوالات کمک‌شده با GenAI نسبت به سوالات ساخته شده توسط معلمان (میانگین ۱۹.۱۲، انحراف معیار ۲.۸۳ در برابر میانگین ۲۱.۱۰، انحراف معیار ۳.۴۲ از ۳۰؛ اختلاف میانگین -۱.۹۷، ۹۵٪ CI -۲.۷۲ تا -۱.۲۳؛ P<.۰۰۱؛ Cohen d=۰.۶۲)، که نشان می‌دهد سوالات کمک‌شده با GenAI ساده‌تر نبودند. امتیازات به صورت مثبت همبستگی داشتند (r=۰.۴۹، ۹۵٪ CI ۰.۳۰-۰.۶۴؛ P<.۰۰۱)، اما تحلیل Bland-Altman نشان‌دهنده توافق محدود بود. پایایی فرمول ۲۰ کودر-ریچاردسون برای سوالات کمک‌شده با GenAI پایین‌تر بود (۰.۳۸ در برابر ۰.۶۰). شاخص سختی میانگین تفاوت معناداری نداشت (۰.۶۴ در برابر ۰.۷۰؛ اختلاف میانگین -۰.۰۷، ۹۵٪ CI -۰.۱۹ تا ۰.۰۶؛ P=.۲۹) و بیشتر سوالات کمک‌شده با GenAI در محدوده سختی قابل قبول قرار داشتند (۱۸/۳۰، ۶۰.۰٪ در برابر ۱۳/۳۰، ۴۳.۳٪). با این حال، تفکیک نقطه-دوگانه اصلاح‌شده میانگین برای سوالات کمک‌شده با GenAI پایین‌تر بود (۰.۰۹ در برابر ۰.۱۸؛ اختلاف میانگین -۰.۰۸، ۹۵٪ CI -۰.۱۶ تا -۰.۰۱؛ P=.۰۴) و تفکیک منفی بیشتر رایج بود (۶/۳۰، ۲۰٪ در برابر ۳/۳۰، ۱۰٪). سوالات کمک‌شده با GenAI همچنین گزینه‌های گمراه‌کننده غیرفعال و تفکیک منفی بیشتری داشتند، اگرچه این تفاوت‌ها آماری معنادار نبودند. رتبه‌بندی‌های شرکت‌کنندگان از سختی، شفافیت و مرتبط بودن عملی درک‌شده تفاوتی با منبع نداشتند. نتیجه‌گیری: سوالات چندگزینه‌ای تک‌به‌به‌ترینِ کمک‌شده با GenAI ویرایش‌شده توسط انسان می‌توانند سختی قابل قبولی را به دست آورند، اما سختی و پذیرش سطحی تضمین آمادگی ارزیابی را نکردند. با استفاده از داده‌های پاسخ دانشجویان، این مطالعه کار را بر روی خروجی خام یا نظر متخصصان گسترش می‌دهد. GenAI باید به عنوان یک مکمل تدوین در جریان‌های کاری رهبری شده توسط معلمان با اولویت‌دهی به تأیید کلیدی، مهندسی گزینه‌های گمراه‌کننده، آزمایش اولیه، تحلیل آماری سوال و تعمیر قبل از استفاده از بانک سوال یا ارزیابی جمعی استفاده شود.

روش پژوهش

این مطالعه یک ارزیابی روان‌سنجی مقایسه‌ای کور و مقطعی درون‌نفرانه در سنگاپور بود. شصت سوال چندگزینه‌ای تک‌به‌به‌ترینِ بهترین از پنج مورد شامل ۳۰ مورد ویرایش‌شده توسط انسان و ۳۰ مورد ساخته شده توسط معلمان بود که با موضوع هم‌خوان و تصادفی‌سازی در دو مجموعه ارزیابی قرار گرفتند. تحلیل‌ها از آزمون‌های نمونه جفت، همبستگی پیرسون و آزمون‌های دقیق فیشر استفاده کردند.

محدودیت‌ها

محدودیت‌های گزارش شده شامل حذف پاسخ‌های جفت ناقص و تمرکز بر سوالات پزشکی خانواده پس‌دوزمانی است. نتایج ممکن است به طور خاصی به سوالات چندگزینه‌ای تک‌به‌به‌ترینِ بهترین از پنج و به محیط آموزشی سنگاپور اعمال نشود.

استخراج ساختاریافته از متن منبع

نمای PICO و پیامدها

جمعیت
پزشکان پس‌دوزمانی ثبت‌نام‌شده در تمرین پزشکی خانواده یا برنامه‌های پس‌دوزمانی که برای آزمون دانش کاربردی آماده می‌شدند.
مداخله/مواجهه
سوالات چندگزینه‌ای تک‌به‌به‌ترینِ کمک‌شده با GenAI ویرایش‌شده توسط انسان.
مقایسه
سوالات چندگزینه‌ای تک‌به‌به‌ترینِ ساخته شده توسط معلمان.
حجم نمونه
۷۳ شرکت‌کننده (۳۶ دانشجوی دیپلم پزشکی خانواده، ۵ دانشجوی MMed پزشکی خانواده و ۳۲ تمرین‌کننده پزشکی خانواده).

متن کامل اصلی

نسخه دارای مجوز در منبع علمی در دسترس است.

لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز می‌شود.

باز کردن متن کامل

کلیدواژه‌ها

ChatGPTassessmentdistractor analysisfamily medicinegenerative artificial intelligenceitem analysismedical educationmultiple-choice questionspsychometrics
در همین زیرشاخه

مقاله‌های مرتبط

PubMed2026

[THE SECONDARY MEDICAL EDUCATION IN RUSSIA: CHALLENGES OF PRACTICAL TRAINING AND STRATEGIES ENHANCING COMPETITIVE ABILITIES OF GRADUATES AT LABOR MARKET].

The article analyzes current state of system of secondary vocational medical education in Russia. On the basis of data from government agencies and professional associations key issues are considered: record-breaking outflow of young professionals from industry, irregularity of practical training and low efficiency of existing mechanisms of employment. The particular attention is paid to strategies of increasing competitiveness of grad…

PubMed2026

Clinical Teaching Fellow Practice Within Complex Clinical-Educational Systems: An Activity Theory-Informed Case Study.

BACKGROUND: Clinical teaching occurs where patient care and education coexist. Within the United Kingdom's National Health Service, workforce pressures constrain teaching and supervision. Clinical Teaching Fellow (CTF) roles have expanded in response but are often viewed as discrete posts rather than practices situated within complex clinical-educational systems. This study examined how tensions within and across these systems shaped C…

PubMed2026

Near-Peer Anatomy-Anchored Teaching.

BACKGROUND: The transition from pre-clinical to clinical medicine is challenging, particularly in applying anatomical knowledge to patient care. Reductions in dedicated anatomy teaching time have compounded this. Near-peer teaching may help address this gap by reducing hierarchy and enhancing psychological safety, though few programmes have explicitly targeted the pre-clinical to clinical transition through the integration of anatomy w…

PubMed2026

Operating Theatre-Based Video Interventions to Enhance Student Preparation: A Scoping Review.

INTRODUCTION: Operating theatre experience is central to surgical education, yet medical students often feel unprepared due to the environment's complexity. Video-based resources are increasingly used in surgical training, but their role in improving preparedness for the operating theatre is unclear. This scoping review examined how video-based interventions influence medical students' self-reported preparedness, including confidence, …