Readability of AI-Generated Patient Visit Summaries in Orthopedic Surgery: Retrospective Analysis.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Patient visit summaries (PVS) are patient-facing documents intended to reinforce communication and promote patient education after clinical encounters. Despite national recommendations that patient education materials be written at or below a sixth-grade reading level, most orthopedic materials substantially exceed this threshold. Current visit summaries are also time-consuming to generate, lack personalization, and often fail to meet patient literacy needs. AI-based scribes can generate personalized PVS in real time directly from patient-provider conversations, offering a potential solution. OBJECTIVE: This study aimed to evaluate the readability of AI-generated PVS produced by a commercial AI scribe platform in an orthopedic surgery setting and determine their alignment with established literacy standards for patient-facing materials. METHODS: A total of 1007 consecutive AI-generated PVS from an academic orthopedic surgery outpatient clinic between December 2023 and May 2024 were reviewed. Following standardized preprocessing, including restoration of original section headings and removal of diagnosis label headers, summaries identified as incomplete were excluded (n=25), yielding a final study cohort of 982 summaries. Readability was assessed using 5 validated indices: the Flesch-Kincaid Grade Level (FKGL), Flesch Reading Ease Score (FRES), Gunning Fog Index (GFI), Coleman-Liau Index (CLI), and Simple Measure of Gobbledygook (SMOG) Index. The proportions of PVS meeting the sixth- and eighth-grade benchmarks were calculated. Spearman's rank correlation (ρ) assessed associations between word count and readability metrics. The Kendall Coefficient of Concordance (W) was used to evaluate agreement among indices after reverse-coding FRES for directional alignment. Statistical significance was set at P<.05. RESULTS: Among 982 analyzed PVS, the mean FKGL was 9.3 (SD 1.2, 95% CI 9.2-9.4) and the mean FRES was 57.6 (SD 7.9, 95% CI 57.1-58.1), corresponding to "fairly difficult." Mean scores for secondary indices were 12.4 (SD 1.6) for GFI, 11.0 (SD 1.5) for CLI, and 12.4 (SD 1.2) for SMOG. Only 0.4% (4/982) of PVS met the sixth-grade benchmark and 14.2% (139/982) met the eighth-grade threshold. Word count was not significantly correlated with FKGL (ρ=0.012, P=.70), suggesting that sentence structure and vocabulary rather than document length drive reading complexity. Readability indices demonstrated strong agreement across all 5 metrics (W=0.882, P<.001). CONCLUSIONS: In this orthopedic outpatient setting, AI-generated PVS consistently exceeded recommended patient literacy thresholds, with a mean ninth-grade reading level and only 14.2% of summaries meeting the eighth-grade standard. In the absence of a concurrent comparison group, the present study was not designed to evaluate improvement over traditional methods. These findings establish a quantitative readability baseline for AI scribe output in orthopedic surgery and highlight the need for algorithmic refinement, plain language optimization, and prospective patient comprehension testing to improve health communication.
نتیجه فارسی
این مطالعه خوانایی ۹۸۲ خلاصه بازدید بیمار تولید شده توسط هوش مصنوعی در جراحی ارتوپدی را بررسی کرد. نتایج نشان داد که خلاصهها به طور متوسط سطح خوانایی نهم را داشتند و تنها ۱۴.۲٪ آنها استاندارد پایه هشتم را رعایت کردند. این یافتهها نشان میدهد که خلاصههای تولید شده توسط هوش مصنوعی هنوز برای اکثر بیماران مناسب نیستند و نیاز به بهبود الگوریتمی و بهینهسازی زبان ساده دارد.
- خلاصههای PVS تولید شده توسط هوش مصنوعی در جراحی ارتوپدی به طور متوسط سطح خوانایی نهم را داشتند.
- فقط ۰.۴٪ خلاصهها و ۱۴.۲٪ آنها استاندارد پایه ششم و هشتم را رعایت کردند.
- تعداد کلمات با سطح خوانایی همبستگی معناداری نداشت.
- این مطالعه بدون گروه مقایسه طراحی شده بود و نمیتواند بهبود نسبت به روشهای سنتی را ارزیابی کند.
ترجمه فارسی چکیده
پسزمینه: خلاصههای بازدید بیمار (PVS) اسنادی هستند که با هدف تقویت ارتباط و آموزش بیمار پس از ملاقاتهای بالینی تهیه میشوند. با وجود توصیههای ملی مبنی بر نگارش مواد آموزشی بیمار در سطح یا پایینتر از پایه ششم تحصیلی، اکثر مواد ارتوپدی به شدت از این آستانه فراتر میروند. هدف: این مطالعه ارزیابی خوانایی خلاصههای PVS تولید شده توسط یک پلتفرم هوش مصنوعی تجاری در محیط جراحی ارتوپدی و بررسی تطابق آنها با استانداردهای شناختی موجود بود. روشها: ۱۰۰۷ خلاصه PVS متوالی تولید شده توسط هوش مصنوعی از یک کلینیک ارتوپدی دانشگاهی بین دسامبر ۲۰۲۳ و مه ۲۰۲۴ بررسی شدند. پس از پیشپردازش استاندارد، خلاصههای ناقص حذف شدند (n=25) و نهایتاً ۹۸۲ خلاصه در مطالعه باقی ماندند. خوانایی با ۵ شاخص معتبر ارزیابی شد: سطح پایه Flesch-Kincaid (FKGL)، امتیاز آسانخوانی Flesch (FRES)، شاخص مهندسی Gunning (GFI)، شاخص Coleman-Liau (CLI) و شاخص SMOG. نسبت خلاصههای مطابق با پایه ششم و هشتم محاسبه شد. همبستگی رتبهای اسپیرمن برای بررسی رابطه بین تعداد کلمات و شاخصهای خوانایی استفاده شد. نتایج: میانگین FKGL ۹.۳ (انحراف معیار ۱.۲) و میانگین FRES ۵۷.۶ (انحراف معیار ۷.۹) بود که به معنای «سختی متوسط» است. فقط ۰.۴٪ (۴/۹۸۲) خلاصهها پایه ششم و ۱۴.۲٪ (۱۳۹/۹۸۲) پایه هشتم را پوشش دادند. تعداد کلمات با FKGL همبستگی معناداری نداشت (ρ=0.012, P=.70). شاخصهای خوانایی در تمام ۵ شاخص همسانی قوی نشان دادند (W=0.882, P<.001). نتیجهگیری: در این محیط ارتوپدی، خلاصههای PVS تولید شده توسط هوش مصنوعی به طور مداوم از آستانههای توصیه شده فراتر رفت و میانگین سطح خوانایی آنها نهم بود.
روش پژوهش
این مطالعه یک تحلیل بازگشتی از ۱۰۰۷ خلاصه PVS تولید شده توسط هوش مصنوعی در یک کلینیک ارتوپدی دانشگاهی بین دسامبر ۲۰۲۳ و مه ۲۰۲۴ بود. خلاصههای ناقص حذف شدند و خوانایی با ۵ شاخص معتبر (FKGL, FRES, GFI, CLI, SMOG) ارزیابی شد.
محدودیتها
این مطالعه بدون گروه مقایسه طراحی شده بود و نمیتواند بهبود نسبت به روشهای سنتی را ارزیابی کند. همچنین، این مطالعه فقط به خوانایی تکیه داشت و درک واقعی بیماران را بررسی نکرد.
نمای PICO و پیامدها
- جمعیت
- بیماران در حال مراجعه به یک کلینیک ارتوپدی دانشگاهی.
- مداخله/مواجهه
- خلاصههای بازدید بیمار تولید شده توسط یک پلتفرم هوش مصنوعی تجاری.
- مقایسه
- هیچ گروه مقایسهای وجود نداشت.
- حجم نمونه
- ۹۸۲ خلاصه نهایی.
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل