Sentence-Level Provenance for AI Medical Record Summarization in a Click-to-Inspect Interface: Formative Usability Evaluation.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
BACKGROUND: Large language models can generate fluent summaries of longitudinal medical records, but in high-stakes clinical settings, verification burden remains a barrier to trust. Existing provenance mechanisms such as document-level citations and section references often require manual search within long, fragmented notes, limiting their usefulness during time-constrained workflows for clinicians. OBJECTIVE: This study aimed to design and evaluate a sentence-level provenance interface ("click to inspect") that enables rapid verification of AI-generated longitudinal medical record summaries at the level of individual statements. METHODS: Between November 2023 and January 2024, we conducted a formative usability study using remotely moderated usability sessions via Zoom to evaluate a web-based sentence-level provenance interface for AI-generated longitudinal medical record summaries. A convenience sample of clinicians was recruited through email outreach to academic and professional networks across the United States. Formative usability testing was conducted with 46 clinician interactions using synthetic longitudinal patient charts. Participants included medical students, residents, and attending physicians across multiple specialties, including internal medicine, dermatology, radiology, plastic surgery, anesthesiology, interventional radiology, obstetrics and gynecology, and family medicine. Usability was assessed using the System Usability Scale and net promoter score, alongside qualitative feedback. RESULTS: Clinicians reported high usability (mean System Usability Scale score 86.25, SD 7.77; 95% CI 83.96-88.54 from 46 participants) and a positive overall experience (net promoter score of 35; 22/46, 47.8% promoters; 18/46, 39.1% passives; and 6/46, 13% detractors). Participants described rapid access to supporting evidence as critical for trust calibration during first-pass chart review. Qualitative feedback identified friction in traditional citation-based interfaces and supported sentence-level inspectability as a low-friction verification mechanism. CONCLUSIONS: Sentence-level provenance transforms AI-generated summaries from static narratives into interactive verification tools. An approach that enables rapid, selective inspection of individual claims during longitudinal chart review may reduce verification burden and support calibrated reliance in high-risk clinical contexts.
نتیجه فارسی
این مطالعه یک رابط کاربری «کلیک برای بررسی» در سطح جمله را برای خلاصهسازی سوابق پزشکی توسط هوش مصنوعی طراحی و ارزیابی کرد. در این رابط، پزشکان میتوانند با کلیک روی هر جمله، شواهد پشتیبان آن را مشاهده کنند. تستها نشان دادند که این رابط کاربردیپذیری بالایی دارد و به پزشکان کمک میکند تا خلاصهها را به سرعت تأیید کنند. این روش میتواند بار تأیید را در محیطهای بالینی کاهش دهد.
- طراحی یک رابط کاربری «کلیک برای بررسی» در سطح جمله برای خلاصهسازی سوابق پزشکی توسط هوش مصنوعی.
- ارزیابی کاربردیپذیری رابط با ۴۶ تعامل پزشک.
- گزارش کاربردیپذیری بالا (میانگین امتیاز ۸۶.۲۵) و تجربه مثبت (امتیاز NPS ۳۵).
- شناسایی اصطکاک در رابطهای مبتنی بر استناد سنتی.
- پذیرش قابلیت بررسی در سطح جمله به عنوان مکانیزمی با اصطکاک کم برای تأیید.
ترجمه فارسی چکیده
مدلهای زبانی بزرگ میتوانند خلاصههای روانی از سوابق پزشکی طولانی تولید کنند، اما در محیطهای بالینی با ریسک بالا، بار تأیید همچنان مانعی برای اعتماد است. مکانیزمهای موجود مانند استناددهی سطح سند و ارجاع به بخشها اغلب نیاز به جستجوی دستی در میان یادداشتهای طولانی و پراکنده دارند که کارایی آنها را در جریانهای کاری محدود زمانی محدود میکند. هدف این مطالعه طراحی و ارزیابی یک رابط کاربری «کلیک برای بررسی» (click to inspect) در سطح جمله بود که امکان تأیید سریع خلاصههای تولید شده توسط هوش مصنوعی را در سطح عبارات فردی فراهم میکند. در این مطالعه کاربردیپذیری، از نوامبر ۲۰۲۳ تا ژانویه ۲۰۲۴، جلسات کاربردیپذیری از راه دور با استفاده از Zoom برای ارزیابی یک رابط وب در سطح جمله انجام شد. نمونهای از پزشکان از طریق تماسهای ایمیل به شبکههای دانشگاهی و حرفهای در ایالات متحده جذب شدند. تستهای کاربردیپذیری با ۴۶ تعامل پزشک با نمودارهای بیمار مصنوعی انجام شد. شرکتکنندگان شامل دانشجویان پزشکی، دستیاران و پزشکان متخصص در رشتههای مختلف از جمله پزشکی داخلی، پوست، رادیولوژی، جراحی پلاستیک، بیهوشی، رادیولوژی مداخلهای، زنان و زایمان و پزشکی خانواده بودند. کاربردیپذیری با مقیاس کاربردیپذیری سیستم و امتیاز نیتسازنده (NPS) و بازخورد کیفی ارزیابی شد. پزشکان کاربردیپذیری بالا را گزارش دادند (میانگین امتیاز ۸۶.۲۵، انحراف معیار ۷.۷۷) و تجربه کلی مثبتی را گزارش کردند (امتیاز NPS ۳۵). بازخورد کیفی، اصطکاک در رابطهای مبتنی بر استناد را شناسایی کرد و پذیرش قابلیت بررسی در سطح جمله را به عنوان مکانیزمی با اصطکاک کم برای تأیید پذیرفت.
روش پژوهش
این مطالعه یک ارزیابی کاربردیپذیری (formative usability study) از نوامبر ۲۰۲۳ تا ژانویه ۲۰۲۴ با استفاده از Zoom انجام شد. از نمونهای از پزشکان (دانشجویان پزشکی، دستیاران و پزشکان متخصص) و نمودارهای بیمار مصنوعی استفاده شد.
محدودیتها
محدودیتهای این مطالعه شامل استفاده از نمونهای از پزشکان و نمودارهای مصنوعی است. همچنین، این مطالعه یک ارزیابی کاربردیپذیری است و نتایج آن ممکن است در محیطهای واقعی متفاوت باشد.
نمای PICO و پیامدها
- جمعیت
- پزشکان (دانشجویان پزشکی، دستیاران و پزشکان متخصص) در رشتههای مختلف از جمله پزشکی داخلی، پوست، رادیولوژی، جراحی پلاستیک، بیهوشی، رادیولوژی مداخلهای، زنان و زایمان و پزشکی خانواده.
- مداخله/مواجهه
- رابط کاربری «کلیک برای بررسی» (click to inspect) در سطح جمله برای خلاصهسازی سوابق پزشکی توسط هوش مصنوعی.
- مقایسه
- رابطهای مبتنی بر استناد سنتی (document-level citations and section references).
- حجم نمونه
- ۴۶ تعامل پزشک.
متن کامل اصلی
برای بررسی دسترسی کتابخانهای یا خرید، رکورد اصلی را باز کنید.
رفتن به منبع اصلی