A curated structural dataset of peptide-protein complexes reveals biases in existing datasets and principles of peptide binding.
پخش حرفهای فارسی و انگلیسی
در حال بررسی نسخههای صوتی ذخیرهشده…
تنظیم صدای طبیعی و سرعت
صداهایی که در نامشان «Natural»، «Neural» یا «Online» دیده میشود معمولاً طبیعیترند. انتخاب صدا به صداهای نصبشده در ویندوز و مرورگر شما بستگی دارد.
چکیده اصلی
Peptide-protein interactions are fundamental to many biological processes, and peptide design is gaining interest due to its therapeutic potential. This has led to the emergence of various structural databases, such as PepBDB and Peptipedia, that classify peptides as polypeptides with fewer than 50 amino acids. These databases provide valuable starting points for studying peptide recognition by protein partners and are widely used for machine learning applications, docking, and scoring functions. However, under such a length definition for peptides, we have very different cases that are likely to confound the analysis of peptide binding, including miniproteins, peptide-peptide complexes, intramolecular peptide disulfide bonds, intermolecular disulfide bridges, and proteins undergoing internal cleavage, such as serpins, as well as non-natural amino acids and covalently bound cofactors. Here, we present a rigorous classification of peptide-protein complexes to generate datasets suitable for comparative energetic analysis with a focus on peptides that are unstructured in the absence of their target protein. The analysis of this dataset shows that peptide binding is typically driven by a small number of hotspot residues mainly enriched in aromatic and bulky hydrophobic side chains. Their number of hotspots and their spatial organization depend on peptide length, secondary structure, and covalent constraints. Short peptides rely on central anchor regions, whereas longer peptides distribute hotspots more broadly, with helices showing periodic spacing and β-strands relying more on backbone-mediated stabilization. Disulfide bonds further decrease the number of hotspots per peptide length by either pre-organizing the peptide or acting as covalent anchors. This work provides a curated resource and general principles for peptide recognition. It highlights the importance of structurally classifying peptide-protein complexes to avoid bias in downstream computational and machine-learning applications.
نتیجه فارسی
مجموعه دادهای از پیوندهای پپتید-پروتئین گردآوری شد تا سوگیریهای پایگاههای داده موجود شناسایی شود. تحلیل نشان داد که پیوند پپتید عمدتاً توسط تعداد کمی باقیمانده هاتاسپات آروماتیک و هیدروفوبیک هدایت میشود. طول پپتید و ساختار ثانویه بر سازماندهی فضایی این باقیماندهها تأثیر میگذارد. پیوندهای دیسولفید تعداد هاتاسپاتها را کاهش میدهند. این کار اهمیت طبقهبندی ساختاری برای کاربردهای محاسباتی را برجسته میکند.
- پیوند پپتید عمدتاً توسط تعداد کمی باقیمانده هاتاسپات هدایت میشود.
- هاتاسپاتها عمدتاً آروماتیک و هیدروفوبیک هستند.
- طول پپتید و ساختار ثانویه بر سازماندهی فضایی هاتاسپاتها تأثیر میگذارد.
- پیوندهای دیسولفید تعداد هاتاسپاتها را کاهش میدهند.
- طبقهبندی ساختاری برای جلوگیری از سوگیری در کاربردهای محاسباتی ضروری است.
ترجمه فارسی چکیده
تعاملات پپتید-پروتئین بنیادی بسیاری از فرآیندهای زیستی هستند و طراحی پپتید به دلیل پتانسیل درمانی، توجه زیادی را به خود جلب کرده است. این امر منجر به ظهور پایگاههای داده ساختاری مختلفی مانند PepBDB و Peptipedia شده است که پپتیدها را به عنوان پلیپپتیدهایی با کمتر از ۵۰ آمینو اسید طبقهبندی میکنند. این پایگاههای داده نقطه شروع ارزشمندی برای مطالعه تشخیص پپتید توسط شریکهای پروتئینی هستند و به طور گسترده برای کاربردهای یادگیری ماشین، داکینگ و توابع امتیازدهی استفاده میشوند. با این حال، تحت این تعریف طول برای پپتیدها، موارد بسیار متفاوتی وجود دارد که احتمالاً تحلیل پیوند پپتید را مختل میکنند، از جمله مینوپروتئینها، پیوندهای پپتید-پپتید، پیوندهای دیسولفید پپتید درونمولکولی، پلهای دیسولفید بینمولکولی و پروتئینهایی که درونشکنی میشوند، مانند سرپینها، به همراه آمینو اسیدهای غیرطبیعی و کوفاکتورهای پیوند کووالانسی. اینجا، ما یک طبقهبندی دقیق از پیوندهای پپتید-پروتئین برای تولید مجموعه دادههای مناسب برای تحلیل انرژی مقایسهای با تمرکز بر پپتیدهایی که در غیاب پروتئین هدف ساختارمند نیستند، ارائه میدهیم. تحلیل این مجموعه داده نشان میدهد که پیوند پپتید معمولاً توسط تعداد کمی باقیمانده «هاتاسپات» (Hotspot) که عمدتاً غنی از زنجیرههای جانبی آروماتیک و هیدروفوبیک بزرگ هستند، هدایت میشود. تعداد هاتاسپاتها و سازماندهی فضایی آنها بستگی به طول پپتید، ساختار ثانویه و محدودیتهای کووالانسی دارد. پپتیدهای کوتاه به مناطق لنگر مرکزی تکیه میکنند، در حالی که پپتیدهای طولانیتر هاتاسپاتها را به طور گستردهتری توزیع میکنند، با نشان دادن فاصلهگذاری دورهای در هلیکسها و وابستگی بیشتر استیبلایزرهای مبتنی بر بکباند در اسکلتهای بتا. پیوندهای دیسولفید تعداد هاتاسپاتها را برای هر طول پپتید به دلیل سازماندهی پیشین پپتید یا عمل به عنوان لنگرهای کووالانسی، کاهش میدهند. این کار یک منبع گردآوری شده و اصول کلی برای تشخیص پپتید را فراهم میکند. این کار اهمیت طبقهبندی ساختاری پیوندهای پپتید-پروتئین را برای جلوگیری از سوگیری در کاربردهای محاسباتی و یادگیری ماشین در مراحل بعدی برجسته میکند.
روش پژوهش
یک طبقهبندی دقیق از پیوندهای پپتید-پروتئین برای تولید مجموعه دادههای مناسب برای تحلیل انرژی مقایسهای انجام شد. تمرکز بر پپتیدهایی بود که در غیاب پروتئین هدف ساختارمند نیستند.
محدودیتها
محدودیتها در متن گزارش نشدهاند.
نمای PICO و پیامدها
- جمعیت
- پپتیدها و پروتئینهای هدف.
- مداخله/مواجهه
- طبقهبندی دقیق پیوندهای پپتید-پروتئین.
- مقایسه
- مجموعه دادههای موجود (مانند PepBDB و Peptipedia).
- حجم نمونه
- تعداد نمونه در متن گزارش نشده است.
متن کامل اصلی
لینک مستقیم از metadata منبع گرفته شده و در تب جدید باز میشود.
باز کردن متن کامل