دیپمایند اطلس آلفاژنوم را برای پیشبینی اثرات ۹ میلیارد جهش دیانای رونمایی کرد
گوگل دیپمایند یک پایگاه داده ۱ پتابایتی منتشر کرده است که اثر مولکولی هر تغییر تکحرفی ممکن در ژنوم انسان را از پیش محاسبه میکند. این کار، گلوگاه تحقیقات ژنومیک را از پیشبینیهای محاسباتی به سمت اعتبارسنجیهای آزمایشگاهی سوق میدهد.
به قلم آزاده ابراهیمی
این خبر را به اشتراک بگذارید
تلاش برای رمزگشایی ژنوم انسان در حال حاضر میان دو واقعیت ناسازگار گرفتار شده است. از یک سو، زیستشناسان محاسباتی استدلال میکنند که مقیاس عظیم دیانای — تقریباً ۳ میلیارد جفتباز که به ۹ میلیارد جهش تکحرفی ممکن میانجامد — برای پیشبینی اینکه کدام تغییرات اهمیت دارند، نیازمند هوش مصنوعی است؛ زیرا آزمایش فیزیکی همه آنها غیرممکن است.
از سوی دیگر، محققان علوم انتقالی (Translational researchers) بر این باورند که مدلهای پیشرفته هوش مصنوعی برای استفاده روزمره در آزمایشگاه از نظر محاسباتی بسیار گرانقیمت هستند و یک پیشبینی تا زمانی که در یک کارآزمایی بالینی فیزیکی تایید نشود، بیفایده باقی میماند.[2][3]
گوگل دیپمایند تلاش کرده است تا با حذف مدل هوش مصنوعی از جریان کار کاربر، این تنش را بهطور کامل دور بزند. در ۸ سپتامبر ۲۰۲۶، این شرکت اطلس آلفاژنوم (AlphaGenome Atlas) را منتشر کرد؛ یک پایگاه داده ۱ پتابایتی که اثر مولکولی هر تغییر تکحرفی ممکن در دیانای را از پیش محاسبه میکند. اکنون محققان به جای اجرای یک مدل با پردازش محاسباتی سنگین برای آزمایش یک واریانت، میتوانند به سادگی پاسخ را در یک مرورگر وب جستجو کنند.[1][2][3]
از نظر تاریخی، تحقیقات علمی به شدت روی آن ۲ درصد از ژنوم که مستقیماً پروتئینها را کد میکند، متمرکز بوده است. ۹۸ درصد باقیمانده که اغلب به عنوان نواحی غیرکدکننده شناخته میشوند، چگونگی و زمان روشن یا خاموش شدن آن ژنها را تنظیم میکنند. درک این معماری تنظیمی برای ردیابی منشأ صفات و بیماریهای پیچیده حیاتی است، اما مقیاس ژنوم غیرکدکننده، تحلیل سیستماتیک آن را به شدت دشوار کرده است.[2]
دیپمایند پیش از این با آلفاژنوم، یک مدل هوش مصنوعی با قابلیت پیشبینی چگونگی اختلال واریانتهای ژنتیکی در فرآیندهای بیولوژیکی، به این موضوع پرداخته بود. پوشمیت کوهلی (Pushmeet Kohli)، معاون علمی دیپمایند، و ژیگا آوسک (Žiga Avsec)، سرپرست ابتکار ژنومیک، در بیانیه انتشار نوشتند: «مدل آلفاژنوم ما پیشتر نشان داده است که چگونه تغییرات منفرد در این نواحی غیرکدکننده دیانای میتوانند فرآیندهای مولکولی مانند تولید پروتئین را مختل کنند، اما تصویر بزرگتر هنوز نامشخص بود.»
علاوه بر این، اجرای این مدل روی واریانتهای منفرد نیازمند منابع محاسباتی قابلتوجه و تخصص برنامهنویسی بود که مانعی برای ورود بسیاری از محققان بیماریهای نادر و آزمایشگاههای کوچکتر ایجاد میکرد.[2]
برای ساخت این اطلس، دیپمایند مدل آلفاژنوم را از پیش روی تمام ۹ میلیارد واریانت تکنوکلئوتیدی ممکن اجرا کرد و اثرات هر ۳ جابجایی حرفی ممکن در هر موقعیت را محاسبه کرد — برای مثال، تغییر یک A به T، C یا G. این پایگاه داده همچنین شامل پیشبینیهایی برای بیش از ۱۰۰ میلیون درج و حذف کوتاه است. این شرکت با محاسبه پیشاپیش کل میدان احتمالات، هزینه محاسباتی را از بودجه محققان فردی به زیرساختهای خود منتقل کرد.[3]
پیمایش در یک مجموعه داده ۱ پتابایتی از پیشبینیهای خام بیولوژیکی، چالش عملیاتی خاص خود را به همراه دارد. برای جلوگیری از غرق شدن محققان در دادهها، این اطلس ۱ معیار یکپارچه را معرفی میکند: امتیاز اثر واریانت آلفاژنوم (AVI). این عدد واحد، پیشبینیهای ۲ سیستم مجزا را خلاصه میکند — آلفاژنوم که نواحی غیرکدکننده را تحلیل میکند، و آلفامیسسنس (AlphaMissense) که مدل دیپمایند برای واریانتهای تغییردهنده پروتئین است.[2][3]
امتیاز AVI یک نقطه شروع رتبهبندیشده برای دانشمندانی که روی مجموعه دادههای بزرگ ژنتیکی کار میکنند، فراهم میآورد. تیمهای آزمایشگاهی به جای غربال کردن هزاران معیار پراکنده در میان صدها نوع سلول، میتوانند از این امتیاز برای اولویتبندی فوری امیدوارکنندهترین واریانتها جهت پیگیریهای آزمایشی استفاده کنند. این ابزار به گونهای طراحی شده است که به عنوان یک تولیدکننده فرضیه عمل کند و میدان احتمالات را پیش از آنکه تیمها زمان و سرمایه آزمایشگاهی خود را صرف کنند، محدود سازد.[2][3]
این اطلس هماکنون در تحقیقات فعال به کار گرفته شده است. در موسسه برود (Broad Institute)، دانشمندان از امتیاز AVI برای اولویتبندی واریانتها در پروندههای حلنشده بیماریهای نادر استفاده کردهاند. در یک مورد، این ابزار یک واریانت غیرکدکننده حیاتی در ژن DNM1 را برجسته کرد و پیشبینی نمود که این جهش، یک محل اتصال (splice site) نادرست مرتبط با صرع شدید ایجاد کرده است.[2]
دیپمایند اطلس آلفاژنوم را از طریق یک پورتال وب تعاملی، برای تحقیقات دانشگاهی غیرتجاری به صورت رایگان در دسترس قرار داده و نیاز به مهارتهای برنامهنویسی برای استعلام دادهها را از بین برده است. عرضه تجاری از طریق گوگل کلاد برای تاریخ بعدی برنامهریزی شده است؛ موضوعی که نشاندهنده یک تغییر بالقوه در نحوه درآمدزایی شرکتهای ارائهدهنده زیرساختهای ابری از هوش مصنوعی است — یعنی دریافت هزینه برای دسترسی به مجموعه دادههای علمی عظیم و از پیش محاسبهشده، به جای صرفاً مدلهای پایه.[2][3]
این انتشار، توالی تحقیقات ژنومیک را به طور بنیادین تغییر میدهد. چالش فوری برای رهبران علوم زیستی دیگر تولید فهرستی از فرضیهها در مقیاس ژنوم نیست، بلکه ایجاد فرآیندهای تکرارپذیر و با توان عملیاتی بالا برای تصمیمگیری درباره این است که کدام یک از این سرنخهای تولیدشده توسط هوش مصنوعی، شایسته اعتبارسنجی فیزیکی در آزمایشگاه هستند.[3]
بررسی عمیق دیدگاهها
زیستشناسان محاسباتی
بر ضرورت استفاده از هوش مصنوعی برای عبور از محدودیتهای فیزیکی آزمایشهای آزمایشگاهی در مقیاس ژنومیک تاکید دارند.
برای محققان محاسباتی، اطلس آلفاژنوم نشاندهنده یک تغییر ساختاری در نحوه طرح پرسشهای بیولوژیکی است. از آنجا که آزمایش فیزیکی ۹ میلیارد واریانت غیرممکن است، پیشبینی هوش مصنوعی تنها روش عملی برای نقشهبرداری از ۹۸ درصد ژنومی است که پروتئینها را کد نمیکند. دیپمایند با محاسبه پیشاپیش کل این مجموعه داده، گلوگاه محاسباتی را که پیشتر این نوع تحلیلها را به آزمایشگاههای دارای بودجه کلان محدود میکرد، از میان برداشته و دسترسی به تولید فرضیه در مقیاس ژنوم را دموکراتیک کرده است.
محققان علوم انتقالی
بر شکاف حیاتی میان یک پیشبینی مولکولی تولیدشده توسط هوش مصنوعی و یک یافته بالینی تاییدشده تمرکز میکنند.
محققان بالینی و انتقالی هشدار میدهند که یک اثر مولکولی پیشبینیشده به معنای تشخیص نیست. اگرچه امتیاز اثر واریانت آلفاژنوم یک مکانیسم تریاژ بسیار کارآمد ارائه میدهد، اما تنها تخمین میزند که چگونه یک واریانت ممکن است تولید پروتئین یا بیان ژن را تغییر دهد. این پیشبینیها همچنان باید از طریق آزمایشهای فیزیکی و دقیق آزمایشگاهی تایید شوند تا بتوانند در مراقبت از بیمار یا توسعه دارو مورد استفاده قرار گیرند. برای این گروه، اطلس مشکل یافتن نقطه شروع را حل میکند، اما کار دشوار اثبات بیولوژیکی همچنان بدون تغییر باقی میماند.
ارائهدهندگان زیرساخت ابری
مجموعه دادههای علمی از پیش محاسبهشده را به عنوان مدل جدیدی برای درآمدزایی از هوش مصنوعی در نظر میگیرند.
برای ارائهدهندگان زیرساختهای ابری بزرگ، این اطلس نشاندهنده گذار از فروش مدلهای هوش مصنوعی به فروش دسترسی به دادههایی است که آن مدلها تولید میکنند. گوگل با تقبل هزینه هنگفت اولیه پردازش برای اجرای آلفاژنوم روی کل ژنوم انسان، یک مجموعه داده اختصاصی ۱ پتابایتی ایجاد کرده است. در حالی که این ابزار در حال حاضر برای استفاده دانشگاهی رایگان است، عرضه تجاری برنامهریزیشده آن در گوگل کلاد، آیندهای را نوید میدهد که در آن ارائهدهندگان زیرساخت به جای اجاره دادن توان پردازشی خام، از میزبانی و استعلام حوزههای علمی از پیش محاسبهشده درآمدزایی میکنند.
نکات کلیدی
- گوگل دیپمایند اطلس آلفاژنوم را منتشر کرد؛ پایگاه دادهای که اثرات تمام ۹ میلیارد تغییر تکحرفی ممکن در دیانای را پیشبینی میکند.
- این مجموعه داده ۱ پتابایتی، اثر مولکولی جهشها را در هر دو ناحیه کدکننده و غیرکدکننده ژنوم انسان از پیش محاسبه میکند.
- امتیاز جدید «اثر واریانت آلفاژنوم» (AVI)، پیشبینیهای متعدد هوش مصنوعی را در یک معیار واحد خلاصه میکند تا به محققان در اولویتبندی واریانتها کمک کند.
- این اطلس در حال حاضر برای تحقیقات دانشگاهی غیرتجاری رایگان است و عرضه تجاری آن برای گوگل کلاد برنامهریزی شده است.
- زیستشناسان محاسباتی
- بر ضرورت استفاده از هوش مصنوعی برای عبور از محدودیتهای فیزیکی آزمایشهای آزمایشگاهی در مقیاس ژنومیک تاکید دارند.
- محققان علوم انتقالی
- بر شکاف حیاتی میان یک پیشبینی مولکولی تولیدشده توسط هوش مصنوعی و یک یافته بالینی تاییدشده تمرکز میکنند.
- ارائهدهندگان زیرساخت ابری
- مجموعه دادههای علمی از پیش محاسبهشده را به عنوان مدل جدیدی برای درآمدزایی از هوش مصنوعی در نظر میگیرند.
دیدگاههایی که این گزارش پوشش نداده
- متخصصان اخلاق زیستی نگران حریم خصوصی دادههای ژنتیکی
- آزمایشگاههای بالینی کوچکتر فاقد منابع اعتبارسنجی با توان عملیاتی بالا
منابع
[1]CurrentHuntمحققان علوم انتقالیGoogle DeepMind launched the AlphaGenome Atlas
مطالعه در CurrentHunt →
[2]Google Blogزیستشناسان محاسباتیAlphaGenome Atlas: a high-resolution map of human DNA
مطالعه در Google Blog →
[3]Google DeepMindزیستشناسان محاسباتیAlphaGenome Atlas: Molecular predictions for
مطالعه در Google DeepMind →
بیشتر در هوش مصنوعی
مشاهده همه →تقطیر دانش
چگونه انتقال لاجیت به یک مدل کوچک دانشآموز اجازه میدهد تا با عملکرد مدل بزرگ معلم برابری کند
8 منبع
زیرساخت هوش مصنوعی
چگونه کش KV مشکل تاخیر در مدلهای زبانی بزرگ را حل میکند
7 منبع
زیرساخت محاسباتی
چگونه «پیجاتنشن» حافظه جیپییو را برای حل گلوگاه زمینه (Context) در مدلهای زبان بزرگ تقسیمبندی میکند؟
3 منبع
بنچمارکهای هوش مصنوعی
مدل Nemotron-3-Ultra-CC انویدیا رکورد برترین امتیاز انسانی را در المپیاد بینالمللی کامپیوتر شکست
5 منبع
نظرات
هر زاویه. هر روز.
اخبار هوش مصنوعی با پوشش کامل منابع و تحلیل دیدگاهها، هر روز و رایگان.





