رفتن به محتوای اصلی
توضیح کوهستانشمول دیجیتالتحلیل و توضیح۷ شهریور ۱۴۰۵، ۲۱:۲۷· 6 دقیقه مطالعه· در فرهنگ

خطر «نامرئی شدن» زبان‌های بومی در داده‌های آموزشی هوش مصنوعی

در حالی که مدل‌های هوش مصنوعی به طور فزاینده‌ای به مجموعه‌داده‌های دیجیتال عظیم متکی هستند، هزاران زبان بومی با میلیون‌ها گویشور به صورت ساختاری از زیربنای اینترنت حذف می‌شوند. موج جدیدی از اشتراک‌گذاری داده‌ها و همکاری‌های فنی تحت رهبری جوامع محلی، قصد دارد این شکاف را پیش از آنکه این زبان‌ها برای نسل بعدی هوش مصنوعی برای همیشه نامرئی شوند، پر کند.

به قلم سروین قاسمی

حامیان حاکمیت داده‌های بومی 40%توسعه‌دهندگان زیرساخت دیجیتال 30%محققان هوش مصنوعی و زبان‌شناسان 30%
حامیان حاکمیت داده‌های بومی
استدلال می‌کنند که جوامع باید مالکیت و کنترل داده‌های زبانی خود را برای جلوگیری از سوءاستفاده هوش مصنوعی در دست داشته باشند.
توسعه‌دهندگان زیرساخت دیجیتال
بر ساخت استانداردهای فنی بنیادی مورد نیاز برای شمول جهانی زبان تمرکز دارند.
محققان هوش مصنوعی و زبان‌شناسان
به دنبال تکنیک‌های جدید یادگیری ماشینی برای آموزش مدل‌ها با مجموعه‌داده‌های بسیار محدود هستند.

نکات کلیدی

  1. تقریباً ۲۰۰۰ زبان که میلیون‌ها نفر به آنها صحبت می‌کنند، به صورت ساختاری از داده‌های آموزشی هوش مصنوعی حذف شده‌اند.
  2. بدون زیرساخت‌های دیجیتال بنیادی مانند پشتیبانی یونیکد، زبان‌ها نمی‌توانند پیکره‌های متنی مورد نیاز هوش مصنوعی را تولید کنند.
  3. مدل‌های هوش مصنوعی که با داده‌های ناکافی آموزش دیده‌اند، اغلب دستور زبان را «توهم» می‌کنند و اطلاعات نادرست درباره فرهنگ‌های بومی منتشر می‌سازند.
  4. یونسکو و یونیکد برای ساخت زیرساخت‌های دیجیتال عادلانه برای جوامع محروم دیجیتالی همکاری می‌کنند.
  5. رهبران بومی تأکید می‌کنند که دیجیتالی‌سازی زبان باید تحت رهبری جامعه باشد تا حاکمیت داده‌های فرهنگی حفظ شود.
  6. تکنیک‌های جدید هوش مصنوعی در حال توسعه هستند تا مدل‌ها را به جای جمع‌آوری عظیم وب، با حداقل مجموعه‌داده‌های قابل قبول آموزش دهند.

چرا مهم است

هوش مصنوعی به سرعت در حال تبدیل شدن به دروازه اصلی خدمات دیجیتال، آموزش و فرصت‌های اقتصادی است. اگر زبانی از مدل‌های هوش مصنوعی حذف شود، گویشوران آن مجبور می‌شوند برای مشارکت در اقتصاد مدرن، زبان مادری خود را کنار بگذارند، که این امر انقراض میراث فرهنگی جهانی را تسریع می‌کند.

هوش مصنوعی دارد به دروازه اصلی ورود به اینترنت تبدیل می‌شود؛ متون را ترجمه می‌کند، دانش را خلاصه می‌سازد و محتوا را با سرعتی بی‌سابقه تولید می‌کند. اما این دروازه بسیار باریک است. برای گویشوران هزاران زبان بومی، انقلاب هوش مصنوعی در یک جهان موازی در حال وقوع است؛ جهانی که نه می‌تواند کلمات آنها را بفهمد، نه خط آنها را بشناسد و نه دانش فرهنگی‌شان را پردازش کند. خطر صرفاً این نیست که این جوامع از ابزارهای صرفه‌جویی در زمان محروم می‌شوند؛ خطر این است که زبان‌هایشان به صورت ساختاری برای نسل بعدی زیرساخت‌های دیجیتال «نامرئی» شوند.[5]

مقیاس این حذف بسیار عظیم است. محققان تخمین می‌زنند که از ۷۶۱۳ زبان زنده جهان، تقریباً ۲۰۰۰ زبان را می‌توان به عنوان «غول‌های نامرئی» طبقه‌بندی کرد؛ زبان‌هایی که از حیات جمعیتی بالایی برخوردارند و میلیون‌ها گویشور دارند، اما حضور دیجیتالی آنها تقریباً صفر است. از آنجا که مدل‌های زبان بزرگ (LLM) با استفاده از متون موجود در اینترنت آموزش می‌بینند، این غیبت دیجیتال مستقیماً به حذف از هوش مصنوعی منجر می‌شود. اگر زبانی دیجیتالی نشود، یک ماشین نمی‌تواند آن را بیاموزد.[1]

این حذف، محصول جانبی طبیعی اندازه یک زبان نیست. بلکه بازتابی از شکاف‌های تاریخی و زیرساختی است. دهه‌ها، اینترنت بر این فرض ساخته شد که کاربران با مجموعه‌ای محدود از کاراکترهای لاتین و دامنه‌های استاندارد ارتباط برقرار خواهند کرد. وقتی زبانی در سطح زیرساخت‌های بنیادی غایب باشد—فاقد صفحه‌کلید استاندارد، غلط‌یاب املایی یا اسکریپت‌های ایمیل شناخته‌شده باشد—نمی‌تواند پیکره‌های متنی عظیمی را که هوش مصنوعی مدرن نیاز دارد، تولید کند.[1][5]

تقریباً ۲۰۰۰ زبان از حیات جمعیتی قوی برخوردارند اما برای مجموعه‌داده‌های آموزشی هوش مصنوعی نامرئی باقی می‌مانند.

پیامدهای این شکاف حیات-دیجیتالی عمیق است. وقتی سیستم‌های هوش مصنوعی مجبور می‌شوند به زبان‌هایی که به سختی می‌شناسند کار کنند، صرفاً با ظرافت شکست نمی‌خورند؛ بلکه دچار توهم می‌شوند. مدل‌های تجاری بزرگ سابقه مستندی در تولید متون نامفهوم، اختراع داستان‌های قبیله‌ای و انتشار اطلاعات نادرست درباره فرهنگ‌های بومی دارند، آن هم زمانی که به زبان‌های کم‌منبع پاسخ می‌دهند. برای جوامعی که برای احیای زبان‌های در معرض خطر خود می‌جنگند، این مواد جعلی می‌تواند فعالانه تلاش‌های آنها را تضعیف کند.[6]

علاوه بر این، این حذف چرخه‌ای از بی‌عدالتی معرفتی-دیجیتال ایجاد می‌کند. وقتی گویشوران نمی‌توانند به ابزارهای هوش مصنوعی دسترسی پیدا کنند، منابع آموزشی آنلاین بیابند یا در تجارت دیجیتال به زبان مادری خود مشارکت کنند، در موقعیت مصرف‌کنندگان منفعل محتوای تولید شده به زبان‌های غالب قرار می‌گیرند، نه خالقان فعال دانش. تنوع زبانی جهان عملاً در چند زبان پرمنبع خلاصه می‌شود.[1]

اما یک تلاش جهانی برای معکوس کردن این روند در جریان است. سازمان‌های بین‌المللی و جوامع بومی با درک این موضوع که شمول زبانی نمی‌تواند یک افزودنی دیرهنگام باشد، بسیج شده‌اند تا زیرساخت‌های لازم را از پایه بسازند. سازمان ملل متحد سال‌های ۲۰۲۲ تا ۲۰۳۲ را «دهه بین‌المللی زبان‌های بومی» اعلام کرده است، که چارچوبی برای تسریع حفظ و دسترسی عادلانه به کالاهای عمومی دیجیتال فراهم می‌کند.[2][5]

سازمان‌های بین‌المللی و جوامع بومی با درک این موضوع که شمول زبانی نمی‌تواند یک افزودنی دیرهنگام باشد، بسیج شده‌اند تا زیرساخت‌های لازم را از پایه بسازند.

در سطح زیرساخت، یونسکو با کنسرسیوم یونیکد (Unicode Consortium) همکاری کرده است تا اطمینان حاصل کند که جوامع محروم دیجیتالی می‌توانند به محیط‌های دیجیتال به زبان خود دسترسی داشته باشند. یونیکد، که استانداردهای باز برای بین‌المللی‌سازی نرم‌افزار را توسعه می‌دهد، برای این تلاش حیاتی است. این همکاری با تضمین اینکه سیستم‌های نوشتاری زبان‌های جهان به درستی در دستگاه‌ها نمایش داده شوند، زمینه را برای شمول آتی در هوش مصنوعی فراهم می‌کند.[2][4]

سیاست‌های سطح دولتی برای شمول زبانی در هوش مصنوعی همچنان به شدت به نفع زبان‌های رسمی ملی است.

با این حال، صرفاً دیجیتالی کردن یک زبان کافی نیست؛ این فرآیند باید توسط خود جوامع مدیریت شود. رهبران و محققان بومی تأکید می‌کنند که بهبود ترجمه و بازنمایی هوش مصنوعی بدون مشارکت کامل مردم بومی قابل حل نیست—اصلی که با شعار «هیچ چیز برای ما بدون ما» (Nothing For Us Without Us) همخوانی دارد.[3]

اعتماد و حاکمیت داده‌ها در این میان اهمیت فوق‌العاده‌ای دارند. از آنجا که قبایل مختلف سنت‌های فرهنگی متمایزی دارند، آموزش مدل‌های هوش مصنوعی بر اساس مواد بومی—به ویژه داستان‌های اجدادی و افسانه‌ها—در صورت عدم مدیریت دقیق، می‌تواند به پیامدهای ناخواسته‌ای منجر شود. به عنوان مثال، برخی داستان‌ها به طور سنتی فقط باید در فصول خاص یا برای مخاطبان خاصی روایت شوند. مدل‌های هوش مصنوعی، فاقد ظرافت‌های فرهنگی، اگر این اطلاعات حساس را بدون تمایز از وب جمع‌آوری کنند، به راحتی می‌توانند آن را نادرست مدیریت کنند.[6]

برای رسیدگی به این موضوع، ابتکارات جدید بر جمع‌آوری داده‌ها با رهبری جامعه متمرکز شده‌اند. شرکت‌کنندگان در اجلاس‌های اخیر یونسکو تأکید کرده‌اند که فناوری‌های جدید زبان بومی باید با محتوای مبتنی بر رضایت، بازخورد مثبت از گویشوران، و حداقل مجموعه‌داده‌های قابل قبول (minimum viable datasets) توسعه یابند. این رویکرد به جوامع قدرت می‌دهد تا ابزارهای خود را بسازند و مدیریت کنند و در عین حال یکپارچگی فرهنگی خود را حفظ نمایند.[3]

یکی از این ابتکارات، «مرکز رشد اشتراک‌گذاری داده‌های زبان بومی» (Indigenous Language Data Commons Incubator) است که توسط یونسکو با همکاری شرکای دانشگاهی و بخش خصوصی راه‌اندازی شده است. این برنامه از تیم‌های تحت رهبری بومیان در توسعه پروژه‌هایی حمایت می‌کند که حاکمیت داده‌ها و مدیریت جامعه بر داده‌های زبانی را تقویت می‌کنند. این مرکز رشد با تضمین اینکه جوامع خود مدیریت منابعشان را بر عهده بگیرند، قصد دارد آینده‌ای را خلق کند که در آن هوش مصنوعی به تنوع زبانی احترام بگذارد و از آن محافظت کند.[6]

زیرساخت‌های بنیادی، مانند طرح‌بندی صفحه‌کلید و پشتیبانی یونیکد، پیش‌نیاز شمول در هوش مصنوعی هستند.

نوآوری‌های فنی نیز به پر کردن شکاف داده‌ها کمک می‌کنند. دانشمندان کامپیوتر که با زبان‌های «بدون منبع» کار می‌کنند، رویکردهای جدیدی را توسعه می‌دهند که نیازی به میلیون‌ها جفت جمله موازی ندارند. این محققان به جای تکیه بر جمع‌آوری داده‌ها با زور و حجم بالا، ابزارهایی را برنامه‌نویسی می‌کنند که به صراحت قوانین گرامری و واژگان یک زبان خاص را به مدل‌های زبان بزرگ آموزش می‌دهند و به هوش مصنوعی اجازه می‌دهند تا از مجموعه‌داده‌های بسیار کوچک‌تر و با دقت تنظیم‌شده، ترجمه‌های دقیقی تولید کند.[6]

اهمیت این کار بسیار فراتر از حفظ واژگان است. زبان، ظرفی برای خرد فرهنگی منحصر به فرد، دانش سنتی و جهان‌بینی‌های متمایز است. وقتی زبانی با شرایط خود گویشورانش وارد قلمرو دیجیتال می‌شود، نه تنها زنده می‌ماند، بلکه شکوفا می‌شود و نسل‌های جوان‌تر را تشویق می‌کند تا آن را در زندگی روزمره دیجیتال خود بیاموزند و به کار ببرند.[6]

در نهایت، هوش مصنوعی دارای یک ظرفیت دوگانه است. می‌تواند کارآمدترین موتور حذف زبانی باشد که جهان تاکنون دیده است و نابرابری‌های تاریخی را در مقیاس جهانی رمزگذاری و تقویت کند. یا، اگر با چارچوب‌های اخلاقی و زیرساخت‌های فراگیر هدایت شود، می‌تواند به نیرویی قدرتمند برای احیای فرهنگی تبدیل شود. تصمیماتی که امروز در مورد مجموعه‌داده‌ها، استانداردها و استقلال جامعه گرفته می‌شود، تعیین خواهد کرد که این فناوری کدام مسیر را طی کند.[5]

بررسی عمیق دیدگاه‌ها

حامیان حاکمیت داده‌های بومی

استدلال می‌کنند که جوامع باید مالکیت و کنترل داده‌های زبانی خود را برای جلوگیری از سوءاستفاده هوش مصنوعی در دست داشته باشند.

این دیدگاه تأکید می‌کند که زبان صرفاً یک ابزار ارتباطی نیست، بلکه مخزنی از دانش مقدس و فرهنگی است. حامیان استدلال می‌کنند که جمع‌آوری زبان‌های بومی از اینترنت برای آموزش مدل‌های تجاری هوش مصنوعی بدون رضایت، نوعی استعمار دیجیتال است. آنها «حاکمیت داده‌ها» را در اولویت قرار می‌دهند و اصرار دارند که جوامع باید حق مدیریت نحوه دیجیتالی شدن زبان‌هایشان، دسترسی به مجموعه‌داده‌ها و نحوه به‌کارگیری ابزارهای هوش مصنوعی حاصله را داشته باشند. از نظر این حامیان، هوش مصنوعی اخلاقی مستلزم اجازه صریح و توسعه تحت رهبری جامعه است، حتی اگر سرعت مقیاس‌پذیری فناوری را کاهش دهد.

توسعه‌دهندگان زیرساخت دیجیتال

بر ساخت استانداردهای فنی بنیادی مورد نیاز برای شمول جهانی زبان تمرکز دارند.

متخصصان فناوری و سازمان‌های استاندارد مانند یونیکد، این چالش را عمدتاً از منظر زیرساختی می‌بینند. آنها استدلال می‌کنند که قبل از اینکه هوش مصنوعی بتواند یک زبان را به درستی پردازش کند، لوله‌کشی اساسی اینترنت—صفحه‌کلیدها، رمزگذاری کاراکتر و شناسایی نام دامنه—باید برای پشتیبانی از خطوط غیرلاتین به‌روزرسانی شود. این گروه بر «پذیرش جهانی» تمرکز دارد، اصلی که بیان می‌کند همه نام‌های دامنه و آدرس‌های ایمیل معتبر باید به طور یکسان در سراسر اینترنت کار کنند. آنها معتقدند که اصلاح این لایه‌های بنیادی پیش‌نیاز هرگونه شمول معنادار در هوش مصنوعی است، زیرا مدل‌ها نمی‌توانند آنچه را که زیرساخت قادر به نمایش آن نیست، بیاموزند.

محققان هوش مصنوعی و زبان‌شناسان

به دنبال تکنیک‌های جدید یادگیری ماشینی برای آموزش مدل‌ها با مجموعه‌داده‌های بسیار محدود هستند.

محققان دانشگاهی و زبان‌شناسان محاسباتی بر غلبه بر محدودیت‌های فنی زبان‌های «کم‌منبع» متمرکز هستند. با درک اینکه اکثر زبان‌های جهان هرگز پیکره‌های متنی عظیمی را که برای انگلیسی یا اسپانیایی در دسترس است، تولید نخواهند کرد، این گروه در حال پیشگامی در معماری‌های جدید هوش مصنوعی است. آنها به جای تکیه بر جمع‌آوری داده‌ها با زور و حجم بالا، مدل‌هایی را توسعه می‌دهند که می‌توانند قوانین گرامری و واژگان را به صراحت توسط کارشناسان انسانی آموزش ببینند. هدف آنها دستیابی به ترجمه و تولید متن با دقت بالا با استفاده از حداقل مجموعه‌داده‌های قابل قبول است، که ثابت می‌کند هوش مصنوعی می‌تواند با کمبود زبانی سازگار شود، نه اینکه تقاضای داده‌های بی‌پایان داشته باشد.

پرسش‌های متداول

چه چیزی یک زبان را به «غول نامرئی» تبدیل می‌کند؟

«غول نامرئی» زبانی است که سطح بالایی از حیات جمعیتی دارد—اغلب میلیون‌ها نفر به آن صحبت می‌کنند—اما حضور دیجیتالی یا بازنمایی آن در داده‌های آموزشی هوش مصنوعی تقریباً صفر است.

چرا مدل‌های هوش مصنوعی نمی‌توانند به سادگی زبان‌های بومی را از اینترنت یاد بگیرند؟

بسیاری از زبان‌های بومی فاقد زیرساخت‌های دیجیتال بنیادی، مانند صفحه‌کلیدهای استاندارد یا پشتیبانی یونیکد، هستند که برای تولید حجم عظیمی از متون آنلاین مورد نیاز مدل‌های هوش مصنوعی برای آموزش، لازم است.

حاکمیت داده‌های بومی چیست؟

این اصلی است که جوامع بومی حق دارند داده‌های فرهنگی و زبانی خود را مالک، کنترل و مدیریت کنند و اطمینان حاصل شود که توسط شرکت‌های فناوری خارجی مورد سوءاستفاده یا تحریف قرار نمی‌گیرد.

محققان چگونه هوش مصنوعی را بدون مجموعه‌داده‌های عظیم آموزش می‌دهند؟

دانشمندان کامپیوتر رویکردهای جدیدی را توسعه می‌دهند که به صراحت قوانین گرامری و واژگان یک زبان را به مدل‌های هوش مصنوعی آموزش می‌دهند و به سیستم اجازه می‌دهند تا از مجموعه‌داده‌های بسیار کوچک‌تر و تنظیم‌شده توسط جامعه، به دقت یاد بگیرد.

منابع

پوشش منابع

6 منبع

3 دیدگاه شناسایی‌شده

حامیان حاکمیت داده‌های بومی 40%توسعه‌دهندگان زیرساخت دیجیتال 30%محققان هوش مصنوعی و زبان‌شناسان 30%
  1. [1]arXivمحققان هوش مصنوعی و زبان‌شناسان

    Invisible Languages of the LLM Universe

    مطالعه در arXiv
  2. [2]UNESCOحامیان حاکمیت داده‌های بومی

    UNESCO and Unicode strengthen collaboration for Indigenous languages online

    مطالعه در UNESCO
  3. [3]UNESCOحامیان حاکمیت داده‌های بومی

    Trust in Indigenous Translation: UNESCO and Translation Commons Celebrate International Translation Day

    مطالعه در UNESCO
  4. [4]American Translators Associationتوسعه‌دهندگان زیرساخت دیجیتال

    UNESCO and Unicode Strengthen Collaboration for Indigenous Languages Online

    مطالعه در American Translators Association
  5. [5]CircleIDتوسعه‌دهندگان زیرساخت دیجیتال

    If a language is absent at the infrastructure level, it becomes invisible to AI

    مطالعه در CircleID
  6. [6]تیم سردبیری کوهستانحامیان حاکمیت داده‌های بومی

    تحلیل تیم سردبیری کوهستان

    مطالعه در تیم سردبیری کوهستان

نظرات

همیشه در جریان باشید

هر زاویه. هر روز.

دریافت فرهنگ اخبار همراه با پوشش کامل منابع و تحلیل دیدگاه‌ها، مستقیم در صندوق ورودی شما.