
طراحی یک مولکول از پایه یکی از دشوارترین مسائل در شیمی است. این فقط مربوط به دانستن اینکه کدام اتمها را به هم وصل کنیم نیست – بلکه مربوط به دانستن ترتیب صحیح واکنشها، زمان محافظت از قسمتهای حساس مولکول، و چگونگی اجتناب از بنبستهایی است که میتوانند ماهها کار آزمایشگاهی را به هدر دهند.
به طور سنتی، این دانش در ذهن شیمیدانان باتجربه قرار دارد. اکنون، تیمی در EPFL میخواهد آن را در یک مدل زبان (language model) بگنجاند.
محققان به رهبری فیلیپ شوالر، این هفته مقالهای در Matter منتشر کردند که Synthegy را توصیف میکند؛ چارچوبی که از مدلهای زبان بزرگ (LLM) به عنوان موتورهای استدلال برای برنامهریزی سنتز شیمیایی استفاده میکند. بینش اصلی ظریف اما مهم است: به جای اینکه از هوش مصنوعی بخواهیم مولکول تولید کند، تیم از هوش مصنوعی برای ارزیابی مسیرهای سنتز که نرمافزارهای سنتی قبلاً تولید کردهاند، استفاده میکند.
این روش به این صورت عمل میکند: یک شیمیدان هدفی را به زبان ساده تایپ میکند، چیزی شبیه به "حلقه پیریمیدین را در مراحل اولیه تشکیل دهید." نرمافزار رتروسنتز موجود – که با تجزیه مولکولهای هدف به قطعات سادهتر کار میکند – سپس دهها یا صدها مسیر سنتز ممکن را تولید میکند.
سنتگی هر مسیر را به متن تبدیل کرده و به یک LLM میدهد که هر مسیر را بر اساس میزان مطابقت با دستورالعمل شیمیدان امتیازدهی میکند. بهترین مسیرها به بالا میآیند، همراه با توضیحات مکتوب درباره علت برتریشان.
آندرس ام. بران، نویسنده اصلی این مطالعه، در بیانیهای از EPFL گفت: "هنگام ساخت ابزارهایی برای شیمیدانان، رابط کاربری اهمیت زیادی دارد و ابزارهای قبلی به فیلترها و قوانین دستوپاگیر متکی بودند."
این سیستم در یک مطالعه دو سوکور با مشارکت 36 شیمیدان مستقل که 368 جفت مسیر را بررسی کردند، اعتبارسنجی شد. انتخابهای آنها در 71.2% موارد با Synthegy مطابقت داشت، رقمی که تقریباً با میزان توافق شیمیدانان متخصص با یکدیگر همخوانی دارد. محققان ارشد (اساتید و دانشمندان پژوهشی) بیشتر از دانشجویان دکترا با Synthegy موافق بودند که نشان میدهد این سیستم همان شهودهای استراتژیک ناشی از تجربه را به تصویر میکشد.
محققان چندین مدل هوش مصنوعی از جمله GPT-4o، Claude و DeepSeek-r1 را آزمایش کردند. هوش مصنوعی سالهاست که در کشف دارو پیشرفتهایی داشته است، اما اکثر رویکردها بر مدلهای آموزشدیده محدود برای وظایف خاص تمرکز دارند. Synthegy به گونهای طراحی شده است که ماژولار باشد – میتواند به هر موتور رتروسنتز در بکاند، و به هر LLM توانمندی در بخش استدلال متصل شود. Gemini-2.5-pro بالاترین امتیاز را در این معیار کسب کرد، در حالی که DeepSeek-r1 به نظر میرسد یک جایگزین متنباز قوی است که میتواند به صورت محلی اجرا شود.
این چارچوب مشکل دومی را نیز حل میکند: توضیح مکانیسم واکنش. این سوال این است که چرا یک واکنش شیمیایی رخ میدهد – چه حرکتهای الکترونی در هر مرحله صورت میگیرد. Synthegy واکنشها را به حرکتهای ابتدایی تجزیه میکند و از LLM میخواهد تا هر مرحله کاندید را از نظر معقول بودن شیمیایی ارزیابی کند. در واکنشهای سادهای مانند جانشینیهای هستهدوست، بهترین مدلها به دقت تقریباً بینقص دست یافتند.
موارد استفاده بالقوه گسترده هستند. کشف دارو آشکارترین مورد است. هوش مصنوعی قبلاً در پیشبینی نتایج درمان سرطان امیدبخش بوده است، اما همین رویکرد در هر جایی که شیمیدانان نیاز به طراحی مواد جدید یا بهینهسازی واکنشهای صنعتی دارند، قابل استفاده است. یک جزئیات عملی: ارزیابی 60 مسیر کاندید با Synthegy تقریباً 12 دقیقه طول میکشد و حدود 2 تا 3 دلار هزینه API دارد.
این مقاله محدودیتهای کنونی را تأیید میکند. LLMها گاهی اوقات جهت واکنش را در نمایش متنی آن اشتباه میخوانند که منجر به فراخوانیهای نادرست امکانپذیری میشود. مدلهای کوچکتر عملکردی بهتر از حدس زدن تصادفی ندارند. ردیابی مسیرهایی با بیش از 20 مرحله به صورت منسجم دشوارتر است.
کد و معیارهای عملکرد به صورت عمومی در github.com/schwallergroup/steer در دسترس هستند.