
Claude در هر مکالمه یکسان رفتار نمیکند. طبق تحقیقات جدیدی که دوشنبه منتشر شد، غول هوش مصنوعی Anthropic دریافت که دستیار آن به طور مداوم ارزشهای متفاوتی را بسته به مدل انتخابی کاربران و زبانی که صحبت میکنند، ابراز میکند.
در گزارشی که دوشنبه منتشر شد، محققان Anthropic ۳۰۹,۸۱۵ مکالمه ناشناس کاربران با Claude را که شامل وظایف ذهنی مانند ارائه مشاوره یا بازخورد بود، تحلیل کردند. این شرکت گفت که بیش از ۳,۳۰۰ ارزش شناسایی شده را به چهار بعد رفتاری—احترام در مقابل احتیاط، صمیمیت در مقابل دقت، عمق در مقابل ایجاز، و صراحت در مقابل اجرا—تقطیر کرده است که نحوه تفاوت پاسخهای Claude در هر مکالمه را توصیف میکند.
محققان نوشتند: «برای اطمینان از اینکه ما ارزشهای ابراز شده توسط Claude را اندازهگیری کردیم—و نه تفاوتها در آنچه کاربران میپرسیدند یا چگونه میپرسیدند—ما وظیفه، موضوع و ارزشهای ابراز شده توسط کاربر در هر مکالمه را کنترل کردیم.»
به گفته Anthropic، هر مدل Claude یک نمایه رفتاری متمایز از خود نشان داد.
Sonnet 4.6 بر صمیمیت، احترام و ایجاز تأکید داشت و اغلب کاربران را تأیید میکرد و با شوخطبعی یا تشویق پاسخ میداد. در همین حال، Opus 4.7 بر دقت، احتیاط، صراحت و عمق تأکید داشت و بیشتر فرضیات را به چالش میکشید، استدلال خود را توضیح میداد، خطرات را شناسایی میکرد و محدودیتهای خود را میپذیرفت. Opus 4.6 به طور کلی رویکردی فشردهتر و متمرکز بر اجرا داشت، در حالی که تأکید بیشتری بر دقت نسبت به Sonnet میکرد.
محققان نوشتند: «این یافتهها با نحوه درک مردم از این مدلها، هم در Anthropic و هم به صورت آنلاین، مطابقت دارد. کاربران Claude.ai اظهار داشتهاند که Opus 4.7 اغلب بیشتر از سایر مدلها پاسخهای خود را با احتیاط بیان میکند.»
به گفته Anthropic، رفتار Claude بر اساس زبان نیز متفاوت بود.
پاسخهای عربی بیشتر متمایل به احترام بودند، در حالی که پاسخهای انگلیسی تأکید بیشتری بر احتیاط داشتند. Claude در هندی و عربی صمیمیترین بود و از زبان مؤدبانهتر، بازیگوشانهتر و تشویقکنندهتری استفاده میکرد. در همین حال، پاسخهای انگلیسی و روسی دقیقتر بودند و مکرراً فرضیات را به چالش میکشیدند، جزئیات را تصحیح میکردند و درخواست شواهد میکردند.
پاسخهای انگلیسی نیز تمایل به ارائه توضیحات مفصلتر داشتند، در حالی که پاسخهای عربی عموماً موجزتر بودند. پاسخهای هلندی صریحترین بودند و به راحتی عدم قطعیت و اشتباهات را میپذیرفتند، در حالی که پاسخهای اندونزیایی بیشتر بر تکمیل درخواست کاربر تمرکز داشتند.
Anthropic گفت که این تحقیق به معنای آن نیست که Claude خود دارای ارزشهایی است. این شرکت اظهار داشت که هنوز نمیداند چه چیزی باعث این تفاوتها میشود—یا اینکه آیا آنها مطلوب هستند—اما معتقد است که این چارچوب میتواند به ارزیابی مدلهای آینده و شناسایی تغییرات رفتاری ناخواسته کمک کند.
این مطالعه جدیدترین مورد در مجموعهای از مطالعات Anthropic است که رفتار درونی Claude را بررسی میکنند.
در اکتبر، این شرکت گزارش داد که مدلهایش نشانههای اولیهای از آنچه آن را «خودآگاهی عملکردی درونی» نامید، از خود نشان دادند که به آنها امکان میدهد جنبههایی از پردازش داخلی خود را تشخیص داده و توصیف کنند. در آوریل، Anthropic تحقیقاتی را منتشر کرد که «بردارهای احساسی» داخلی را که بر رفتار Claude تأثیر میگذارند، شناسایی کرد، در حالی که تأکید داشت اینها شواهدی از احساسات یا هوشیاری نیستند.