هوش مصنوعی گران است و احتمالاً تا حالا متوجه این موضوع شدهاید. اشتراکی که زمانی تقریباً همه امکانات موردنیاز را در اختیار شما میگذاشت، حالا مدلهای قدرتمندتر را پشت پلنهای گرانتر قرار داده است. محدودیتها نیز بسیار سختگیرانهتر شدهاند و قابلیتهایی که واقعاً به آنها نیاز دارید، مدام در بخشهای گرانتر صفحه قیمتگذاری قرار میگیرند.
بخش زیادی از این وضعیت به هزینه پردازش و افزایش تقاضا برای توان محاسباتی مربوط میشود، اما همهچیز خارج از کنترل شما نیست. نحوه استفاده از ابزارهای هوش مصنوعی نیز روی هزینه پردازش، سرعت رسیدن به محدودیتها و حتی کیفیت پاسخها تأثیر میگذارد.
خوشبختانه راهحل سادهتر از چیزی است که تصور میکنید؛ فقط باید بدانید هر بار که دکمه ارسال را میزنید، پشت صحنه چه اتفاقی رخ میدهد.
مدل واقعاً حافظهای از گفتوگو ندارد
همهچیز را دوباره میخواند
یکی از نکاتی که بسیاری از کاربران درباره Claude و ChatGPT و Gemini و سایر چتباتها نمیدانند این است که خود مدل، حافظهای به معنای معمول آن ندارد.
البته بسیاری از دستیارهای هوش مصنوعی امروزی قابلیتهایی مانند حافظه پایدار، خلاصهسازی مکالمات و جستوجو در گفتوگوهای قبلی دارند. با این حال، این قابلیتها به این معنا نیستند که خود مدل زبانی تمام گفتوگوهای قبلی را به خاطر میسپارد.
در سطح مدل زبانی، هر بار که پیام جدیدی ارسال میکنید، مدل باید اطلاعات لازم برای پاسخگویی را از زمینهای که در اختیارش قرار گرفته دریافت کند. به همین دلیل است که گفتوگو برای شما پیوسته به نظر میرسد، اما این پیوستگی الزاماً نتیجه حافظه واقعی مدل نیست.
بخش بزرگی از این فرایند به چیزی به نام پنجره زمینه یا Context Window مربوط میشود. آنتروپیک این مفهوم را نوعی «حافظه کاری» مدل توصیف میکند؛ یعنی مجموعه متنی که مدل هنگام تولید پاسخ میتواند به آن دسترسی داشته باشد.
بنابراین، وقتی پیام جدیدی ارسال میکنید، بخشهای قبلی گفتوگو نیز میتوانند در زمینه مورد استفاده مدل قرار بگیرند تا پاسخ جدید بر اساس سابقه مکالمه تولید شود.
هر پیام جدید میتواند هزینه بیشتری داشته باشد
مسئله فقط تعداد پیامها نیست؛ تعداد توکنها هم مهم است
آنتروپیک در مستندات خود توضیح میدهد که با ادامه پیدا کردن یک گفتوگو، پیامهای کاربر و پاسخهای دستیار در پنجره زمینه جمع میشوند. بنابراین هرچه مکالمه طولانیتر شود، اطلاعات بیشتری ممکن است همراه درخواست جدید ارسال شود.
موضوع فقط پیامهای شما نیست. محتوای موجود در زمینه میتواند شامل دستورهای سیستمی، پیامهای قبلی، نتایج ابزارها، تصاویر، اسناد و سایر اطلاعاتی باشد که در طول مکالمه در اختیار مدل قرار گرفتهاند.
برای درک بهتر موضوع، یک گفتوگوی طولانی را تصور کنید که در آن صد پیام ردوبدل شده است. پیام صدم دیگر فقط یک پرسش مستقل نیست؛ بلکه میتواند در بستری از پیامهای قبلی، پاسخهای مدل و سایر اطلاعات موجود در همان گفتوگو پردازش شود.
هرچه این زمینه بزرگتر شود، مقدار اطلاعاتی که مدل باید هنگام تولید پاسخ در نظر بگیرد نیز افزایش پیدا میکند.
البته نحوه مدیریت زمینه در سرویسهای مختلف یکسان نیست و برخی سیستمها از روشهایی مانند فشردهسازی یا خلاصهسازی زمینه برای مدیریت گفتوگوهای طولانی استفاده میکنند. بنابراین نباید تصور کرد که در همه سرویسها دقیقاً تمام محتوای قبلی بدون هیچ پردازشی دوباره ارسال میشود.
این وضعیت چه هزینهای برای شما دارد؟
هم سرعت و هم کیفیت پاسخ ممکن است تحت تأثیر قرار بگیرد
در نهایت، طولانیتر شدن زمینه میتواند از دو جهت برای کاربر هزینه داشته باشد. اولین مورد، مصرف بیشتر توکنها است. اگر از یک API استفاده میکنید و هزینه بر اساس میزان مصرف محاسبه میشود، ارسال زمینههای طولانی میتواند به افزایش هزینه منجر شود. هرچه اطلاعات بیشتری در هر درخواست پردازش شود، مقدار توکن مصرفی نیز میتواند افزایش پیدا کند.
در سرویسهای اشتراکی نیز ممکن است مکالمات طولانیتر و درخواستهای سنگینتر سریعتر به محدودیتهای مصرف نزدیک شوند؛ البته میزان تأثیر آن به نحوه محاسبه محدودیتها توسط هر سرویس بستگی دارد.
اما هزینه دوم شاید مهمتر باشد: افزایش زمینه همیشه به معنای پاسخ بهتر نیست.
طبیعی است تصور کنید هرچه اطلاعات بیشتری در اختیار مدل قرار دهید، پاسخ دقیقتر خواهد شد. این موضوع تا حدی درست است، اما پس از یک نقطه، حجم زیاد اطلاعات میتواند پیدا کردن اطلاعات مهم را برای مدل دشوارتر کند.
آنتروپیک برای این پدیده از اصطلاح Context Rot استفاده میکند. با افزایش تعداد توکنها، توانایی مدل برای بازیابی و استفاده دقیق از اطلاعات موجود در زمینه ممکن است کاهش پیدا کند.
در چنین شرایطی، سؤال اصلی شما یا یک دستور مهم ممکن است میان دهها پیام دیگر گم شود.
راهحل؛ اطلاعات مهم را از همان ابتدا ارائه کنید
گفتوگوی قطرهای میتواند نتیجه بدتری داشته باشد
دلیل بررسی این فرایند این است که وقتی سازوکار زمینه را بهتر درک کنید، راهحل نیز سادهتر میشود: اطلاعات موردنیاز را تا حد امکان از همان پیام اول ارائه کنید.
به جای اینکه درخواست خود را در چندین پیام پراکنده مطرح کنید، بهتر است تا جایی که امکان دارد زمینه، محدودیتها، نمونهها و قالب خروجی موردنظر را در همان پیام نخست مشخص کنید.
به عنوان مثال، به جای اینکه ابتدا فقط یک سؤال کلی بپرسید و بعد در پیامهای بعدی جزئیات بیشتری اضافه کنید، میتوانید از همان ابتدا هدف، اطلاعات زمینهای، محدودیتها، نمونه موردنظر و شکل پاسخ را توضیح دهید.
این کار از هر دو جهت مفید است.
از نظر کیفیت پاسخ، یک درخواست منظم باعث میشود اطلاعات مهم از ابتدا در اختیار مدل قرار داشته باشد و نیازی نباشد مدل هدف واقعی شما را از میان دهها پیام پراکنده بازسازی کند.
در واقع، به جای اینکه مدل مجبور باشد از دل یک گفتوگوی طولانی متوجه شود دقیقاً چه میخواهید، یک دستورالعمل کامل و منسجم دریافت میکند.
از نظر مصرف نیز مزیت اصلی این است که ممکن است بتوانید کار موردنظر را در تعداد پیامهای بسیار کمتری به پایان برسانید.
یک درخواست بزرگ اولیه لزوماً سبکتر از چند پیام کوتاه نیست. حتی ممکن است همان پیام اول توکن بیشتری داشته باشد. مزیت در اینجاست که اگر همان پیام باعث شود پاسخ مناسب را سریعتر دریافت کنید، دیگر مجبور نیستید چندین مرحله سؤال، اصلاح، توضیح و تصحیح انجام دهید.
فرض کنید برای انجام یک کار به ده رفتوبرگشت نیاز دارید، در حالی که میتوانستید تمام نیازمندیها را در یک یا دو پیام مشخص کنید. کاهش تعداد رفتوبرگشتها میتواند مقدار زمینهای را که در طول کل فرایند پردازش میشود نیز کاهش دهد.
گفتوگوهای طولانی را بیدلیل ادامه ندهید
اگر یک مکالمه از موضوع اصلی فاصله گرفته، پر از اصلاحات و اطلاعات قدیمی شده یا دیگر پاسخهای مطلوبی دریافت نمیکنید، شروع یک گفتوگوی جدید میتواند انتخاب بهتری باشد.
در گفتوگوی جدید، میتوانید فقط اطلاعاتی را که واقعاً برای انجام کار ضروری هستند وارد کنید. این کار باعث میشود زمینه مکالمه تمیزتر و متمرکزتر باشد و اطلاعات غیرضروری کمتری در اختیار مدل قرار گیرد.
البته این به معنای آن نیست که باید برای هر پرسش یک گفتوگوی کاملاً جدید ایجاد کنید. اگر سابقه مکالمه برای کار فعلی مهم است، حفظ همان گفتوگو منطقی است. هدف این است که از ادامه دادن بیدلیل یک مکالمه بسیار طولانی و انباشته از اطلاعات نامرتبط جلوگیری کنید.
ترفند سادهای که ارزش امتحان کردن دارد
اگر احساس میکنید محدودیتهای Claude زودتر از چیزی که انتظار دارید تمام میشوند یا کیفیت پاسخها در مکالمات بسیار طولانی افت میکند، شاید بخشی از مشکل به شیوه تعامل شما با مدل مربوط باشد.
سعی کنید درخواستهای مهم را از همان ابتدا کامل و ساختاریافته مطرح کنید. زمینه، محدودیتها، نمونهها و قالب خروجی موردنظر را در ابتدای کار مشخص کنید.
در عین حال، وقتی یک گفتوگو دیگر اطلاعات مفیدی برای کار فعلی ندارد، از ادامه دادن آن خودداری کنید و یک گفتوگوی جدید بسازید.
هوش مصنوعی ممکن است گران باشد، اما لازم نیست با مدیریت نامناسب گفتوگو، هزینه یا مصرف آن را بیشتر از چیزی کنید که برای انجام کار واقعاً لازم است.
اینتوتک



