صفحه اصلیمرکز اخبار LBank
به ظاهر ساده‌ترین پرامپت هوش مصنوعی، از ماه‌ها مهندسی دقیق پرامپت در طراحی بازی پیشی گرفت
dumbest-ai-prompt-claude-beat-careful-game-design
به ظاهر ساده‌ترین پرامپت هوش مصنوعی، از ماه‌ها مهندسی دقیق پرامپت در طراحی بازی پیشی گرفت
توسعه‌دهنده به Claude Opus 5 گفت که "کاملاً بی‌نقص" باشد و بقیه کار را به مدل سپرد—نتایج، برای یک مدل هوش مصنوعی، کاملاً بی‌نقص از آب درآمد.
2026-07-28 منبع:decrypt.co

به طور خلاصه

  • Claude Opus 5 یک بازی تیراندازی اول شخص را تنها با یک فرمان ساده و نتایج بسیار چشمگیر "یک‌جا ساخت" که مردم در باور آن تردید دارند.
  • دیگران نیز این فرمان را دوباره اجرا کرده‌اند و نتایج تأیید شده است.
  • مت شومر، سازنده بازی با کمک Claude، این روش را حلقه گانتلت (Gauntlet Loop) می‌نامد: به یک عامل یک معیار واقعی برای رسیدن به آن بدهید، کار را بین منتقدان تازه تقسیم کنید و هرگز اجازه ندهید سازنده کار خودش را ارزیابی کند.

تنها دو روز پس از عرضه Claude Opus 5، مت شومر، سرمایه‌گذار هوش مصنوعی و مدیرعامل سابق HyperWrite، ویدیویی از یک بازی تیراندازی اول شخص کاملاً قابل بازی را منتشر کرد که این مدل تماماً خودش آن را ساخته بود.

او نوشت: "Claude Opus 5 این بازی را یک‌جا ساخت،" و اضافه کرد که حتی یک دارایی خارجی نیز در این ساخت استفاده نشده است.

اکنون، ممکن است فکر کنید چنین خروجی با کیفیتی نیازمند یک فرمان طولانی، دقیق و با دقت برای هدایت مدل‌های هوش مصنوعی در پیچیدگی‌های ساخت یک بازی تیراندازی اول شخص صیقلی بوده است.

دوباره فکر کنید.

Claude Opus 5 one-shotted this game.

EVERYTHING you see in this demo is custom code... not a single external asset was used.

AI games are going to be amazing.

(sound on) pic.twitter.com/zc7C61kgv1

— Matt Shumer (@mattshumer_) July 25, 2026

فرمان اصلی آن سه پاراگراف کوتاه بود که به طور کامل در گیت‌هاب منتشر شد. این فرمان به Opus 5 دستور می‌داد تا یک بازی تیراندازی در سطح جدیدترین بازی‌های Call of Duty بسازد، زیرعامل‌ها (subagents) —کارگرانی که هر یک حافظه جداگانه و کار محدودی دارند— را برای رسیدگی به بخش‌های مختلف به صورت جداگانه پخش کند و با یک منتقد سخت‌گیر جداگانه روی هر بخش به چرخه ادامه دهد تا زمانی که در مقایسه کور و کنار به کنار با ویدیوهای واقعی Call of Duty مقاومت کند. نتیجه، طبق فرمان، باید "کاملاً بی‌عیب و نقص" باشد.


این برعکس روشی است که مهندسان فرمان‌نویس به مردم آموزش داده‌اند. توصیه در دوران اوج کدنویسی بصری (vibe-coding) این بود که به جای صفات، معیارها را مشخص کنید: بگویید "خوب" به چه معناست به جای اینکه فقط آن را درخواست کنید. کد باید چه چیزی را در نظر بگیرد به جای اینکه بگوید "AAA".

نسخه شومر تقریباً برعکس عمل می‌کند و از زیرعامل‌های خود می‌خواهد که "کاملاً شگفت‌زده" شوند و تعریف واقعی را به منتقدی واگذار می‌کند که Opus 5 برای خودش ساخته است.

این تقریباً تمام توضیحات بود. شومر بعداً نوشت که او هرگز رندرکننده را مشخص نکرد، سیستم‌های بازی را لیست نکرد یا تعریف نکرد که "کیفیت AAA" شامل چه چیزهایی باید باشد. او این رویکرد را حلقه گانتلت نامیده است: به یک عامل یک معیار واقعی و قابل بازرسی بدهید به جای یک دستورالعمل مبهم، اجازه دهید کار را به قطعات کوچک تقسیم کند، و هر قطعه را از طریق یک منتقد که هرگز دلیل سازنده برای انتخاب‌هایش را نمی‌بیند، هدایت کند.

دو ویژگی Claude Code این حلقه را پیش می‌برند. زیرعامل‌ها در پنجره‌های متنی ایزوله با دستورالعمل‌ها و دسترسی ابزار خودشان فعال می‌شوند، بنابراین منتقدی که مدل اسلحه را ارزیابی می‌کند، بهانه‌های سازنده را در مورد چرایی ظاهر آن به ارث نمی‌برد. Ultracode یک تنظیم در Claude Code است که مدل را به اوج تلاش استدلالی خود می‌رساند و به آن اجازه می‌دهد تا طرح ارکستراسیون خود را بنویسد و کار را بین حداکثر ۱۶ عامل به طور همزمان پخش کند، با سقف ۱۰۰۰ عامل در هر اجرا.

قابلیت داخلی /loop Anthropic که برای چرخه‌های تکراری "رفع-تست-تنظیم" ساخته شده است، چیزی بود که مانع از توقف اجرا در لحظه‌ای شد که بازی قابل قبول به نظر می‌رسید. شومر هرگز تعداد دورها را مشخص نکرد. او اجازه داد منتقد به شناسایی شکافی جدید ادامه دهد و سازنده را ساعت‌ها در تعقیب آن نگه داشت تا زمانی که خودش جلسه را بست.

نسخه نهایی روی Three.js و WebGL2 ساده اجرا می‌شود و تقریباً ۵۵,۰۰۰ خط کد در ۱۱ زیرسیستم توزیع شده است. هر بافت، مش، انیمیشن و صدا در زمان بارگذاری در داخل مرورگر تولید می‌شود – بدون مدل‌های دانلود شده، HDRIs، فایل‌های تصویری یا فایل‌های صوتی. گزارش منتقد شومر نشان می‌دهد که امتیاز از ۳.۵۹ از ۱۰ به کمی بالاتر از ۵ افزایش یافته است، اما همچنان در هر دور از بازی واقعی عقب می‌ماند.

افراد شکاک ساعت‌ها کدنویسی دستی پنهان را فرض می‌کردند، بنابراین شومر کل فرمان و پایگاه کد را منتشر کرد. در این زمان بود که مقلدان شروع به کار کردند.

همان ترفند، سه سازنده مختلف

جیمز آلتوچر، مدیر سابق صندوق پوشش ریسک و پادکستر، همان فرمان را اجرا کرد و گزارش داد که "کمی بیش از ده ساعت" و تقریباً ۱.۳ میلیون توکن را روی Opus 5 برای رسیدن به این هدف صرف کرده است. بازی ساخته شده توسط او، Operation Blackout، به صورت رایگان در مرورگر قابل بازی است و فوق‌العاده به نظر می‌رسد.

می‌توانید این بازی را از اینجا بازی کنید.

توسعه‌دهنده Prompt Silo، همین درخواست را به پرچم‌دار رقیب OpenAI ارائه کرد و پست کرد: "Sol 5.6 Ultra با همان فرمان" — Sol بالاترین رده از خانواده سه‌مدلی GPT-5.6 است که OpenAI در ۹ جولای به همراه نسخه‌های ارزان‌تر Terra و Luna منتشر کرد.

Sol 5.6 Ultra with same prompt. pic.twitter.com/89EhfiCvg0

— Rich · Atom Tan Studio (@atomtanstudio) July 26, 2026

توسعه‌دهنده لئون لین حرکت متفاوتی را امتحان کرد و به سراغ فرمان دقیق معمول رفت. او به جای کپی کردن نسخه کوتاه شومر، قصد داشت "یک فرمان برای این بازی مهندسی معکوس کند" و سندی را تولید کرد که شامل حدود ۲۰ بخش عمیق بود و همه چیز را از فیزیک راگ‌دول تا نقشه‌های سایه آبشاری توضیح می‌داد. او این فرمان را با استفاده از Opus 5 ساده و با تلاش زیاد، بدون زیرعامل و بدون Ultracode، به Cursor داد و نتیجه —یک بازی تیراندازی خیابانی به نام Dust Corridor— نیز در مرورگر قابل بازی است و همچنین عالی به نظر می‌رسد.

هیچ یک از ساخت‌های بعدی با آزمون کور که شومر روی پروژه خودش اجرا کرد، مواجه نشده‌اند. گزارش منتقد او همچنان نشان می‌دهد که Call of Duty واقعی در هر دور که او ثبت کرده است، برنده می‌شود — معیاری که آلتوچر و اتم تن استودیو با فرمان دقیق سه پاراگرافی او و همچنین لئون لین با حدود ۲۰ بخش فرمان خودش، به دنبال آن هستند.

چه میزان از این موارد واقعاً جدید است؟

ابزارهای کدنویسی مبتنی بر عامل مانند Claude Code نرم‌افزار را مانند یک مهندس تازه‌کار تحت نظارت می‌نویسند: آن‌ها فایل‌ها را می‌خوانند، کد را اجرا می‌کنند، به اسکرین‌شات‌هایی که تولید می‌کنند نگاه می‌کنند و بخش‌هایی از کار را به زیرعامل‌ها و منتقدانی می‌دهند که نتیجه را با یک هدف مشخص مقایسه می‌کنند. این حلقه واقعی است و حلقه گانتلت شومر یک روش واقعی برای ساختاربندی آن است. هیچ یک از این موارد به تنهایی ثابت نمی‌کند که مدل، یک بازی را از تخیل طراحی کرده است، نه اینکه الگوهای کدی را که قبلاً جذب کرده بود، بازترکیب کرده باشد.

Three.js کنترل‌های دوربین اشاره‌گر-قفل خود را به عنوان یک مثال رسمی ارائه می‌دهد، و آن الگوی پایه —دیدن با ماوس، حرکت WASD، پرتاب اشعه برای تیراندازی— برای بیش از یک دهه در گیت‌هاب، گیتس و انجمن‌های توسعه‌دهندگان فورک شده و آموزش داده شده است. یک مدل کدنویسی که بر روی مخازن عمومی آموزش دیده است، تقریباً به طور قطع صدها یا حتی هزاران بازی تیراندازی تقریباً یکسان را قبل از خواندن فرمان شومر دیده است.

این باعث نمی‌شود که "Claude of Duty" ساختگی باشد، اما ادعای "ساخته شده از صفر" را برای اعتبار کامل سخت‌تر می‌کند، بنابراین این نتایج را با کمی احتیاط در نظر بگیرید.

محققانی که مدل‌های تولیدکننده کد را مطالعه می‌کنند، برای این مسئله گسترده‌تر نامی دارند: آلودگی داده‌ها، زمانی که یک مدل عمدتاً به این دلیل در یک کار خوب عمل می‌کند که نمونه‌های تقریباً یکسان قبلاً در داده‌های آموزشی آن وجود داشته‌اند، نه به دلیل اینکه چیزی جدید را استدلال کرده است.

هیچ یک از ساخت‌های بازی‌های تیراندازی اول شخص، بررسی‌ای برای این نوع آلودگی منتشر نکرده‌اند. مخزن خود شومر حاوی خلاقیت‌های خود Claude است، اگر بتوان آن را اینگونه نامید. این دلیلی است که "ساخت یک بازی AAA در یک مرحله" را به عنوان یک عامل توانمند که در یکی از مستندترین ژانرهای برنامه‌نویسی کار می‌کند، در نظر بگیریم، نه به عنوان اثباتی که هوش مصنوعی یک بازی تیراندازی را بدون هیچ پیشینه‌ای طراحی کرده است.

رمزارز های محبوب
همین حالا ثبت‌نام کنید، هیچ به‌روزرسانی‌ای را از دست ندهید!