تخطّي إلى المحتوى
Kudos AI

موسومة بـ “value-iteration”

3 مقالات.

قراءة 4 دقيقةالتعلّم المعزّز

الوسيط الذي لا يختاره أحد

مكافأة البقاء في عالَم الشبكة تُكتب مرّةً ولا تُناقَش، والسياسة المثلى دالّة درجيّة فيها: ثمانية عتبات بين -3 و0، كلٌّ منها يقلب مربّعًا واحدًا بالضبط. والقيمة المألوفة -0.04 تبعد 0.0048 عن العتبة التي تقرّر هل يسلك الوكيل الطريق القصير بمحاذاة الحفرة، وفوق -0.0221، حين تكاد الخطوات تكون مجانيّة، يصير الفعل الأمثل في أحد الأركان أن يدفع الجدار عمدًا.

الذكاء الاصطناعي
قراءة 8 دقيقةالقرارات المتسلسلة والتعلّم المعزَّز

التصرّف حين لا ترى الحالة

ما الذي يتغير حين يتلقى العميل إدراكات مشوَّشة بدل حالته: حالة الاعتقاد التي تحلّ محلها وتحديث الترشيح الذي يصونها، والإحالة المضبوطة لـ POMDP إلى عملية ماركوفية على الاعتقادات، ودالة القيمة الخطية بالقطع المحدّبة التي تجعل تلك الإحالة قابلة للحساب من حيث المبدأ، والأسباب المقيسة لتعذّرها عمليًا - مع النقطة الثابتة للاعتقاد ومتجهات ألفا ودالة القيمة محسوبةً لا مُدّعاة.

الذكاء الاصطناعيالاحتمالات
قراءة 7 دقيقةالتعلّم المعزّز

عمليات القرار الماركوفية

كيف تخطّط حين لا تفعل الأفعال ما تقصده بموثوقية: الحالات، ونموذج الانتقال، والمكافآت والخصم، ومعادلة بلمان، وتكرار القيمة محلولاً عددياً حتى نقطته الثابتة.

التعلّم المعزّزالاحتمالاتالذكاء الاصطناعي