トレーニング後の推論は通常、目的と最終スコアとして報告されますが、小規模なGPUでは、トレーニングループが可能なことを決定します。コンパクトな数学的推論のための、批評家なしの検証可能な報酬からの強化学習(RLVR)パイプラインが、固定8GBプロファイル内で安定して観測可能かつ回復可能かをテストします。私たちは、4ビットNF4の固定バックボーン、手動LoRAアダプター、明示的なフェーズ境界、VRAM対応のチェックポイント、フェーズローカルのOOM回復を持つDeepSeek-R1-Distill-Qwen-1.5B用のPyTorchオーケストレーションエンジンを提示します。ここでの直接オーケストレーションは、純粋なPyTorchカーネルスタックではなく、トレーニングループの制御を意味します。実行時はロールアウト生成、固定ポリシースコアリング、報酬計算、アダプターの更新、キャッシュ解放、チェックポイント、ベンチマークを公開します。学習経路は、応答制限、切り捨て処理、シーケンス長診断、トークンレベルのエントロピーマスキング、および意味的エントロピーのカリキュラム順序付けを使用した検証者報酬によるGRPOファミリー最適化を使用します。このシステムは、まばらな報酬、応答の長さ、およびエントロピーに基づく選択性がコンパクトなSLMで相互作用するときに、検証者サポートされたGRPOがどのように機能するかに関するMLの質問に対応します。選択された768トークンプロファイルは、RTX 3060 Tiで40ステップの診断をOOMバックオフなしで完了します。プロンプトマッチ評価では、LoRAアダプターは正であるが統計的には不確実なマクロpass@1の差異を示しました。ペアリングされたブートストラップ分析は、平均サンプルの正確性が向上し、応答が短縮されることを示しました。結果は、短いローカル応答予算の下で測定されたプロンプトにマッチした行動の変化を持つ8GBのGRPOアーティファクトです。
エンディカ・ブランコ(木曜日)はこの問題を研究しました。