Thinking Machinesは2026年8月24日、オープンウェイトモデルの安全性に関する研究を支援するため、最大5万ドルのクレジットを提供する「Tinker grants」を開始すると発表しました。同社は、モデルの公開に伴うリスクの軽減に焦点を当てた研究を募っています。
研究の重点領域
助成対象となる研究領域は多岐にわたりますが、特に「モデルを公開した状態での安全性向上」が重要な柱となっています。具体的には、防御能力を攻撃能力よりも優先的に高める手法や、有害なデータを含む情報を大規模に識別する分類器の構築、さらには追加学習によって安全策が解除されるのを防ぐ、改ざん耐性のある安全性トレーニングなどが挙げられています。
また、AIの挙動が意図せず変化する「アライメントの失敗」の解明も重要なテーマです。特定のタスクに関する微調整が、モデル全体の広範な振る舞いに影響を及ぼすメカニズムや、報酬を不正に獲得しようとする「報酬ハッキング」といった問題の特定が求められています。
さらに、リスクの予測と測定に関する研究も対象に含まれます。モデルが公開された後に起こりうる最悪のケースのリスク推定や、計算資源や学習予算の拡大に伴って安全性がどのように変化するかという、スケーリングの傾向を予測する研究が期待されています。
助成プログラムの概要
本プログラムは、オープンウェイトモデルの安全性に関する有望な研究を加速させることを目的としています。対象となる研究のリストは、同社によって「非網羅的である」とされており、特定の分野に限定されません。研究者は、提案するプロジェクトが「Tinkerクレジットによって加速され得るものである」場合に、申請を行うことができます。
