検索
連載

OpenAIが最新モデルに対する強化学習を2週間中断/LLMCが約332億パラメーターの「LLM-jp-4 33B」を公開週末の「気になるニュース」一気読み!(1/3 ページ)

うっかり見逃していたけれど、ちょっと気になる――そんなニュースを週末に“一気読み”する連載。今回は、8月16日週を中心に公開された主なニュースを一気にチェックしましょう!

Share
Tweet
LINE
Hatena

 うっかり見逃していたけれど、ちょっと気になる――そんなニュースを週末に“一気読み”する連載。今回は、8月16日週を中心に公開された主なニュースを一気にチェックしましょう!

OpenAIが最新モデルに対する強化学習のトレーニングを2週間中断

 OpenAIは8月18日、サイバーセキュリティ分野でのモデルの能力が高まったことを受け、開発のペースを一時的に落として安全対策を強化したと公表した。

photo
OpenAIが開発ペースを一時的に落とすと発表。最新モデルに対する強化学習を2週間停止する

 きっかけは2つある。1つは、7月に公表したHugging Faceのセキュリティインシデントだ。サイバー能力の評価中だったモデルがテスト環境の外に出て、Hugging Faceの本番システムにアクセスしたというものだ。

 もう1つは、開発中のモデル「Astra」について、同社の安全性指針「Preparedness Framework」が定める「Critical」水準のサイバー能力に達する可能性があると8月7日に判断したことだ。

 対応として、同社は展開を予定している最新モデルの強化学習(RL)を2週間停止した。最大規模を計画していたフロンティアRLの実行も保留が続いているという。

 研究用クラスタでは、インターネット接続を伴うコード実行のワークロードについてフロンティアモデルの推論を止め、信頼できないコードのサンドボックス化、ネットワーク分離、模擬攻撃による継続的なテストを進めているとのことだ。

 Astraとサイバー能力を持つモデルには最も厳しい対策を適用しており、環境の移行が済むまで停止したままのワークロードも残るとしている。

 監視面では、思考の連鎖(chain-of-thought)を対象とした多段階の仕組みを導入した。サンプリングしたトークンでモデル内部の活動を検査する「活性化分類器」を使い、懸念があれば段階的により高度な自動調査へ引き渡す。

 懸念のある挙動が浮かび上がってから、30分以内のアラート発報を目標に置くという。GPT-5.6 Sol相当以上のモデルがツールを使うRL学習/評価では、この監視が必須となる。ただ、監視対象となる推論の計算量の約20%がオーバーヘッドとして上乗せされるとのこと。

 同社はPreparedness Frameworkを改定し、学習と展開の両段階に安全対策を統合していく方針も示している。技術的な知見については、数週間のうちに公開するとしている。

LLMCが約332億パラメーターを持つDense型の大規模言語モデル「LLM-jp-4 33B」を公開

 国立情報学研究所(NII)の大規模言語モデル研究開発センター(LLMC)は8月18日、約332億パラメーターのDense型LLM「LLM-jp-4 33B」を公開した。ライセンスはApache License 2.0で、商用利用も認められる。

photo
LLMCが約332億パラメーターのDense型LLM「LLM-jp-4 33B」を公開した

 公開されたのは2種類だ。事前学習と中間学習までを行ったベースモデル「llm-jp-4-33b-base」と、教師ありファインチューニング(SFT)と直接選好最適化(DPO)まで施した「llm-jp-4-33b-thinking」で、いずれもHugging Faceで配布されている。DPOに使ったデータセットも併せて公開されている。

 LLM-jp-4シリーズは、2026年4月にDense型の8BモデルとMixture of Experts(MoE)型の32B-A3Bモデルが公開されている。今回はそれに続く、パラメーターを全て使うDense型の33Bという位置付けになる。

 33Bは64層、隠れ層は5120で、コンテキスト長は6万5536トークンとなる。事前学習には11.7兆トークンを投入したという。対応言語は日本語と英語となっている。

 性能評価には、同センターの「llm-jp-judge」を使っている。日本語MT-Bench、英語MT-Bench、AnswerCarefully、llm-jp-instructionsの4つのベンチマーク全てで、これまでに公開したLLM-jp-4 Thinkingモデルを上回るスコアを記録したという。

 推論の深さを示すreasoning_effortがmediumの場合、日本語MT-Benchが8.00、英語MT-Benchが8.24で、同じ条件のgpt-oss-20b(7.33、7.85)を上回る。ただ、5点満点のAnswerCarefullyとllm-jp-instructionsは3.79で、比較対象に並ぶgpt-4o(4.00、4.07)には届いていない。

 なお、公開されたモデルは研究開発の初期段階のモデルであり、出力を人間の意図や安全性に沿わせる調整は行っていないとのこと。利用時は注意しておきたい。

Copyright © ITmedia, Inc. All Rights Reserved.

       | 次のページへ
ページトップに戻る