2024年12月

この月に主要AIサービスで起きた24件の出来事です。対話AI 8件、開発 4件、統合エージェント 1件、リサーチ 2件、画像生成 2件、動画生成 5件、音声・会議 2件。

対話AI8

  • DeepSeekモデル

    DeepSeek-V3 を公開

    総パラメータ671B、活性化37BのMoEモデル。V2 の約3倍の毎秒60トークンで出力する。モデルと論文はオープンソースで公開された。2025年2月8日以降の API 料金は、入力0.27ドル、出力1.10ドル(100万トークンあたり)と案内された。

  • Grok企業

    60億ドルの Series C を調達

    xAI が Series C で60億ドルを調達した。10万基の NVIDIA Hopper GPU を持つスーパーコンピュータ Colossus の完成と、20万基への拡張計画も示した。

  • Grok機能

    Grok を X の全ユーザーに無料提供

    高速化した Grok-2 を X の全ユーザーに無料で提供し始めた。引用付きのウェブ検索、Aurora による画像生成、投稿を解析する Grok ボタンも加わった。同日、API 向けに grok-2-1212 などの新モデルも出した。

  • Geminiモデル

    Gemini 2.0 Flash を実験公開

    エージェント用途を想定した Gemini 2.0 Flash が実験版として公開された。1.5 Pro を上回る性能を2倍の速度で出すとされ、画像や音声の出力にも対応する。同時に Project Astra・Mariner・Jules などの試作も示された。

  • Gemini機能

    Deep Research を提供開始

    複数段階の調査計画を立て、Web を検索して報告書にまとめる Deep Research が Gemini Advanced に加わった。

  • DeepSeek機能

    V2.5-1210 とウェブ検索を公開

    V2.5 系の最終更新として、数学・コード・文章などを改善した。chat.deepseek.com には「Internet Search」の切り替えが加わり、ウェブ検索を使った回答ができる。

  • Grok機能

    画像生成モデル Aurora を公開

    自己回帰型の画像生成モデル Aurora を X のユーザー向けに展開し始めた。写実的な描画と、文字指示への追従を特長とする。

  • ChatGPT料金

    ChatGPT Pro(月額$200)を開始

    月額200ドルの ChatGPT Pro を始めた。o1 の無制限利用と、より多くの計算を使う o1 pro mode が含まれる。

開発4

  • GitHub Copilot料金

    無料プラン Copilot Free を開始

    VS Code に組み込まれる形で、月2,000回のコード補完と50回のチャットを無料で使えるようにした。個人の GitHub アカウントでサインインして使い、モデルは Claude 3.5 Sonnet か GPT-4o から選べる。

  • GitHub Copilot機能

    Copilot Chat on GitHub を一般提供

    github.com/copilot の専用チャット画面が、全ユーザー向けに一般提供になった。コードベースとの対話ができ、リポジトリのインデックスの上限もなくなった。

  • Devin料金

    Devin を一般提供、月500ドルから

    エンジニアリングチーム向けに一般提供を始めた。月500ドルからで、席数無制限、Slack 連携、IDE 拡張、API アクセス、導入支援が含まれる。

  • Devin機能

    12月アップデート:Slack と VS Code 拡張

    Slack で @Devin を呼べるようになり、PR コメントや lint 失敗への自動対応が加わった。VS Code 拡張(ベータ)、REST API、リポジトリ知識の自動生成も追加された。

統合エージェント1

  • Genspark機能

    Mixture-of-Agents を導入

    公式ブログで、複数のエージェントを組み合わせる MoA システムが発表された。チャット、画像、翻訳の体験に使われると紹介されている。

リサーチ2

  • NotebookLM料金

    NotebookLM Plus を開始、画面も刷新

    画面を Sources、チャット、Studio の3区画に改め、有料版の NotebookLM Plus を始めた。Plus は音声概要、ノートブック、ソースの上限が5倍で、回答スタイルの調整、チーム共有、利用状況の分析が付く。Workspace と Google Cloud 向けに先行提供した。

  • NotebookLM機能

    音声概要に参加できる対話モードを追加

    音声概要の再生中に、ホストへ声で質問できる「参加」機能を実験的に加えた。回答の精度に難がある場合があると案内している。同じ発表で、Gemini 2.0 Flash の実験版も NotebookLM に入った。

画像生成2

  • Midjourney機能

    複数プロファイルとムードボード

    パーソナライズのプロファイルを複数持てるようにし、画像を集めて好みを伝えるムードボードを追加した。必要な評価数は40回から始められ、200回で安定する。

  • Midjourney機能

    Patchwork の研究プレビューを公開

    物語の世界観を共同で作る AI 支援つきの無限キャンバス。patchwork.midjourney.com で、Google アカウントでのログインが必要。

動画生成5

  • Runway企業

    Talent Network を開始

    クリエイターや制作会社が作品を見せ、仕事を探せるプラットフォームを開始した。最初の登録者に、Creative Partner Program の作家や EDGLRD などの制作会社が含まれる。

  • Veoモデル

    Veo 2 を公開

    Veo の第2世代モデル。カメラワークやレンズ指定など映像表現の指示への理解を高め、最大4Kの解像度に対応するとされた。Google Labs の VideoFX で、待機リストの対象者を広げて提供した。

  • Soraモデル

    Sora Turbo を sora.com で一般提供

    2月のプレビュー版より高速な Sora Turbo を、sora.com で ChatGPT Plus と Pro の利用者に提供し始めた。最大1080p・最長20秒の動画を生成でき、Plus では480pで月50本までとされた。英国、スイス、欧州経済領域は対象外だった。

  • Sora企業

    Sora のシステムカードを公開

    Sora の一般提供にあわせ、モデルの学習データ、リスクの洗い出し、対策をまとめたシステムカードを公開した。

  • Veo機能

    Vertex AI で Veo を限定提供

    Vertex AI の顧客向けに、テキストや画像から動画を作る Veo が非公開プレビューとして提供された。Imagen 3 も同時に案内された。

音声・会議2

  • ElevenLabsモデル

    Flash v2 と Flash v2.5 を公開

    低遅延の音声合成モデル。生成にかかる時間は約75ミリ秒で、Flash v2 は英語のみ、Flash v2.5 は32言語に対応する。対話型の音声エージェント向けに設計されている。

  • Suno機能

    Android アプリを公開

    テキストの指示から曲を作り、他の作者の曲を聴いたり共有したりできる Android アプリを公開した。