Gemini で Veo 2 の動画生成
Gemini Advanced 利用者が Veo 2 で8秒の動画を作れるようになった。
この月に主要AIサービスで起きた30件の出来事です。対話AI 4件、開発 7件、統合エージェント 2件、リサーチ 4件、画像生成 4件、動画生成 7件、音声・会議 1件、業務効率化 1件。
Gemini Advanced 利用者が Veo 2 で8秒の動画を作れるようになった。
ツールを自律的に使える推論モデル o3 と o4-mini を公開した。同年6月10日には o3-pro が Pro 向けに追加された。現在は ChatGPT では提供されていない。
創業50周年に合わせ、個人向け Copilot に記憶と個人設定、予約や購入を代行する Actions、スマホとWindowsでの Vision、Pages、Deep Research、Copilot Search などを加えた。
Grok 3 系のモデルが API で一般提供となった。日付は開発者向けリリースノートの月単位の記載による。
JetBrains プラグインの更新履歴で、無料プランの上限が引き上げられたと記載されている。同じ版で o4-mini の medium と high が選べるようになり、アプリのアイコンとロゴも新しくなった。
JetBrains プラグインの更新履歴によると、Flow Action クレジットがなくなり、プロンプトクレジットだけの方式になった。各プランにはメッセージごとに消費するプロンプトクレジットが含まれる。
JetBrains プラグインの更新履歴に、会社が Codeium から Windsurf に改称したと記されている。同じ版で、エージェント型のコーディング支援 Cascade が書き込みモードとチャットモードで使えるようになった。
agent mode と MCP への対応が、VS Code の全ユーザーに順次提供された。Claude 3.7 Sonnet や Gemini 2.0 Flash などの追加モデルは、有料プランでプレミアムリクエストとして使える。
個人向けの上位プラン。月額39ドルで、プレミアムリクエストを月1,500回分含み、GPT-4.5 などの最新モデルを使える。プレミアムリクエストの枠は5月5日から適用と案内された。
クラウド上の対話型 IDE を備えた Devin が複数を並列で動かせるようになった。計画を立てる Interactive Planning、コード検索の Devin Search、リポジトリを文書化する Devin Wiki も加わった。
Devin 2.0 に合わせ、Core プランを20ドルから使えるようにした。エンタープライズ向けは営業窓口経由の個別契約とされた。
公式ブログで、エージェントがスライドを作成する AI Slides が発表された。同日に Canva や Figma で編集する手順も案内された。
公式ブログで、汎用の AI アシスタント Super Agent が発表された。以後の製品展開の中心になるエージェントである。
音声概要を、日本語を含む50以上の言語で作れるようになった。音声とチャットの出力言語を切り替える設定も加わった。音声の処理には Gemini 2.5 Pro のネイティブ音声機能を使っている。
ウェブ上の論文や資料を探し、そのままノートブックに追加できるソース探索を加えた。PDF 内の画像やグラフも読み取る。マインドマップとあわせて学生向けの機能として紹介された。
NotebookLM が、すべての Workspace for Education の顧客でコアサービスになった。対象は18歳以上で、初期設定は K-12 ではオフ、高等教育ではオン。
江戸時代の古文風テキストで答えるチャットボット。約2,500万字の江戸期の文章で Llama-3-ELYZA-JP-8B を追加学習し、モデルとデモを HuggingFace で公開した。
MAX London で Firefly Image Model 4 と Image Model 4 Ultra が一般提供になった。Firefly Video Model も一般提供になり、1080p の動画を生成できる。OpenAI、Google Cloud、Flux 1.1 Pro のモデルも Firefly 内で選べるようになった。
ムードボードやストーリーボードを作れる共同作業の場として、Firefly Boards が公開ベータになった。発想の整理から制作の前段階までを、AI を使って進められる。
外部画像エディタをすべての会員プランで使えるようにした。複数の画像をレイヤーとして取り込めるほか、V7 の入力バーも整理した。
テキスト解釈と、手・体・物体の整合性を高めた新モデル。パーソナライズが必須になり、10倍速で半額の Draft Mode を備える。公開時は Turbo と Relax から提供した。
参照画像を使って、一貫したキャラクターや場所などを生成できる機能。公式の更新履歴に記載されている。
動画モデル KLING 2.0 Master と画像モデル KOLORS 2.0 に更新した。同時に、動画の要素を足したり差し替えたりできる Multi-Elements Editor と、画像の部分編集や拡張も加わった。
Veo 2 が Google AI Studio での試用と、Gemini API の有料枠での利用に対応した。テキストまたは画像から8秒の動画クリップを生成できる。
Gemini の有料プラン向けに、Veo 2 による動画生成が加わった。720p・16:9・8秒の MP4 を作れ、Whisk の Animate では画像を動画にできる。
Gen-4 系の動画モデルのうち、最も速く効率がよい版。公式の更新履歴に記載されている。
General Atlantic が主導し、シリーズDで3億ドル超を調達した。資金は研究の強化と、AI映像スタジオ Runway Studios の拡大に使う。
シーンをまたいで人物、場所、物体の一貫性を保てる動画生成モデル。1枚の参照画像から同じキャラクターを出せる。公式の更新履歴の日付は4月1日。
東京に初の海外子会社 ElevenLabs G.K. を設立した。日本と韓国向けの現地化を進め、DOCOMO Innovations や TBS などとの協業が始まっていると発表した。
AI が受信メールを重要度の基準に沿って自動でラベル分けし、Notion のページを文脈にした返信の下書きも作る。Notion Calendar と連携して会議の調整もできる。