GPT-4.5 を研究プレビューで公開
事前学習の規模を拡大した GPT-4.5 を研究プレビューとして公開した。最初は Pro 利用者と開発者が対象で、翌週以降 Plus と Team などへ広げる計画だった。
この月に主要AIサービスで起きた21件の出来事です。対話AI 7件、開発 5件、統合エージェント 3件、リサーチ 3件、画像生成 2件、音声・会議 1件。
事前学習の規模を拡大した GPT-4.5 を研究プレビューとして公開した。最初は Pro 利用者と開発者が対象で、翌週以降 Plus と Team などへ広げる計画だった。
思考過程を見せる拡張思考を備えたハイブリッド推論モデル。価格は入力100万トークン3ドル、出力15ドルで、前世代と同じ。
コードの検索・編集、テスト実行、GitHub へのコミットまでを担うコマンドライン型のエージェント。Claude 3.7 Sonnet と同時に、限定プレビューで始まった。
推論モデルの Grok 3 (Think) と Grok 3 mini (Think) をベータで出した世代。複数の情報源を調べる DeepSearch が加わり、コンテキスト長は100万トークンとされた。
API で Gemini 1.0 Pro が利用できなくなった。
gemini-2.0-flash-001 が正式版になり、Pro の実験版と Flash-Lite のプレビューも同日公開された。
複数の情報源を調べて報告書にまとめる deep research を ChatGPT に追加した。
Anthropic が、ターミナルから使うコーディング支援ツール Claude Code を限定的なリサーチプレビューとして発表した。コードの検索と読み取り、ファイル編集、テストの実行、GitHub へのコミットとプッシュ、コマンドライン操作を任せられる。同日に Claude 3.7 Sonnet も公開された。
有料プラン全体で Claude 3.7 Sonnet が使えるようになった(パブリックプレビュー)。思考ありとなしの両モードに対応し、エージェント的な作業で改善が大きいとされた。
v0.46 で、これまで別だった Chat、Composer、Agent が1つの画面に統合され、Agent が標準になった。.cursorignore などの除外設定も加わった。
外部ツールを Copilot Chat から自然言語で呼び出せる拡張の仕組みが、全ライセンスで一般提供になった。Perplexity、Stack Overflow、Docker、Mermaid Chart などの拡張が並ぶ。
Copilot が自分のコードを見直し、エラーを見つけて直す動作を繰り返す agent mode を、VS Code Insiders で試験公開した。同日、複数ファイルを編集する Copilot Edits が VS Code で一般提供になった。課題を割り当てて動く自律エージェントは年内に出すと予告された。
公式ブログで、画像生成などを扱う AI クリエイティブツール Image Studio が発表された。
公式ブログで、Deep Research の第2版が発表された。複数の高性能モデルを組み合わせて調査を進める仕組みと紹介されている。
公式ブログで、MoA の第2版が発表された。Gemini 2.0 を使い、高い性能を出したと説明されている。
個人向けの Google One AI Premium に NotebookLM Plus が含まれるようになった。Gemini Advanced や 2TB のストレージと同じ料金で使える。米国の18歳以上の学生には、12か月間月額9.99ドルになる割引も始まった。
NotebookLM と NotebookLM Plus が Google Workspace のコアサービスになり、エンタープライズ級のデータ保護の対象になった。アップロード、クエリ、回答はモデルの学習に使われず、組織の外へ共有されない。
数十回の検索と数百の情報源の読み込みを自動で行い、報告書にまとめる機能。無料でも1日の回数制限つきで使え、有料加入者は回数の上限が高い。まず Web 版で提供された。
新しい Firefly アプリで Firefly Video Model が公開ベータになった。1080p の動画を、テキストや画像から生成できる。3Dスケッチから画像を作る Scene to Image や、20以上の言語に対応する音声・動画の翻訳も加わった。
月額9.99ドルの Standard(2,000クレジット)と、月額29.99ドルの Pro(7,000クレジット)が発表された。いずれも画像とベクターの生成は無制限。月額の Premium は近日公開とされた。
ElevenLabs 初の音声認識モデル。99言語の文字起こしに対応し、単語ごとのタイムスタンプ、話者の識別、音声イベントのタグ付けを返す。