今週のAI年表(9月28日〜10月4日):出来事22件、節目は5件
2026年9月28日〜10月4日の年表には、22件の出来事が載った。節目は Gemini 4 Argon の発表、Manus 2.0 の公開など5件。カテゴリごとの動きと、期限の近い変更を並べる。
Manus
音声合成・文字起こし・音声エージェントのAI
ElevenLabs は、音声合成、文字起こし、吹き替え、音楽生成などを提供する音声AIの会社。電話や Web で話す音声エージェントを作る ElevenAgents や、画像・動画も扱う ElevenCreative を展開している。音声合成の主力は感情表現を重視した Eleven v4 で、90以上の言語に対応する。開発者向けの API も用意されている。
日本語の公式サイトはあり、日本語の音声生成や吹き替えにも対応する。ただしアプリ画面の日本語表示は確認できていない。料金は日本語ページでもドル表示で、日本円の価格は確認できなかった。
公式サイト2026年10月10日時点で確認
Timeline
38件の出来事
3億ドルの従業員向けテンダーオファーを完了し、評価額は220億ドルとなった。Wellington と T. Rowe Price が主導した。企業向けが売上の55%を占めるという。
公式発表:ElevenLabs valuation increases to $22 billion fueled by enterprise demand for conversational agents感情表現を重視した音声合成モデル。90以上の言語に対応し、Turbo 版は最初の音声が出るまで約150ミリ秒。10秒の音声から Instant Voice Clone を作れる。
公式発表:Introducing Eleven v4, our most emotive modelドキュメントの更新履歴に、Sora 2 の各モデルを提供終了し、Seedance 1.5 Pro を非推奨にしたと記載された。
公式発表:Changelog医療音声に特化した文字起こしモデルを、API で誰でも使えるようにした。臨床音声の単語誤り率が Scribe v2 より約35%低い。英語、フランス語、ドイツ語に対応する。
公式発表:Scribe v2 Medical is now available to everyone音楽生成モデルの新版で、ElevenMusic の標準モデルになった。ElevenCreative と API でも使える。他のアーティストの楽曲を参照した曲はダウンロードできない。
公式発表:Introducing Music v2.5, our best music model yetUniversal Music Group と、複数年のライセンスおよび製品開発の契約を結んだ。ファンがリミックスなどを作れる新しい音楽プラットフォームを共同で作る。大手レーベルとの契約は初めて。
公式発表:Universal Music Group and ElevenLabs announce multi-year strategic agreement広告素材を50以上の言語に展開するツール。文字の翻訳、画像の調整、動画の吹き替えを同時に行い、Google Ads、Meta、LinkedIn へ書き戻せる。
公式発表:Introducing Ads Engine in ElevenCreative元の話者の演技を直接読み取り、感情や間を保ったまま吹き替える新モデル。90以上の言語に対応する。公開時点で API は準備中だった。
公式発表:Introducing Dubbing v2: our revolutionary new dubbing model音楽生成モデルの新版。ボーカルや編曲を改善し、曲の一部だけを作り直せる。多言語の歌詞にも対応し、API 利用料は最大50%下がった。
公式発表:Introducing Music v2, our groundbreaking new music model2026年の最初の4か月で年間経常収益が5億ドルを超えたと発表した。2025年末は3億5000万ドルだった。BlackRock、NVIDIA などが新たに出資した。
公式発表:ElevenLabs crosses $500M ARR as it welcomes new investors including BlackRock, NVIDIA, Jamie Foxx and Eva Longoria聴く、リミックスする、曲を作る機能をまとめた音楽サービス。モバイルアプリと Web で使え、公開時点で4000組以上のアーティストの楽曲が入っている。
公式発表:Introducing ElevenMusic公共機関向けに音声エージェントを提供する取り組みを始めた。ウクライナ、チェコ、米国ミッドランド市での導入が紹介されている。
公式発表:Introducing ElevenLabs for GovernmentSequoia Capital 主導で5億ドルを調達し、評価額は110億ドルとなった。調達額は累計7億8100万ドルになる。資金は ElevenAgents や感情を扱う会話モデルの研究に充てるとしている。
公式発表:ElevenLabs raises $500M Series D at $11B valuationアルファ版だった Eleven v3 を、全プラットフォームで正式に提供し始めた。数字や記号の読み上げ誤りが、検証では15.3%から4.9%に減ったという。
公式発表:Eleven v3 is Now Generally Available一括の文字起こし、字幕、キャプション向けの新モデル。最大100語のキーワード指定、56種類の機密情報の検出、言語の自動判別に対応する。
公式発表:Introducing Scribe v2音声、画像、動画の生成を一つの場所で扱える Image & Video をベータ版で公開した。Veo、Sora、Kling、Wan、Seedance などの動画モデルと、Nanobanana や GPT Image などの画像モデルを選べる。
公式発表:Introducing ElevenLabs Image & Videoリアルタイムの文字起こしモデル。150ミリ秒未満で書き起こし、90を超える言語に対応する。音声エージェントや会議の字幕向けで、Agents にも組み込まれた。
公式発表:Introducing Scribe v2 Realtimeエージェントの会話の流れを画面上で設計できる機能。専門のサブエージェントへの振り分けや、人間の担当者への引き継ぎを設定できる。
公式発表:Introducing Agent Workflows日本の非営利団体 AILAS と組み、声優の声が本人の同意で登録されていることを示す音声IDの仕組みを始めた。AILAS ID は Voice Library に表示され、利用条件を確認できる。
公式発表:ElevenLabs and AILAS launch voice ID system to protect actors from AI misuse従業員が株式を売却できるテンダーオファーを、評価額66億ドルで実施すると発表した。年間経常収益は2億ドルを超えたとしている。
公式発表:Announcing an Employee Tender Offer at $6.6B valuation会話型AIの基盤の名称を ElevenLabs Agents に変えた。電話、Web、アプリで話し、入力し、操作まで行うエージェントを作れる基盤として位置づけている。作成されたエージェントは200万を超える。
公式発表:Introducing ElevenLabs AgentsEleven v3(アルファ版)を API で使えるようにした。話者数に制限のない対話モードと、70以上の言語への対応が加わった。HeyGen、Poe、Captions、InVideo などが組み込んでいる。
公式発表:Eleven v3 (alpha), now available in the APIEleven Music を開発者向け API で使えるようにした。生成した楽曲は幅広い商用利用が認められ、映画やテレビなど一部の用途は企業向けプランが必要になる。8月は50%割引で提供した。
公式発表:Eleven Music, now available in the API文章の指示からジャンルや構成を指定して楽曲を作れる。ボーカル入りとインストの両方を生成でき、英語、スペイン語、ドイツ語、日本語などに対応する。レーベルや出版社との協力により、商用利用の許諾を得ている。
公式発表:Eleven Music is here音声で操作するAIアシスタントのアルファ版。MCP を使い、Perplexity、Linear、Slack、Notion などの外部ツールに指示を出せる。無料の試験提供として始まった。
公式発表:Introducing 11ai: the voice-first AI assistant that takes action70以上の言語に対応する音声合成モデルの研究プレビュー。[excited] や [whispers] などのタグで感情を指定でき、複数の話者による会話も生成できる。
公式発表:Introducing Eleven v3 (alpha) — the most expressive Text to Speech model音声エージェントの基盤を更新した。会話の間合いを判断するモデル、RAG、言語の自動判別、テキストと音声の併用、電話の発信・着信やバッチ発信に対応した。HIPAA対応とEUデータ保管も選べる。
公式発表:Introducing ElevenLabs Conversational AI 2.0東京に初の海外子会社 ElevenLabs G.K. を設立した。日本と韓国向けの現地化を進め、DOCOMO Innovations や TBS などとの協業が始まっていると発表した。
公式発表:ElevenLabs establishes Japanese Subsidiary, ElevenLabs G.K.ElevenLabs 初の音声認識モデル。99言語の文字起こしに対応し、単語ごとのタイムスタンプ、話者の識別、音声イベントのタグ付けを返す。
公式発表:Meet Scribe, the world's most accurate ASR modela16z と ICONIQ Growth が主導する1億8000万ドルの調達を発表した。評価額は33億ドル。NTT DOCOMO Ventures や Deutsche Telekom の投資部門なども参加した。
公式発表:ElevenLabs raises $180M Series C to be the voice of the digital world低遅延の音声合成モデル。生成にかかる時間は約75ミリ秒で、Flash v2 は英語のみ、Flash v2.5 は32言語に対応する。対話型の音声エージェント向けに設計されている。
公式発表:Meet FlashTurbo v2.5 モデルで、ハンガリー語、ベトナム語、ノルウェー語の音声生成に対応した。Speech Synthesis、Studio、API から使える。
公式発表:Introducing three new languages: Hungarian, Vietnamese and NorwegianAndreessen Horowitz、Nat Friedman、Daniel Gross が主導する8000万ドルの調達を発表した。あわせて、29言語に対応する Dubbing Studio と、声を共有して収益を得られる Voice Library の提供を始めた。
公式発表:ElevenLabs Releases New AI Products and Raises $80M Series B話者の声を保ったまま、音声を別の言語へ翻訳する吹き替え機能を発表した。日本語を含む20以上の言語に対応し、複数の話者がいる音声も扱える。
公式発表:ElevenLabs launches voice translation tool to break down language barriers for contentベータ版を終了し、約30言語に対応した音声合成モデルを公開した。対応言語に日本語を含む。Professional Voice Cloning も同時に提供を始めた。
公式発表:ElevenLabs Comes Out of Beta and Releases Eleven Multilingual v2Nat Friedman、Daniel Gross、Andreessen Horowitz が主導する1900万ドルの調達を発表した。長尺音声の制作ツール Studio と、AI生成音声を判別する AI Speech Classifier も公開した。
公式発表:ElevenLabs Launches New Generative Voice AI Products and Announces $19m Series A Round複数言語の音声を作れる音声合成モデル。新たにフランス語、ドイツ語、ヒンディー語、イタリア語、ポーランド語、ポルトガル語、スペイン語の7言語に対応した。全プランで使える。
公式発表:Introducing Eleven Multilingual v1: Our New Speech Synthesis ModelElevenLabs が音声合成のベータ版を公開した。長い文章にナレーションを付けられ、5秒ほどの音声サンプルから声のクローンも作れる。同時に、Credo Ventures 主導で200万ドルの事前調達(プレシード)を発表した。
公式発表:ElevenLabs Raises $2M and Announces AI Speech Platform Promising to Revolutionize Audio Storytelling2023年1月23日にベータ版を公開した。
無料プランがあり、月10,000クレジットまで使える。
2023年8月の Multilingual v2 から日本語の音声生成に対応し、最新の Eleven v4 も日本語を含む90以上の言語に対応する。
2026年9月28日に公開された Eleven v4 と v4 Turbo が音声合成の最新モデル。
2025年4月に東京で日本法人 ElevenLabs G.K. を設立している。
Starter が月$6、Creator が月$22、Pro が月$99、Scale が月$299、Business が月$990。
音声合成、文字起こし、吹き替え、音楽生成、音声エージェントの作成などができる。
ある。音声合成、文字起こし、音楽生成などを API で使える。
2026年9月28日〜10月4日の年表には、22件の出来事が載った。節目は Gemini 4 Argon の発表、Manus 2.0 の公開など5件。カテゴリごとの動きと、期限の近い変更を並べる。
Suno が2026年10月1日、語りと BGM を1本の音声として同時に作る Speech(ベータ)を全員に公開した。約1か月の少人数テストを経た。料金、消費クレジット、対応言語は発表に書かれていない。
ElevenLabs は2026年9月28日、音声合成モデル Eleven v4 と、応答の速い v4 Turbo を公開した。Turbo は最初の音声が出るまで約150ミリ秒。両モデルは90以上の言語に対応する。前の更新から6日後だ。