Grok Imagine Image 2.0:生成ではなく編集に注力
xAI
OpenAI
ByteDance
xAI は、一回の生成ではなく反復的な編集に焦点を当てた画像生成ツール、Grok Imagine Image 2.0 をリリースしました。領域編集、背景除去、複数参照のサポート、スマートリサイズなどの機能を備え、ベンチマークでは画像編集とテキストから画像生成の両方の分野で2位にランクインしています。現在、このモデルは Vercel AI Gateway API を通じて競合他社よりも低コストで利用可能です。
xAIは、単なる美しい画像生成ツールではなく、実際の反復的な画像作業のためのツールとして、Imagine Image 2.0を発表しました。この新しいモデルは、正確な編集を重視しており、局所的な編集のためのマジックワンド、ゾーン選択のためのセグメンテーション、背景除去とPNG書き出し、最大5枚の画像をサポートするマルチリファレンス編集などの機能を備えています。スマートリサイズは9つのアスペクト比をサポートし、写真編集、マーケティング素材、ゲームアセットなどの一般的なタスク用に15のワークフローテンプレートが用意されています。また、このモデルはキャラクターやシーン間での一貫性を確保することを目指しており、動画制作ワークフローを対象としています。ベンチマークでは、Image Edit ArenaでElo 1439で2位、Text-to-Image Arenaで1320で、GPT-Image-2に次ぐスコアを記録しています。現在は、Vercel AI Gateway APIを介してアクセスでき、1世代あたり0.05ドルと、Seedream 5 Pro、Nano Banano 2、GPT Image 2より安価です。ただし、Nano Banano 2よりは遅いものの、GPT Image 2よりは高速です。著者は、中国のモデルはNano Banano 2に遅れを取っているものの、この手頃で高品質なモデルは、現時点でAPIの全機能が動作していなくても、多くの人にとってベースラインとなる可能性が高いと指摘しています。ロシアでは、Vercel AI Gatewayでのプレビューへの非公式アクセスを除いて、このモデルはまだ利用できませんが、リリースは間近で、今週中にはVEGAを含むさまざまなサービスで利用可能になる予定です。
出典: Habr — хаб ИИ —
原文
