AIオートパイロット:受理タスクのフローが13倍に増加
Anthropic
OpenAI
プロジェクトにAIオートパイロット(YouTrackからGUIでの検証までのパイプライン)を導入しました。受理タスクのフローは週5件未満から約60件に増加し、そのうち4分の3をAIがクローズしています。新規依頼の数はほぼ3倍に増加し、半分のタスクは初回修正まで1日未満となっています。
チームは、YouTrackからのタスクをライブの2D/3D GUIでの検証まで処理するAIオートパイロットパイプラインを構築した。オートパイロット導入前は、プロジェクトは週あたり5件未満のタスクしか受け入れていなかったが、導入後は約60件となり、AIがその4分の3を処理した。新しいチケットの提出もほぼ3倍に増えたが、その理由の一部は、修正が迅速になったことで、ユーザーが問題を報告し始めたことにある。最初の修正までの中央値は、ほぼ3日から1日未満に短縮された。チームは700件以上のタスクのバックログを解消し、9ヶ月以上経過した144件を処理し、そのうちのほぼ3分の2が受け入れられた。しかし、再オープン率は約11%からより高い水準に上昇し、多くの場合、AIが生成した証明が説得力に欠けることが原因だった。これに対応するため、独立した監査パスを導入し、実行の約3分の1で作業を拒否し、誤って解釈されたタスクを検出した。このシステムは、ほぼ8週間で869時間稼働し、これはおよそフルタイムエンジニア2.8人分に相当する。月額サブスクリプション費用は約500ドルで、同等のトークンベースの価格設定は約5700ドルになる。Claudeはより安価だが厳格さが劣り、Codexはより高価だがGUI検証に優れていた。チームは、CodexをGUIパイロットの役割に移し、監査にはよりシンプルなモデルを使用する計画である。
出典: Habr — хаб ИИ —
原文
