llms.txtバリデータを64のテスト付きで作成 — ボットがこのファイルを読むか検証
著者はllms.txtのジェネレーターとバリデータを作成し、64のテストを実行しました。その結果、AIボットがこのファイルをリクエストすることはまれで、5億1500万件のボットイベントのうちわずか408件のみでした。このバリデータは、仕様に準拠しているか確認するのに役立ちますが、仕様はしばしば違反されています。
Habrに掲載された記事では、サイトの要約を言語モデルに提供するための提案標準であるllms.txtファイル用のバリデータとジェネレータの開発について説明しています。著者は64件のテストを実施し、AIボットがllms.txtを要求することはまれであることを発見しました。Limy.aiの2026年5月の分析では、90日間の約5億1500万件のボットイベントのうち、わずか408件の要求が確認されました。それにもかかわらず、実際のファイルでは仕様がしばしば違反されているため(タイトル欠落、複数のH1、httpリンクなどの問題)、バリデータは有用であることが証明されました。パーサーは解析と検証を分離しており、検証スコアは100から重み付きペナルティ(重大40、高25、中12、低5)を減算して算出します。テストスイートは22の特定ルールとエッジケースをカバーし、43ミリ秒で実行されます。著者は、llms.txtをAI回答への保証された道ではなく、安価な保険として使用することを推奨し、公開前にファイル構造を確認することをアドバイスしています。
出典: Habr — хаб ИИ —
原文
