twin3 · Agent-Ready 量測

AI 爬蟲來訪檢測器

貼上你的 nginx access log,看 Claude / GPT / Bing 等 AI 機器人到底有沒有來過你的網站。我們分成三層:訓練爬蟲(被抓 ≠ 被引用)、索引爬蟲(可能被引用)、以及 ⭐ 真人即時 browse(最接近真實被引用的訊號),並把偽造 UA 的掃描器排除掉。

.log / .txt 檔拖到這裡,或點擊選檔(僅讀純文字,不上傳到別處;不支援 .gz)
隱私:日誌只在這次請求裡即時分析,不會存到伺服器或硬碟。每次分析最多讀前 ~2MB / 20,000 行。
想自己在伺服器上跑?用 Claude Code / grep 兩行就好

不想貼 log?在你自己的 server 上直接撈 AI 爬蟲紀錄:

# 一行 grep:列出所有 AI bot 來訪
grep -iE "ClaudeBot|Claude-User|Claude-SearchBot|GPTBot|ChatGPT-User|OAI-SearchBot|PerplexityBot|Perplexity-User|Googlebot|Google-Extended|bingbot|Bytespider|CCBot" \
  /var/log/nginx/access.log

# 只看 ⭐ 真人即時 browse(最接近真實被引用)
grep -iE "Claude-User|ChatGPT-User|Perplexity-User" /var/log/nginx/access.log

或把這段貼給 Claude Code:

讀 /var/log/nginx/access.log,找出所有 AI 爬蟲(ClaudeBot、GPTBot、
PerplexityBot、Googlebot、bingbot、Bytespider、CCBot…)的來訪,
分成「訓練爬蟲 / 索引爬蟲 / 真人即時 browse(*-User)」三層,
把宣稱 AI UA 卻打 /.env、/wp-admin、/.git 的偽造掃描器標出來並排除,
時間轉成台北時間 (UTC+8),最後用表格回報每隻 bot 的次數、最常抓的頁、首末來訪。
怎麼解讀(誠實版):
· 訓練爬蟲來訪 ≠ 被引用 —— ClaudeBot / GPTBot / CCBot 是去收訓練語料,被抓不代表會出現在答案裡。
· 即時 browse(*-User)= 最接近真實被引用的訊號 —— 那是真人在 AI 對話中,AI 即時去抓了你的頁。
· IP 來源:本工具離線、零依賴,無法做即時 ASN 查詢;未經 ASN 驗證一律標 外部/未驗證,絕不杜撰來源。