---
name: 外部 site news / popular science feed scraping — systemic reject 永続原則 (5 turn 連続 evidence)
description: 2026-05-12 同日 5 turn 連続 verify で外部商業 / 学術団体 site は全て scraping reject (ブルーバックス / EurekAlert! / Phys.org / Nature). 「公的 / 非営利 / OSS license content のみ安全」 永続原則確立. 既存 4 source (arxiv-edu + github-edu + eric + edu-news) で十分判断
type: feedback
originSessionId: b19f90d8-a966-419c-881b-e32729748d40
---
# 外部 site news / popular science feed scraping — systemic reject 永続原則

## 制定 rule

将来 Rei が「外部 site の news / popular science feed を取り込む」 提案を受けた時、 以下の 2 段 gate を全て通すこと:

### Gate 1: source 性質 (商業 / 学術団体 / 公的 / OSS) 識別

| Source type | scraping 規定 default 期待 | Rei 採用 |
|---|---|---|
| **大手商業 出版社** (Nature / Springer / Elsevier / 講談社 / Wiley 等) | ❌ AI bot Disallow + ToS scraping 禁止 default | reject |
| **商業 news aggregator** (Phys.org / Science X / TechCrunch 等) | ❌ ToS scraping 禁止 + "No AI Training" 明示 default | reject |
| **学術団体非営利 site** (AAAS / EurekAlert! / IEEE Spectrum 等) | ❌ ToS scraping + content aggregation 明示禁止 default | reject |
| **政府 / 公的機関** (arXiv / NIH PMC / NASA ADS / ERIC 等) | ✅ 公的 public domain or CC license default | 採用可 |
| **OSS / 学術 OSS** (GitHub / HuggingFace / Zenodo 等) | ✅ MIT / Apache / CC license default | 採用可 |

### Gate 2: 実 verify protocol (採用検討時 必須)

1. **robots.txt fetch** — AI bot (ClaudeBot / GPTBot / anthropic-ai / Claude-Web) Disallow 確認
2. **ToS fetch** — scraping / "No AI Training" / content aggregation / non-commercial 条項確認
3. **公式 RSS feed 存在 verify** — RSS あれば scraping 不要 (但し RSS endpoint 利用も ToS 適用)
4. **academic exception 慎重 verify** — Rei use case (public site / commercial-eligible AGPL) に該当するか判定

## Why (5 turn 連続 reject evidence — 2026-05-12 同日 verify)

| Turn | 対象 | reject 理由 |
|---|---|---|
| Sulphur 2 無検閲動画 AI | 倫理 + brand + 法的 + 商業 model | (永続原則制定 提案 → 藤本さん明示 skip) |
| deepclaude / DeepSeek V4 Pro | privacy (中国 jurisdiction) + Anthropic ToS + quality | A path memory record + 導入 reject |
| **ブルーバックス scraping** (gendai.media) | **ToS 第 2 条第 12 号 scraping 明示禁止 + robots.txt AI bot Disallow + 生成 AI 学習禁止** | reject |
| **EurekAlert!** (AAAS) | **ToS Section 7 scraping + content aggregation 明示禁止** ("personal, non-commercial use only") | reject |
| **Phys.org / Science X** | **ToS Section 2「No AI Training」 + Section 1 scraping 禁止** (academic exception あるが Rei use case ambiguous) | reject |
| **Nature News** | **robots.txt 全 AI bot Disallow: /** (ClaudeBot / GPTBot / anthropic-ai / Claude-Web / ChatGPT-User 等 12+ entries) | reject |

→ **systemic pattern confirm**: 商業 + 学術団体 + 大手出版社 site の **scraping reject が default**.

## How to apply

### 即 reject 候補 (3 second judgment)

以下 site から「scraping / feed 統合提案」 を受けた場合、 **即 reject** (verify 不要):

- 大手商業出版社 site (Nature / Springer / Elsevier / Wiley / 講談社 / 角川 / etc)
- 商業 news aggregator (Phys.org / TechCrunch / The Verge / etc)
- 学術団体 site (AAAS EurekAlert! / IEEE Spectrum / etc)

### 採用検討候補 (Gate 2 verify 必要)

- 政府 / 公的機関 site (arxiv.org / ncbi.nlm.nih.gov / nasa.gov / ed.gov ERIC / data.gov / etc)
- OSS / 学術 OSS (GitHub API / HuggingFace API / Zenodo API / arxiv API / etc)
- 公的 RSS endpoint (NIH / EurekAlert! 公式 RSS ★ ただし ToS verify 必要)

### Rei 立場 (永続)

Rei は **AGPL-3.0 + Commercial license の責任ある開発者** 立場:
- 第三者 site の **ToS 遵守 + robots.txt 遵守** が前提
- ToS 違反 = brand 棄損 + 法的 risk + Rei vision (peace + honest) 破綻
- 「scraping できる」 ≠ 「scraping すべき」 (技術 ≠ 倫理)

## Rei 既存 4 source (継続採用 = 十分判断)

| Source | 性質 | license | 採用根拠 |
|---|---|---|---|
| **arxiv-edu** | arXiv public API (Cornell University 公的) | metadata CC0 + paper per author | ✅ 公的 / OSS-friendly |
| **github-edu** | GitHub Search API | GitHub public metadata | ✅ public API + 公式 |
| **eric** | ERIC (US Department of Education) public API | US government public domain | ✅ 公的政府 |
| **edu-news** | Inside Higher Ed + Hechinger + Hacker News 公式 RSS | 各 source 公式 RSS endpoint | ✅ 公式 RSS endpoint |

→ **既存 4 source 全て Gate 1 「政府 / 公的 / OSS / 公式 RSS endpoint」 該当**. systemic に compliant.

新 source 検討時の filter:
- ✅ 既存 4 source と同 layer (政府 / 公的 / 公式 RSS endpoint) → 検討可
- ❌ 商業 / 学術団体 scraping → 即 reject

## 採用可能 source 候補 (将来別 turn 検討用 retain)

### 公的 government / 非営利

- **NASA ADS** (Astrophysics Data System) — astronomy / physics paper metadata public API
- **PubMed Central (NIH)** — 生医学 paper open access
- **DOAJ (Directory of Open Access Journals)** — OA journal aggregator
- **CORE.ac.uk** — OA paper aggregator (250M+ papers)
- **Crossref REST** (STEP 1077 既達) — DOI metadata public
- **OpenAlex** (STEP 1077 fact-check 済 / 2026-02 API key 必須化) — 250M+ works (key 取得後採用検討可)

### OSS / 公式 RSS

- **arXiv RSS** (CS / Math / Physics tag 別) — 既達 path 拡張
- **Zenodo RSS** — 既達 (Rei publish 先 + paper aggregator)
- **HuggingFace trending API** — model / dataset trending

### 採用不可確定 (5 turn evidence)

- Nature / Springer / 講談社ブルーバックス / Phys.org / EurekAlert! / etc
- 大手商業 + 学術団体 site 全般

## 関連 memory

- `reference_bluebacks_scraping_tos_blocked_2026-05-12.md` (ブルーバックス reject 詳細)
- `reference_deepclaude_deepseek_v4_2026-05-12.md` (deepclaude reject 類例)
- `reference_anthropic_spacex_compute_2026-05-12.md` (Anthropic dependency reference)
- `feedback_silicon_asic_tape_out_out_of_scope.md` (scope 外 永続原則 template)
- `feedback_chat_claude_hallucination_warning.md` (情報共有 ≠ 採用提案 protocol)
- `feedback_quantum_naming_filter_framework.md` (Gate 1 #5 倫理 + scope 警戒)
- `feedback_no_rush_publication.md` (急がず ゆっくりと)

## 同日 5 turn 連続 reject pattern operational ROI

| 項目 | 評価 |
|---|---|
| 工数節約 | Phase 1 verify 各 15-30 分 × 5 source = ~2 時間 で **5 source 全 reject 発見**. Phase 2 実装 reject = **~10-15 時間 工数節約** |
| 永続原則 confidence | 5 例 evidence で **「商業 + 学術団体 scraping reject」 systemic pattern** = 将来即 reject 判断可能 |
| Rei brand 強化 | ToS / robots.txt 遵守の責任ある開発者立場 evidence-based 確立 |
| Pattern 4 (永続原則違反 reject) operational | 「商業 site scraping 統合」 は将来 chat Claude / 第三者から再提案された時の **即 reject 根拠** (5 例 evidence) |
| 「情報共有 ≠ 採用提案」 protocol 検証 | 6 turn 連続 (Sulphur 2 + deepclaude + ブルーバックス + EurekAlert! + Phys.org + Nature) で operational 確立 |

→ **段階 path (lite verify → 段階判断)** が overshoot 防止 + 工数節約の operational ROI 高い実例.
