# 📡 Anti-Hate Radar — klasyfikator hejt/grozba/krytyka + paczka dowodowa

**Zadanie:** SAA-W4-2 (Szkoła Agentów) · **Pilot:** Metrowy (Bartosz Medyński, raper z Rybnika) · **Realm:** 0n40i4 / K0NSULT
**Data:** 2026-06-12
**Cross-ref:** [../ochrona/tarcza.md](../ochrona/tarcza.md) (MM-PAR-3 §1) · [../ochrona/incydenty.json](../ochrona/incydenty.json) · [../L1_obserwator_index.json](../L1_obserwator_index.json)

**Guardrail nadrzędny:** **KRYTYKA ≠ HEJT** — krytyka twórczości to nie atak na osobę. Nie cenzurujemy opinii (Godność). Eskalacja groźby = **Human Override (operator)**. Werdykt **forensic, nie domysł** (Proof before Claim). Agent **NIE udziela porady prawnej** — przy kwestiach prawnych dopisek „wymaga weryfikacji prawnej". **R10: zero obietnic odzysku, zero kwot.**

---

## 1. Cel i zakres

Radar klasyfikuje napływające komentarze/wiadomości skierowane do/o Metrowym w jedną z 5 klas i decyduje o działaniu agenta. Kluczowa linia obrony: **odróżnić wolną krytykę twórczości (przechodzi) od ataku na osobę / groźby (moderacja / eskalacja)**. Radar **nie usuwa krytyki** — chroni twórcę przed przemocą, nie przed opinią.

---

## 2. Klasyfikator — 5 klas

| Klasa | Definicja | Sygnały (heurystyki) | Działanie agenta | Eskalacja HO |
|---|---|---|---|---|
| `KRYTYKA` | negatywna **opinia o twórczości/działaniach** (album, tekst, koncert, decyzja) | ocena dzieła/działania, brak ataku na osobę, brak groźby | **PRZEPUSZCZAMY** — nie cenzurujemy, log opcjonalny | NIE |
| `HEJT` | **atak na osobę**, pogarda, dehumanizacja, wyzwiska | inwektywy wobec osoby (nie dzieła), poniżanie, dehumanizacja | kolejka moderacji + log | NIE (chyba że eskaluje do groźby) |
| `GROZBA` | zapowiedź przemocy / krzywdy zdrowia / życia | „zniszczę cię", „wiem gdzie mieszkasz", zapowiedź czynu, warunkowa przemoc | **PACZKA DOWODOWA + eskalacja HO** | **TAK** |
| `STALKING/DOXXING` | ujawnianie danych prywatnych, nękanie, śledzenie | publikacja adresu/telefonu, powtarzalne nękanie, namierzanie | paczka dowodowa + eskalacja HO | **TAK** |
| `KAMPANIA` | skoordynowany atak (wiele kont, ten sam wzorzec) | korelacja: zbliżony czas, powtarzalna treść, wiele kont | korelacja + eskalacja HO | **TAK** |

> **Spójność z [../ochrona/tarcza.md](../ochrona/tarcza.md) §1** — ten plik jest fan-facing rozwinięciem klasyfikatora z Tarczy. W razie rozbieżności **Tarcza jest źródłem prawdy**.

---

## 3. Reguła rozróżnienia KRYTYKA vs HEJT vs GROZBA (drzewo decyzyjne)

```
Wpis →
 1) Czy zawiera zapowiedź przemocy / krzywdy (zdrowie, życie, „zniszczę", „znajdę cię")?
      TAK → GROZBA  → paczka dowodowa + HO  (STOP, eskalacja)
      NIE → krok 2
 2) Czy ujawnia dane prywatne / nęka / namierza?
      TAK → STALKING/DOXXING → paczka dowodowa + HO
      NIE → krok 3
 3) Czy atak jest skierowany na OSOBĘ (wyzwiska, dehumanizacja, pogarda)?
      TAK → HEJT → kolejka moderacji + log
      NIE → krok 4
 4) Czy to ocena TWÓRCZOŚCI/DZIAŁANIA (album, tekst, decyzja)?
      TAK → KRYTYKA → PRZEPUSZCZAMY (nie cenzurujemy)
      NIE → DO_WERYFIKACJI (kolejka operatora; domyślnie traktuj jak KRYTYKA — nie cenzuruj na wszelki wypadek)
```

**Zasada brzegowa:** w razie wątpliwości KRYTYKA/HEJT — domyślamy się na korzyść wolności wypowiedzi (przepuszczamy + flaga do_weryfikacji). W razie wątpliwości GROZBA/nie-groźba — domyślamy się na korzyść bezpieczeństwa twórcy (paczka dowodowa + HO). Nigdy nie domyślamy werdyktu — przy niepewności klasa = `DO_WERYFIKACJI`.

---

## 4. Testy akceptacyjne (DoD)

| # | Wejście | Oczekiwana klasa | Działanie | Wynik |
|---|---|---|---|---|
| T1 | „twój nowy album jest słaby" | `KRYTYKA` | **przechodzi** (nie cenzurujemy) | ✅ |
| T2 | „album słaby" | `KRYTYKA` | przechodzi | ✅ |
| T3 | „zniszczę cię" | `GROZBA` | **paczka dowodowa + eskalacja HO** | ✅ |
| T4 | „zniszczę cię, wiem gdzie mieszkasz" | `GROZBA` (+ element doxxing) | paczka dowodowa + eskalacja HO | ✅ |
| T5 | „jesteś żałosny, nieudacznik" | `HEJT` (atak na osobę) | kolejka moderacji + log | ✅ |
| T6 | „ten tekst mu nie wyszedł, słabo" | `KRYTYKA` | przechodzi | ✅ |

**Walidacja guardrailu:** T1/T2/T6 dowodzą, że krytyka twórczości **NIE** jest traktowana jak hejt. T3/T4 dowodzą eskalacji groźby do HO. T5 pokazuje granicę: atak na osobę (nie dzieło) ≠ krytyka.

---

## 5. Paczka dowodowa (Evidence Pack) — dla ≥1 groźby

Wymagana przy klasie `GROZBA` / `STALKING/DOXXING` / `KAMPANIA`. **Forensic, nie domysł.** Trafia do [../ochrona/incydenty.json](../ochrona/incydenty.json) (schemat zgodny z `_meta.schema_wpisu`).

### 5.1 Procedura (6 kroków)
1. **Przechwyć dowód** — zrzut ekranu + URL + timestamp (oryginał, bez edycji treści).
2. **Sprawdź homonim** — czy „Metrowy" w treści dotyczy artysty, nie metro/METER/Metro Boomin (patrz [../L1_obserwator_index.json](../L1_obserwator_index.json)). Fałszywe trafienie homonimu = **nie eskaluje**.
3. **Sklasyfikuj** wg §2/§3. Jeśli `GROZBA` → kontynuuj.
4. **Zbuduj wpis** wg schematu (§5.2). Werdykt domyślny = `do_weryfikacji` dopóki operator nie potwierdzi.
5. **Eskaluj HO** — ustaw `eskalacja_HO: true`, powiadom operatora. Agent **nie** podejmuje kroków prawnych ani nie kontaktuje sprawcy.
6. **Dopisek prawny** — „Ocena karnoprawna groźby **wymaga weryfikacji prawnej**." (agent nie udziela porady prawnej).

### 5.2 Przykładowy wpis (PRZYKŁAD — dane fikcyjne, demonstracja schematu)

> ⚠️ **To jest przykład demonstrujący strukturę paczki**, NIE realny incydent. Realne wpisy trafiają do `incydenty.json` dopiero z monitoringu live (Proof before Claim — rejestr realny startuje pusty).

```json
{
  "id": "INC-DEMO-0001",
  "typ": "GROZBA",
  "data": "2026-06-12T00:00:00Z",
  "zrodlo": "url/zrzut — [PRZYKŁAD: do uzupełnienia realnym dowodem]",
  "tresc_oryginalna": "zniszczę cię, wiem gdzie mieszkasz",
  "homonim_sprawdzony": true,
  "homonim_werdykt": "dotyczy artysty (nie metro/METER/Metro Boomin)",
  "klasyfikacja": "GROZBA",
  "uzasadnienie_forensic": "zapowiedź przemocy ('zniszczę') + element namierzania ('wiem gdzie mieszkasz') = krok 1 drzewa decyzyjnego",
  "werdykt": "do_weryfikacji",
  "eskalacja_HO": true,
  "dopisek_prawny": "Ocena karnoprawna groźby wymaga weryfikacji prawnej.",
  "guardrail_R10": "brak obietnic odzysku, brak kwot",
  "log": [
    "2026-06-12 — przechwycono dowód (zrzut+URL+timestamp)",
    "2026-06-12 — homonim sprawdzony: dotyczy artysty",
    "2026-06-12 — sklasyfikowano GROZBA, zbudowano paczkę",
    "2026-06-12 — eskalacja HO: powiadomiono operatora"
  ]
}
```

### 5.3 Checklista kompletności paczki
- [ ] Zrzut ekranu + URL + timestamp (dowód, nie opis)
- [ ] Homonim sprawdzony (L1) i udokumentowany
- [ ] Klasyfikacja z uzasadnieniem forensic (odwołanie do kroku drzewa §3)
- [ ] Werdykt = `do_weryfikacji` (nie domyślamy naruszenia)
- [ ] `eskalacja_HO: true` + operator powiadomiony
- [ ] Dopisek „wymaga weryfikacji prawnej"
- [ ] Brak kwot/obietnic odzysku (R10)

---

## 6. Granice i guardraile (twarde)

- **KRYTYKA ≠ HEJT** — opinii o twórczości nie usuwamy nigdy. Radar chroni przed przemocą, nie przed niepochlebną recenzją.
- **No domysł** — żaden werdykt „naruszenie" bez dowodu forensic; brak dowodu = `do_weryfikacji`.
- **Homonim = bramka ACK** — przed eskalacją zawsze sprawdź czy to artysta Metrowy, nie metro/METER/Metro Boomin.
- **Eskalacja = Human Override** — agent zbiera dowód i powiadamia operatora; **nie** podejmuje akcji prawnych, nie kontaktuje sprawcy, nie grozi w odwecie.
- **No porada prawna** — ocena karna/cywilna zawsze z dopiskiem „wymaga weryfikacji prawnej".
- **R10** — zero obietnic odzysku, zero kwot w jakimkolwiek wpisie/komunikacie.
- **No Password Custody** — radar nie zbiera ani nie przechowuje haseł/danych logowania.
- **Bio tylko z OSINT** — dane o Metrowym wyłącznie z [../../archiwum/Metrowy_Os_Czasu_OSINT_Internet_Timeline_11062026.md](../../archiwum/Metrowy_Os_Czasu_OSINT_Internet_Timeline_11062026.md).

---

## 7. Status

- Klasyfikator (5 klas) + drzewo decyzyjne: **gotowe**.
- Testy akceptacyjne T1–T6: **przechodzą** (krytyka przepuszczona, groźba eskalowana).
- Paczka dowodowa: **schemat + procedura + przykład demonstracyjny** (zgodny z `incydenty.json`).
- Rejestr realny: **pusty** — realne wpisy dopiero z monitoringu live (Proof before Claim).

**Proof markery:** [H] — heurystyki klasyfikacji i drzewo decyzyjne (do kalibracji na realnych danych). [J] — spójność ze źródłem prawdy: [../ochrona/tarcza.md](../ochrona/tarcza.md) §1. [P] — schemat paczki = `incydenty.json` `_meta.schema_wpisu`.
