docs: README an modulare Architektur angepasst

This commit is contained in:
2026-04-04 15:47:40 +02:00
parent d4f76692db
commit fc387b379a

View File

@@ -4,22 +4,22 @@ Ein automatisiertes Überwachungswerkzeug für Webseiten und Nachrichtenportale,
## 🚀 Kernfunktionen ## 🚀 Kernfunktionen
- **Intelligente KI-Analyse:** Nutzt die Gemini-CLI (Sitzung 1), um Textänderungen aus einer dezidiert linken, antifaschistischen Perspektive zu bewerten. - **Intelligente KI-Analyse:** Nutzt die Gemini-CLI, um Textänderungen aus einer dezidiert linken, antifaschistischen Perspektive zu bewerten.
- **Geografische Hierarchie:** Priorisiert Meldungen aus dem Kerngebiet (Pfarrkirchen, Eggenfelden) und dem Landkreis Rottal-Inn gegenüber landesweiten News. - **Geografische Hierarchie:** Priorisiert Meldungen aus dem Kerngebiet (Pfarrkirchen, Eggenfelden) und dem Landkreis Rottal-Inn.
- **Cloudflare-Bypass:** Dank `cloudscraper` werden auch durch Cloudflare geschützte Seiten (z.B. AfD-Fraktionen) zuverlässig ausgelesen. - **Cloudflare-Bypass:** Dank `cloudscraper` werden auch geschützte Seiten zuverlässig ausgelesen.
- **Deep-Analysis & Link-Veredelung:** Extrahiert Links aus neuen Artikeln. Die KI bewertet den Kontext und schickt den direkten Link zum Volltext an das Endgerät. - **Worker-Architektur:** Modulares Design mit parallelen Analyzer-Instanzen (konfigurierbar) und dediziertem Notifier.
- **ntfy-Benachrichtigungen:** - **Effiziente Datenhaltung:** Nutzt eine SQLite-Datenbank zur Verwaltung von Analyse-Jobs und deren Status.
- **Public Kanal:** Relevante politische News (ohne Passwort lesbar). - **ntfy- & Signal-Benachrichtigungen:**
- **Admin Kanal:** Technische Fehler und Statusmeldungen (Passwort-geschützt). - **Public Kanal:** Relevante politische News.
- **Priorisierung:** Nutzt ntfy-Prioritäten (1-5) für unterschiedliche Vibrations- und Soundmuster je nach Wichtigkeit. - **Admin Kanal:** Technische Fehler, Website-Ausfälle und Statusmeldungen (Passwort-geschützt).
## 🛠 Technische Details ## 🛠 Technische Details
- **Sprache:** Python 3 - **Sprache:** Python 3
- **Bibliotheken:** `cloudscraper`, `BeautifulSoup4`, `requests` - **Bibliotheken:** `cloudscraper`, `BeautifulSoup4`, `requests`
- **KI-Integration:** Gemini Pro via CLI - **KI-Integration:** Gemini Pro via CLI
- **Datenhaltung:** `results.json` (speichert den letzten Stand der Webseiten) - **Datenhaltung:** SQLite (`polit_scraper.db`)
- **Konfiguration:** `urls.txt` (Liste der Ziel-URLs) und `gemini_instructions.md` (KI-Regelwerk) - **Konfiguration:** `urls.txt` (Ziel-URLs), `gemini_instructions.md` (KI-Regelwerk) und `.env` (Zugangsdaten & Einstellungen)
## 📋 Installation & Setup ## 📋 Installation & Setup
@@ -27,13 +27,19 @@ Ein automatisiertes Überwachungswerkzeug für Webseiten und Nachrichtenportale,
```bash ```bash
pip install cloudscraper beautifulsoup4 requests --break-system-packages pip install cloudscraper beautifulsoup4 requests --break-system-packages
``` ```
2. **Gemini-CLI vorbereiten:** 2. **Konfiguration (`.env`):**
Eine Sitzung mit Index 1 erstellen und die `gemini_instructions.md` als System-Prompt einlesen. Erstelle eine `.env`-Datei basierend auf `.env.example` und setze deine Zugangsdaten sowie `MAX_ANALYZER_WORKERS`.
3. **Ziele definieren:** 3. **Ziele definieren:**
URLs in die `urls.txt` eintragen (eine pro Zeile). URLs in die `urls.txt` eintragen (eine pro Zeile).
4. **Starten:** 4. **Starten:**
Der `crawler.py` steuert automatisch die Analyzer-Worker und den Notifier:
```bash ```bash
python3 web_check.py python3 crawler.py
```
5. **Überwachung:**
Nutze den Live-Monitor für den Status der Abarbeitung:
```bash
python3 monitor.py
``` ```
## ⚖️ Lizenz & Zweck ## ⚖️ Lizenz & Zweck