docs: README an modulare Architektur angepasst
This commit is contained in:
32
README.md
32
README.md
@@ -4,22 +4,22 @@ Ein automatisiertes Überwachungswerkzeug für Webseiten und Nachrichtenportale,
|
||||
|
||||
## 🚀 Kernfunktionen
|
||||
|
||||
- **Intelligente KI-Analyse:** Nutzt die Gemini-CLI (Sitzung 1), um Textänderungen aus einer dezidiert linken, antifaschistischen Perspektive zu bewerten.
|
||||
- **Geografische Hierarchie:** Priorisiert Meldungen aus dem Kerngebiet (Pfarrkirchen, Eggenfelden) und dem Landkreis Rottal-Inn gegenüber landesweiten News.
|
||||
- **Cloudflare-Bypass:** Dank `cloudscraper` werden auch durch Cloudflare geschützte Seiten (z.B. AfD-Fraktionen) zuverlässig ausgelesen.
|
||||
- **Deep-Analysis & Link-Veredelung:** Extrahiert Links aus neuen Artikeln. Die KI bewertet den Kontext und schickt den direkten Link zum Volltext an das Endgerät.
|
||||
- **ntfy-Benachrichtigungen:**
|
||||
- **Public Kanal:** Relevante politische News (ohne Passwort lesbar).
|
||||
- **Admin Kanal:** Technische Fehler und Statusmeldungen (Passwort-geschützt).
|
||||
- **Priorisierung:** Nutzt ntfy-Prioritäten (1-5) für unterschiedliche Vibrations- und Soundmuster je nach Wichtigkeit.
|
||||
- **Intelligente KI-Analyse:** Nutzt die Gemini-CLI, um Textänderungen aus einer dezidiert linken, antifaschistischen Perspektive zu bewerten.
|
||||
- **Geografische Hierarchie:** Priorisiert Meldungen aus dem Kerngebiet (Pfarrkirchen, Eggenfelden) und dem Landkreis Rottal-Inn.
|
||||
- **Cloudflare-Bypass:** Dank `cloudscraper` werden auch geschützte Seiten zuverlässig ausgelesen.
|
||||
- **Worker-Architektur:** Modulares Design mit parallelen Analyzer-Instanzen (konfigurierbar) und dediziertem Notifier.
|
||||
- **Effiziente Datenhaltung:** Nutzt eine SQLite-Datenbank zur Verwaltung von Analyse-Jobs und deren Status.
|
||||
- **ntfy- & Signal-Benachrichtigungen:**
|
||||
- **Public Kanal:** Relevante politische News.
|
||||
- **Admin Kanal:** Technische Fehler, Website-Ausfälle und Statusmeldungen (Passwort-geschützt).
|
||||
|
||||
## 🛠 Technische Details
|
||||
|
||||
- **Sprache:** Python 3
|
||||
- **Bibliotheken:** `cloudscraper`, `BeautifulSoup4`, `requests`
|
||||
- **KI-Integration:** Gemini Pro via CLI
|
||||
- **Datenhaltung:** `results.json` (speichert den letzten Stand der Webseiten)
|
||||
- **Konfiguration:** `urls.txt` (Liste der Ziel-URLs) und `gemini_instructions.md` (KI-Regelwerk)
|
||||
- **Datenhaltung:** SQLite (`polit_scraper.db`)
|
||||
- **Konfiguration:** `urls.txt` (Ziel-URLs), `gemini_instructions.md` (KI-Regelwerk) und `.env` (Zugangsdaten & Einstellungen)
|
||||
|
||||
## 📋 Installation & Setup
|
||||
|
||||
@@ -27,13 +27,19 @@ Ein automatisiertes Überwachungswerkzeug für Webseiten und Nachrichtenportale,
|
||||
```bash
|
||||
pip install cloudscraper beautifulsoup4 requests --break-system-packages
|
||||
```
|
||||
2. **Gemini-CLI vorbereiten:**
|
||||
Eine Sitzung mit Index 1 erstellen und die `gemini_instructions.md` als System-Prompt einlesen.
|
||||
2. **Konfiguration (`.env`):**
|
||||
Erstelle eine `.env`-Datei basierend auf `.env.example` und setze deine Zugangsdaten sowie `MAX_ANALYZER_WORKERS`.
|
||||
3. **Ziele definieren:**
|
||||
URLs in die `urls.txt` eintragen (eine pro Zeile).
|
||||
4. **Starten:**
|
||||
Der `crawler.py` steuert automatisch die Analyzer-Worker und den Notifier:
|
||||
```bash
|
||||
python3 web_check.py
|
||||
python3 crawler.py
|
||||
```
|
||||
5. **Überwachung:**
|
||||
Nutze den Live-Monitor für den Status der Abarbeitung:
|
||||
```bash
|
||||
python3 monitor.py
|
||||
```
|
||||
|
||||
## ⚖️ Lizenz & Zweck
|
||||
|
||||
Reference in New Issue
Block a user