diff --git a/README.md b/README.md index 817750d..6fbb092 100644 --- a/README.md +++ b/README.md @@ -4,22 +4,22 @@ Ein automatisiertes Überwachungswerkzeug für Webseiten und Nachrichtenportale, ## 🚀 Kernfunktionen -- **Intelligente KI-Analyse:** Nutzt die Gemini-CLI (Sitzung 1), um Textänderungen aus einer dezidiert linken, antifaschistischen Perspektive zu bewerten. -- **Geografische Hierarchie:** Priorisiert Meldungen aus dem Kerngebiet (Pfarrkirchen, Eggenfelden) und dem Landkreis Rottal-Inn gegenüber landesweiten News. -- **Cloudflare-Bypass:** Dank `cloudscraper` werden auch durch Cloudflare geschützte Seiten (z.B. AfD-Fraktionen) zuverlässig ausgelesen. -- **Deep-Analysis & Link-Veredelung:** Extrahiert Links aus neuen Artikeln. Die KI bewertet den Kontext und schickt den direkten Link zum Volltext an das Endgerät. -- **ntfy-Benachrichtigungen:** - - **Public Kanal:** Relevante politische News (ohne Passwort lesbar). - - **Admin Kanal:** Technische Fehler und Statusmeldungen (Passwort-geschützt). - - **Priorisierung:** Nutzt ntfy-Prioritäten (1-5) für unterschiedliche Vibrations- und Soundmuster je nach Wichtigkeit. +- **Intelligente KI-Analyse:** Nutzt die Gemini-CLI, um Textänderungen aus einer dezidiert linken, antifaschistischen Perspektive zu bewerten. +- **Geografische Hierarchie:** Priorisiert Meldungen aus dem Kerngebiet (Pfarrkirchen, Eggenfelden) und dem Landkreis Rottal-Inn. +- **Cloudflare-Bypass:** Dank `cloudscraper` werden auch geschützte Seiten zuverlässig ausgelesen. +- **Worker-Architektur:** Modulares Design mit parallelen Analyzer-Instanzen (konfigurierbar) und dediziertem Notifier. +- **Effiziente Datenhaltung:** Nutzt eine SQLite-Datenbank zur Verwaltung von Analyse-Jobs und deren Status. +- **ntfy- & Signal-Benachrichtigungen:** + - **Public Kanal:** Relevante politische News. + - **Admin Kanal:** Technische Fehler, Website-Ausfälle und Statusmeldungen (Passwort-geschützt). ## 🛠 Technische Details - **Sprache:** Python 3 - **Bibliotheken:** `cloudscraper`, `BeautifulSoup4`, `requests` - **KI-Integration:** Gemini Pro via CLI -- **Datenhaltung:** `results.json` (speichert den letzten Stand der Webseiten) -- **Konfiguration:** `urls.txt` (Liste der Ziel-URLs) und `gemini_instructions.md` (KI-Regelwerk) +- **Datenhaltung:** SQLite (`polit_scraper.db`) +- **Konfiguration:** `urls.txt` (Ziel-URLs), `gemini_instructions.md` (KI-Regelwerk) und `.env` (Zugangsdaten & Einstellungen) ## 📋 Installation & Setup @@ -27,13 +27,19 @@ Ein automatisiertes Überwachungswerkzeug für Webseiten und Nachrichtenportale, ```bash pip install cloudscraper beautifulsoup4 requests --break-system-packages ``` -2. **Gemini-CLI vorbereiten:** - Eine Sitzung mit Index 1 erstellen und die `gemini_instructions.md` als System-Prompt einlesen. +2. **Konfiguration (`.env`):** + Erstelle eine `.env`-Datei basierend auf `.env.example` und setze deine Zugangsdaten sowie `MAX_ANALYZER_WORKERS`. 3. **Ziele definieren:** URLs in die `urls.txt` eintragen (eine pro Zeile). 4. **Starten:** + Der `crawler.py` steuert automatisch die Analyzer-Worker und den Notifier: ```bash - python3 web_check.py + python3 crawler.py + ``` +5. **Überwachung:** + Nutze den Live-Monitor für den Status der Abarbeitung: + ```bash + python3 monitor.py ``` ## ⚖️ Lizenz & Zweck