Intranet-Crawler · 4 Min. Lesezeit
Leitfaden zur Installation und Konfiguration
Schritt-für-Schritt-Anleitung zur Einrichtung des Intranet-Crawlers für deine Organisation.
Diese Anleitung führt dich durch den kompletten Setup-Prozess für den Intranet-Crawler, von der initialen Konfiguration bis zur Aktivierung des Tools für deine Assistenten. Das Setup erfordert Zusammenarbeit mit unserem technischen Team bei Intric — es gibt keinen Selbstbedienungs-Onboarding-Prozess.
Für einen High-Level-Überblick über Funktionen und Sicherheit siehe den Artikel unten.
Voraussetzungen
Abschnitt betitelt „Voraussetzungen“Stelle vor dem Setup sicher, dass folgende Punkte erfüllt sind:
- Du hast identifiziert, welche Intranet-Inhalte indexiert werden sollen
- Du hast einen Benutzerkonto (oder Login-Konto) mit geeigneten Berechtigungen auf deinem Intranet erstellt oder identifiziert
- Dein Intranet ist über HTTPS erreichbar
- Du verstehst die Authentifizierungsanforderungen deines Intranets
Schritt 1: Das Crawler-Admin-Panel erreichen
Abschnitt betitelt „Schritt 1: Das Crawler-Admin-Panel erreichen“Navigiere zu https://mcp-servers.intric.ai/<kunde>-intranet/admin in deinem Browser. Das Panel ist durch HTTP Basic-Authentifizierung geschützt — verwende die Anmeldeinformationen, die dir während deines Onboardings bereitgestellt wurden. Das Panel ist schwedisch-first mit einem Englisch-Toggle.
Hinweis: Der MCP-Endpoint unter
https://mcp-servers.intric.ai/<kunde>-intranet/mcphat ein separates IP-basiertes Access-Gate. Wenn du das Panel nicht erreichen kannst, überprüfe mit Intric, ob deine eingehenden IP-Adressen auf der Allowlist stehen.
Schritt 2: Serverkonfiguration überprüfen
Abschnitt betitelt „Schritt 2: Serverkonfiguration überprüfen“Der Crawler wurde bereits während des Onboardings mit seiner Server-URL konfiguriert. Die URL folgt dem Muster https://mcp-servers.intric.ai/<kunde>-intranet/mcp, wobei <kunde> deine Kundenidentifikator ist (z.B. /varberg-intranet, /lidkoping, /oslo).
Wenn du den Crawler in deinem eigenen Cluster betreibst, folgt die URL deinem eigenen Infrastruktur-Muster.
Dein API-Schlüssel — ein 365-tägiges signiertes Token, das von einem Intric-Ingenieur aus dem Kunden-Deployment-Secret gemint wird — ist bereits konfiguriert. Du kannst ihn nicht selbst erneuern — kontaktiere den Intric-Support, wenn er erneuert werden muss.
Schritt 3: Crawl-Ziele konfigurieren
Abschnitt betitelt „Schritt 3: Crawl-Ziele konfigurieren“Navigiere im Crawler-Admin-Panel zum Bereich Ziele.
Du konfigurierst zwei Einstellungen:
URL-Präfix
Abschnitt betitelt „URL-Präfix“Setze url_filter_prefix auf eine einzelne Präfix-Zeichenkette. Dies ist der Basis-Pfad, dem der Crawler folgen wird. Gib die Root-URL deines Intranets oder eines bestimmten Bereichs ein.
Beispiel:
url_filter_prefix: https://intranet.deinefirma.de/handbuchURL-Ausschlüsse
Abschnitt betitelt „URL-Ausschlüsse“Setze exclude_url_patterns auf eine Liste von Substring-Mustern. Jede URL, die einen dieser Substrings enthält, wird ausgeschlossen. Keine Glob-Syntax — dies sind einfache Substring-Matches.
Beispiel:
exclude_url_patterns: - /archiv/ - /entwurf/Diese Einstellungen werden in /data/crawler_config.json auf dem Deployment geschrieben.
Schritt 4: Authentifizierung für den Crawler konfigurieren
Abschnitt betitelt „Schritt 4: Authentifizierung für den Crawler konfigurieren“Der Crawler unterstützt formularbasiertes Login zu deinem Intranet. Er verarbeitet:
- Generische CMS-Login-Formulare
- Sitevision-Portlets
- Multi-Step Azure AD / Entra SAML-Flows, einschließlich “Angemeldet bleiben?”-Interstitium
Gib die Anmeldeinformationen für das Konto an, das der Crawler verwenden soll. Einige Deployments crawlen öffentliche Websites ohne jegliche Login.
Unterstützte Dateitypen: Der Crawler erkennt und indexiert .docx, .xlsx, .pdf und .txt-Dateien. Beachte, dass .doc- und .xls-Dateien erkannt, aber stillschweigend übersprungen werden. Die Dokumentextraktion hat folgende Grenzen:
- 10 MB hardcoded Download-Grenze für Dokumente
- 20 MB konfigurierbare Größenbegrenzung (per-Deployment-Umgebungsvariable)
- PDFs werden nur bis Seite 20 gelesen
- Extrahierter Text wird bei 300.000 Zeichen abgeschnitten
Nicht unterstützt: Der Crawler verarbeitet keine CAPTCHA oder gerätebasierte Zwei-Faktor-Authentifizierung.
Schritt 5: Dokumentextraktions-Einstellungen
Abschnitt betitelt „Schritt 5: Dokumentextraktions-Einstellungen“Im Crawler-Admin-Panel gibt es eine einzige Dokumentextraktions-Kontrolle: eine Ein/Aus-Checkbox. Dateitypen sind hardcoded (siehe oben). Größenbegrenzungen werden per-Deployment über Umgebungsvariablen gesetzt, nicht über das UI.
Schritt 6: Crawl-Plan konfigurieren
Abschnitt betitelt „Schritt 6: Crawl-Plan konfigurieren“Der Standard-Vollcrawl wird einmal täglich um 02:00 Uhr UTC ausgeführt.
Ein zweiter geplanter Job führt einen inkrementellen News-Crawl alle 30 Minuten durch. Um ein Intervall zu ändern, musst du den Pod neu starten.
Für den Pre-crawled Data Mode sind Updates manuell — sende eine neue Datendatei, wenn sich Inhalte ändern. Geplante Crawls werden in diesem Modus vollständig übersprungen.
Schritt 7: Crawl testen
Abschnitt betitelt „Schritt 7: Crawl testen“Das Crawler-Admin-Panel bietet vier Buttons zum Testen:
- Full Crawl — alle konfigurierten Ziele crawlen
- Test Crawl (eine Seite) — eine einzelne Seite crawlen, um die Konfiguration zu überprüfen
- News Crawl — den inkrementellen News-Crawl auslösen
- Extra-Quellen-Crawl — zusätzliche konfigurierte Quellen crawlen
Dies sind die einzigen Betriebskontrollen im Panel. Es gibt keinen “Verbindung testen”-Button.
Schritt 8: Das Tool für deine Assistenten aktivieren
Abschnitt betitelt „Schritt 8: Das Tool für deine Assistenten aktivieren“Sobald die Konfiguration abgeschlossen und getestet ist:
- Navigiere zum Bereich Tools in deinem Intric Space
- Finde den Intranet-Crawler in der Liste der verfügbaren Tools
- Aktiviere ihn für Assistenten in diesem Space
- Konfiguriere Sicherheitsklassifizierungseinstellungen falls erforderlich
Das Tool ist nun zur Verwendung verfügbar.
Korrekturen verwalten
Abschnitt betitelt „Korrekturen verwalten“Im Crawler-Admin-Panel navigiere zum Korrekturen-Bereich, der eine Pending-Count-Badge anzeigt.
Optionen für jede ausstehende Korrektur:
- Accept — Die Korrektur sofort indexieren. Akzeptierte Korrekturen haben Vorrang vor gecrawlten Inhalten in zukünftigen Antworten.
- Edit — Die Korrektur bearbeiten und in einem Schritt akzeptieren.
- Deny — Die Korrektur ablehnen.
Fehlerbehebung
Abschnitt betitelt „Fehlerbehebung“| Problem | Lösung |
|---|---|
| Kann das Admin-Panel nicht erreichen | Überprüfe, ob deine eingehenden IP-Adressen auf der Allowlist stehen — kontaktiere den Intric-Support |
| Crawl gibt keine Seiten zurück | Überprüfe Crawl-Ziele und URL-Ausschlüsse; überprüfe Crawl-Kontoberechtigungen |
| Crawling ist langsam | Reduziere Crawl-Tiefe (Standard 3) oder beschränke URL-Ausschlüsse; überprüfe Rate Limiting |
| Authentifizierung schlägt fehl | Überprüfe die Formular-Login-Konfiguration; der Crawler unterstützt keine Basic Auth zu Ziel-Sites |
| Korrekturen erscheinen nicht | Stelle sicher, dass die correct_intranet_answer-Fähigkeit auf dem Assistenten aktiviert ist |
Crawl-Logs werden in den Pod-Output geschrieben und über kubectl gelesen — dies ist eine Intric-Ingenieur-Aktion, keine kundenorientierte Funktion. Es gibt keine Log-Ansicht im UI.
Hilfe erhalten
Abschnitt betitelt „Hilfe erhalten“Wenn du während des Setup auf Probleme stößt oder Hilfe benötigst, kontaktiere den Intric-Support:
- Deine Kundenidentifikator (der Pfadabschnitt in deiner Admin-Panel-URL)
- Beschreibung des Problems
- Jegliche Fehlermeldungen, die du siehst