Zum Inhalt springen
Service status

Tippen, um zu suchen

Intranet-Crawler · 4 Min. Lesezeit

Leitfaden zur Installation und Konfiguration

Schritt-für-Schritt-Anleitung zur Einrichtung des Intranet-Crawlers für deine Organisation.

Diese Anleitung führt dich durch den kompletten Setup-Prozess für den Intranet-Crawler, von der initialen Konfiguration bis zur Aktivierung des Tools für deine Assistenten. Das Setup erfordert Zusammenarbeit mit unserem technischen Team bei Intric — es gibt keinen Selbstbedienungs-Onboarding-Prozess.

Für einen High-Level-Überblick über Funktionen und Sicherheit siehe den Artikel unten.

Stelle vor dem Setup sicher, dass folgende Punkte erfüllt sind:

  • Du hast identifiziert, welche Intranet-Inhalte indexiert werden sollen
  • Du hast einen Benutzerkonto (oder Login-Konto) mit geeigneten Berechtigungen auf deinem Intranet erstellt oder identifiziert
  • Dein Intranet ist über HTTPS erreichbar
  • Du verstehst die Authentifizierungsanforderungen deines Intranets

Navigiere zu https://mcp-servers.intric.ai/<kunde>-intranet/admin in deinem Browser. Das Panel ist durch HTTP Basic-Authentifizierung geschützt — verwende die Anmeldeinformationen, die dir während deines Onboardings bereitgestellt wurden. Das Panel ist schwedisch-first mit einem Englisch-Toggle.

Hinweis: Der MCP-Endpoint unter https://mcp-servers.intric.ai/<kunde>-intranet/mcp hat ein separates IP-basiertes Access-Gate. Wenn du das Panel nicht erreichen kannst, überprüfe mit Intric, ob deine eingehenden IP-Adressen auf der Allowlist stehen.

Der Crawler wurde bereits während des Onboardings mit seiner Server-URL konfiguriert. Die URL folgt dem Muster https://mcp-servers.intric.ai/<kunde>-intranet/mcp, wobei <kunde> deine Kundenidentifikator ist (z.B. /varberg-intranet, /lidkoping, /oslo).

Wenn du den Crawler in deinem eigenen Cluster betreibst, folgt die URL deinem eigenen Infrastruktur-Muster.

Dein API-Schlüssel — ein 365-tägiges signiertes Token, das von einem Intric-Ingenieur aus dem Kunden-Deployment-Secret gemint wird — ist bereits konfiguriert. Du kannst ihn nicht selbst erneuern — kontaktiere den Intric-Support, wenn er erneuert werden muss.

Navigiere im Crawler-Admin-Panel zum Bereich Ziele.

Du konfigurierst zwei Einstellungen:

Setze url_filter_prefix auf eine einzelne Präfix-Zeichenkette. Dies ist der Basis-Pfad, dem der Crawler folgen wird. Gib die Root-URL deines Intranets oder eines bestimmten Bereichs ein.

Beispiel:

url_filter_prefix: https://intranet.deinefirma.de/handbuch

Setze exclude_url_patterns auf eine Liste von Substring-Mustern. Jede URL, die einen dieser Substrings enthält, wird ausgeschlossen. Keine Glob-Syntax — dies sind einfache Substring-Matches.

Beispiel:

exclude_url_patterns:
- /archiv/
- /entwurf/

Diese Einstellungen werden in /data/crawler_config.json auf dem Deployment geschrieben.

Schritt 4: Authentifizierung für den Crawler konfigurieren

Abschnitt betitelt „Schritt 4: Authentifizierung für den Crawler konfigurieren“

Der Crawler unterstützt formularbasiertes Login zu deinem Intranet. Er verarbeitet:

  • Generische CMS-Login-Formulare
  • Sitevision-Portlets
  • Multi-Step Azure AD / Entra SAML-Flows, einschließlich “Angemeldet bleiben?”-Interstitium

Gib die Anmeldeinformationen für das Konto an, das der Crawler verwenden soll. Einige Deployments crawlen öffentliche Websites ohne jegliche Login.

Unterstützte Dateitypen: Der Crawler erkennt und indexiert .docx, .xlsx, .pdf und .txt-Dateien. Beachte, dass .doc- und .xls-Dateien erkannt, aber stillschweigend übersprungen werden. Die Dokumentextraktion hat folgende Grenzen:

  • 10 MB hardcoded Download-Grenze für Dokumente
  • 20 MB konfigurierbare Größenbegrenzung (per-Deployment-Umgebungsvariable)
  • PDFs werden nur bis Seite 20 gelesen
  • Extrahierter Text wird bei 300.000 Zeichen abgeschnitten

Nicht unterstützt: Der Crawler verarbeitet keine CAPTCHA oder gerätebasierte Zwei-Faktor-Authentifizierung.

Im Crawler-Admin-Panel gibt es eine einzige Dokumentextraktions-Kontrolle: eine Ein/Aus-Checkbox. Dateitypen sind hardcoded (siehe oben). Größenbegrenzungen werden per-Deployment über Umgebungsvariablen gesetzt, nicht über das UI.

Der Standard-Vollcrawl wird einmal täglich um 02:00 Uhr UTC ausgeführt.

Ein zweiter geplanter Job führt einen inkrementellen News-Crawl alle 30 Minuten durch. Um ein Intervall zu ändern, musst du den Pod neu starten.

Für den Pre-crawled Data Mode sind Updates manuell — sende eine neue Datendatei, wenn sich Inhalte ändern. Geplante Crawls werden in diesem Modus vollständig übersprungen.

Das Crawler-Admin-Panel bietet vier Buttons zum Testen:

  • Full Crawl — alle konfigurierten Ziele crawlen
  • Test Crawl (eine Seite) — eine einzelne Seite crawlen, um die Konfiguration zu überprüfen
  • News Crawl — den inkrementellen News-Crawl auslösen
  • Extra-Quellen-Crawl — zusätzliche konfigurierte Quellen crawlen

Dies sind die einzigen Betriebskontrollen im Panel. Es gibt keinen “Verbindung testen”-Button.

Schritt 8: Das Tool für deine Assistenten aktivieren

Abschnitt betitelt „Schritt 8: Das Tool für deine Assistenten aktivieren“

Sobald die Konfiguration abgeschlossen und getestet ist:

  1. Navigiere zum Bereich Tools in deinem Intric Space
  2. Finde den Intranet-Crawler in der Liste der verfügbaren Tools
  3. Aktiviere ihn für Assistenten in diesem Space
  4. Konfiguriere Sicherheitsklassifizierungseinstellungen falls erforderlich

Das Tool ist nun zur Verwendung verfügbar.

Im Crawler-Admin-Panel navigiere zum Korrekturen-Bereich, der eine Pending-Count-Badge anzeigt.

Optionen für jede ausstehende Korrektur:

  • Accept — Die Korrektur sofort indexieren. Akzeptierte Korrekturen haben Vorrang vor gecrawlten Inhalten in zukünftigen Antworten.
  • Edit — Die Korrektur bearbeiten und in einem Schritt akzeptieren.
  • Deny — Die Korrektur ablehnen.
Problem Lösung
Kann das Admin-Panel nicht erreichen Überprüfe, ob deine eingehenden IP-Adressen auf der Allowlist stehen — kontaktiere den Intric-Support
Crawl gibt keine Seiten zurück Überprüfe Crawl-Ziele und URL-Ausschlüsse; überprüfe Crawl-Kontoberechtigungen
Crawling ist langsam Reduziere Crawl-Tiefe (Standard 3) oder beschränke URL-Ausschlüsse; überprüfe Rate Limiting
Authentifizierung schlägt fehl Überprüfe die Formular-Login-Konfiguration; der Crawler unterstützt keine Basic Auth zu Ziel-Sites
Korrekturen erscheinen nicht Stelle sicher, dass die correct_intranet_answer-Fähigkeit auf dem Assistenten aktiviert ist

Crawl-Logs werden in den Pod-Output geschrieben und über kubectl gelesen — dies ist eine Intric-Ingenieur-Aktion, keine kundenorientierte Funktion. Es gibt keine Log-Ansicht im UI.

Wenn du während des Setup auf Probleme stößt oder Hilfe benötigst, kontaktiere den Intric-Support:

  • Deine Kundenidentifikator (der Pfadabschnitt in deiner Admin-Panel-URL)
  • Beschreibung des Problems
  • Jegliche Fehlermeldungen, die du siehst