Salta ai contenuti
Service status

Digita per cercare

Crawler intranet · 5 min di lettura

Guida a installazione e configurazione

Guida passo passo per configurare il crawler intranet per la tua organizzazione.

Questa guida ti accompagna nel processo completo di configurazione del crawler intranet, dalla configurazione iniziale all’abilitazione dello strumento per i tuoi assistenti. La configurazione richiede collaborazione con il nostro team tecnico di Intric — non esiste un flusso di onboarding self-service.

Per una panoramica ad alto livello di funzionalità e sicurezza, leggi l’articolo sottostante.

Prima di iniziare la configurazione, assicurati che quanto segue:

  • Hai identificato quali contenuti dell’intranet devono essere indicizzati
  • Hai creato o identificato un account (o account di accesso) con autorizzazioni appropriate sul tuo intranet
  • Il tuo intranet è accessibile tramite HTTPS
  • Comprendi i requisiti di autenticazione del tuo intranet

Passaggio 1: Raggiungere il pannello di amministrazione del crawler

Sezione intitolata “Passaggio 1: Raggiungere il pannello di amministrazione del crawler”

Naviga a https://mcp-servers.intric.ai/<cliente>-intranet/admin nel tuo browser. Il pannello è protetto dall’autenticazione HTTP Basic — utilizza le credenziali fornite durante il tuo onboarding. Il pannello è in svedese come lingua principale con un toggle per l’inglese.

Nota: L’endpoint MCP all’indirizzo https://mcp-servers.intric.ai/<cliente>-intranet/mcp ha un gateway di accesso basato su IP separato. Se non riesci a raggiungere il pannello, verifica con Intric che i tuoi indirizzi IP in entrata siano nella allowlist.

Passaggio 2: Verificare la configurazione del server

Sezione intitolata “Passaggio 2: Verificare la configurazione del server”

Il crawler è già configurato con il suo URL del server durante l’onboarding. L’URL segue il modello https://mcp-servers.intric.ai/<cliente>-intranet/mcp dove <cliente> è il tuo identificatore cliente (ad es. /varberg-intranet, /lidkoping, /oslo).

Se stai eseguendo il crawler nel tuo cluster, l’URL seguirà il modello della tua infrastruttura.

La tua chiave API — un token firmato di 365 giorni coniato da un ingegnere Intric dal segreto della deployment del cliente — è già configurata. Non puoi rigenerarlo da solo — contatta il supporto Intric quando deve essere rinnovato.

Passaggio 3: Configurare le destinazioni di crawling

Sezione intitolata “Passaggio 3: Configurare le destinazioni di crawling”

Nel pannello di amministrazione del crawler, naviga alla sezione Destinazioni.

Configuri due impostazioni:

Imposta url_filter_prefix su una singola stringa di prefisso. Questo è il percorso base che il crawler seguirà. Inserisci l’URL root del tuo intranet o di una sezione specifica.

Esempio:

url_filter_prefix: https://intranet.latuaazienda.it/manuale

Imposta exclude_url_patterns su un elenco di modelli di sottostringa. Qualsiasi URL contenente una di queste sottostringhe verrà esclusa. Nessuna sintassi glob — questi sono semplici matching di sottostringhe.

Esempio:

exclude_url_patterns:
- /archivio/
- /bozze/

Queste impostazioni vengono scritte in /data/crawler_config.json sulla deployment.

Passaggio 4: Configurare l’autenticazione per il crawler

Sezione intitolata “Passaggio 4: Configurare l’autenticazione per il crawler”

Il crawler supporta il login basato su form per il tuo intranet. Gestisce:

  • Form di login CMS generici
  • Portlet Sitevision
  • Flussi Azure AD / Entra SAML multi-step, comprese le interruzioni “Rimani collegato?”

Fornisci le credenziali per l’account che il crawler deve utilizzare. Alcune deployments crawlan siti pubblici senza alcun login.

Tipi di file supportati: Il crawler rileva e indicizza file .docx, .xlsx, .pdf e .txt. Nota che i file .doc e .xls vengono rilevati ma ignorati silenziosamente. L’estrazione dei documenti ha i seguenti limiti:

  • Limite di download hardcoded di 10 MB per i documenti
  • Limite di dimensioni configurabile di 20 MB (variabile d’ambiente per-deployment)
  • I PDF vengono letti solo fino alla pagina 20
  • Il testo estratto viene troncato a 300.000 caratteri

Non supportato: Il crawler non gestisce CAPTCHA o autenticazione a due fattori basata su dispositivo.

Passaggio 5: Impostazioni di estrazione dei documenti

Sezione intitolata “Passaggio 5: Impostazioni di estrazione dei documenti”

Nel pannello di amministrazione del crawler, c’è un solo controllo di estrazione documenti: una casella di controllo on/off. I tipi di file sono hardcoded (vedi sopra). I limiti di dimensione vengono impostati per-deployment tramite variabili d’ambiente, non attraverso l’interfaccia.

Il crawling completo predefinito viene eseguito una volta al giorno alle 02:00 UTC.

Un secondo lavoro programmato esegue un crawling incrementale delle notizie ogni 30 minuti. Per modificare un intervallo devi riavviare il pod.

Per la modalità dati precrawled, gli aggiornamenti sono manuali — invia un nuovo file di dati quando i contenuti cambiano. I crawling programmati vengono completamente saltati in questa modalità.

Il pannello di amministrazione del crawler offre quattro pulsanti per il test:

  • Crawling completo — crawla tutte le destinazioni configurate
  • Test di crawling (una pagina) — crawla una singola pagina per verificare la configurazione
  • Crawling notizie — attiva il crawling incrementale delle notizie
  • Crawling fonti extra — crawla le fonti aggiuntive configurate

Questi sono gli unici controlli operativi nel pannello. Non esiste un pulsante “Verifica connessione”.

Passaggio 8: Abilitare lo strumento per i tuoi assistenti

Sezione intitolata “Passaggio 8: Abilitare lo strumento per i tuoi assistenti”

Una volta che la configurazione è completa e testata:

  1. Naviga alla sezione Strumenti nel tuo Intric Space
  2. Trova il crawler intranet nell’elenco degli strumenti disponibili
  3. Abilitalo per gli assistenti in quello Space
  4. Configura le impostazioni di classificazione della sicurezza se richiesto

Lo strumento è ora disponibile per l’uso.

Nel pannello di amministrazione del crawler, naviga nella sezione delle correzioni, che visualizza un badge con il conteggio delle correzioni in attesa.

Opzioni per ogni correzione in sospeso:

  • Accetta — Indizza la correzione immediatamente. Le correzioni accettate hanno la precedenza sui contenuti crawlati nelle risposte future.
  • Modifica — Modifica la correzione e accetta in un’unica azione.
  • Rifiuta — Declina la correzione.
Problema Soluzione
Impossibile raggiungere il pannello di amministrazione Verifica che i tuoi indirizzi IP in entrata siano nella allowlist — contatta il supporto Intric
Il crawling non restituisce pagine Controlla le destinazioni di crawling e le esclusioni URL; verifica le autorizzazioni dell’account di crawling
Il crawling è lento Riduci la profondità di crawling (predefinita 3) o limita le esclusioni URL; controlla il rate limiting
Autenticazione non riuscita Rivedi la configurazione del login del form; il crawler non supporta l’autenticazione Basic ai siti di destinazione
Le correzioni non appaiono Assicurati che la funzionalità correct_intranet_answer sia abilitata sull’assistente

I log di crawling vengono scritti nell’output del pod e letti tramite kubectl — questa è un’azione di un ingegnere Intric, non una funzione destinata al cliente. Non esiste una visualizzazione dei log nell’interfaccia.

Incontri problemi durante la configurazione o hai bisogno di assistenza, contatta il supporto Intric:

  • Il tuo identificatore cliente (il segmento del percorso nel tuo URL del pannello di amministrazione)
  • Descrizione del problema
  • Eventuali messaggi di errore che vedi