1 articoli · 4 min di lettura
Crawler intranet
Indicizza e cerca i contenuti dell'intranet della tua organizzazione con il crawler intranet basato su MCP di Intric.
Panoramica
Sezione intitolata “Panoramica”Il crawler intranet consente ai tuoi assistenti di cercare e recuperare informazioni dall’intranet interna della tua organizzazione. Costruito sullo standard Model Context Protocol (MCP), offre al tuo team un accesso autenticato ai contenuti dell’intranet direttamente nelle conversazioni Intric.
Ogni cliente riceve una deployments separata — un container dedicato, volume persistente, database vettoriale e percorso ingress — in cui condividete solo l’immagine del container. Le deployments non possono condividere database. L’onboarding è una procedura eseguita da un ingegnere Intric; non esiste un flusso di onboarding self-service.
Il crawler indicizza contenuti dietro intranet protette da login utilizzando le credenziali che fornisci durante la configurazione. Questo include manuali dei dipendenti, documenti di policy, wiki interni e altre risorse che richiedono autenticazione.
Strumenti e risorse
Sezione intitolata “Strumenti e risorse”Il crawler espone tre strumenti MCP e una risorsa:
intranet_get_usage_guide
Sezione intitolata “intranet_get_usage_guide”Restituisce questa guida all’uso. Le stesse istruzioni del crawler indicano all’assistente di chiamare questo strumento per primo in ogni conversazione. Chiamalo prima di qualsiasi altro strumento del crawler.
search_intranet
Sezione intitolata “search_intranet”Cerca nei contenuti indicizzati dell’intranet e recupera le informazioni rilevanti in risposta alle query degli utenti. Ogni utente che può raggiungere lo strumento vede ogni pagina indicizzata. L’indice contiene solo ciò che l’account di crawling poteva raggiungere durante il crawling, quindi un attento scoping dell’account di crawling è fondamentale per prevenire un over-indexing. Non esiste un controllo dei permessi al momento della query.
correct_intranet_answer
Sezione intitolata “correct_intranet_answer”Correggi una risposta — non l’indice. Usalo per suggerire una risposta migliore per un risultato di ricerca specifico. Il suggerimento viene instradato agli amministratori che possono revisionare, modificare e approvare le modifiche. Le correzioni accettate vengono indicizzate immediatamente e hanno la precedenza sui contenuti indicizzati nelle risposte future.
Risorsa crawler_stats
Sezione intitolata “Risorsa crawler_stats”Restituisce informazioni sullo stato corrente del crawling, incluse le pagine indicizzate, l’ultimo orario di crawling e gli errori di crawling.
Come funziona
Sezione intitolata “Come funziona”Il crawler opera come un server MCP personalizzato che configuri tramite il proprio pannello di amministrazione del crawler all’indirizzo https://mcp-servers.intric.ai/<cliente>-intranet/admin. Il pannello è in svedese come lingua principale con un toggle per l’inglese, ed è protetto dall’autenticazione HTTP Basic. Una volta configurato:
- Il crawler visita periodicamente gli URL configurati sul tuo intranet
- Si autentica utilizzando le credenziali che fornisci
- I contenuti vengono estratti, elaborati e indicizzati
- Gli assistenti con lo strumento crawler intranet abilitato possono cercare in questi contenuti
- Gli utenti possono suggerire correzioni tramite un’interfaccia dedicata
- Gli amministratori revisionano le correzioni nel pannello di amministrazione del crawler
Modalità di crawling dell’intranet
Sezione intitolata “Modalità di crawling dell’intranet”Crawling standard
Sezione intitolata “Crawling standard”Il crawler visita il tuo intranet direttamente su base programmata. I crawling programmati vengono eseguiti una volta al giorno alle 02:00 UTC come impostazione predefinita, con un crawling incrementale delle notizie aggiuntivo che viene eseguito ogni 30 minuti. La modifica di un intervallo richiede un riavvio del pod. Questa modalità richiede l’accesso alla rete al tuo intranet e le credenziali configurate durante la configurazione.
Modalità dati precrawled
Sezione intitolata “Modalità dati precrawled”Una configurazione alternativa in cui il crawler non tocca mai la tua rete. Invece, crawli il tuo intranet con i tuoi strumenti e consegni un file di dati a Intric, che lo indicizza. Questa modalità:
- Non richiede accesso alla rete al tuo intranet dal lato Intric
- Non richiede credenziali di crawling
- Utilizza aggiornamenti manuali (non programmati) — invia un nuovo file di dati quando i contenuti cambiano
Questa modalità è posizionata per clienti sensibili alla sicurezza che non possono concedere a Intric l’accesso al loro intranet. Avvertenza: un reindicizzazione nella modalità precrawled distrugge le correzioni accettate, poiché cancella la raccolta vettoriale e la sostituisce con una appena creata.
Sicurezza e permessi
Sezione intitolata “Sicurezza e permessi”Il crawler opera sotto i permessi dell’account configurato durante la configurazione. Questo significa:
- L’indice contiene solo i contenuti che l’account di crawling poteva raggiungere
- Tutto il contenuto indicizzato diventa ricercabile da ogni utente di un assistente con lo strumento allegato — non esiste un filtraggio per utente al momento della query
- Un attento scoping dell’account di crawling è fondamentale per prevenire un over-indexing
Importante: Rivedi il modello di permessi del tuo intranet prima di configurare il crawler. Se il tuo account di crawling ha diritti di accesso ampi, considera se tutto il contenuto indicizzato dovrebbe essere ricercabile da tutti gli utenti dell’assistente.
Le regole di classificazione della sicurezza si applicano allo strumento crawler intranet proprio come avviene per altri strumenti in Intric. Un assistente può utilizzare il crawler solo se soddisfa i requisiti di sicurezza dello Space a cui appartiene.
Citazioni dei documenti
Sezione intitolata “Citazioni dei documenti”Quando un risultato di ricerca punta a un PDF o ad un altro documento, cliccando sulla citazione l’utente viene portato alla pagina padre che ha linkato il documento — non al documento stesso. Questo è intenzionale.
Opzioni avanzate
Sezione intitolata “Opzioni avanzate”Sono disponibili opzioni di configurazione aggiuntive per casi d’uso specifici. Contattaci per dettagli su:
- Fonti di crawling extra — indicizza un secondo sito autenticato nella stessa knowledge base, con le proprie credenziali
- URL seed aggiuntivi — pagine che nessun link sul tuo intranet raggiunge
- Crawling di link esterni — un passo fuori dall’intranet (disattivato per impostazione predefinita, limitato a 500 pagine)
- Quarantena degli URL bloccati e purga delle pagine indesiderate
- Rendering JavaScript forzato
- Scoperta basata sulla ricerca SharePoint
Prossimi passi
Sezione intitolata “Prossimi passi”Pronto a abilitare la ricerca nell’intranet per la tua organizzazione?
- Contattaci su support@intric.ai per avviare la configurazione e coordinarti con il nostro team tecnico
- Leggi l’articolo sottostante per comprendere il processo di configurazione e preparare le informazioni necessarie.