Salta ai contenuti
Service status

Digita per cercare

1 articoli · 4 min di lettura

Crawler intranet

Indicizza e cerca i contenuti dell'intranet della tua organizzazione con il crawler intranet basato su MCP di Intric.

Il crawler intranet consente ai tuoi assistenti di cercare e recuperare informazioni dall’intranet interna della tua organizzazione. Costruito sullo standard Model Context Protocol (MCP), offre al tuo team un accesso autenticato ai contenuti dell’intranet direttamente nelle conversazioni Intric.

Ogni cliente riceve una deployments separata — un container dedicato, volume persistente, database vettoriale e percorso ingress — in cui condividete solo l’immagine del container. Le deployments non possono condividere database. L’onboarding è una procedura eseguita da un ingegnere Intric; non esiste un flusso di onboarding self-service.

Il crawler indicizza contenuti dietro intranet protette da login utilizzando le credenziali che fornisci durante la configurazione. Questo include manuali dei dipendenti, documenti di policy, wiki interni e altre risorse che richiedono autenticazione.

Il crawler espone tre strumenti MCP e una risorsa:

Restituisce questa guida all’uso. Le stesse istruzioni del crawler indicano all’assistente di chiamare questo strumento per primo in ogni conversazione. Chiamalo prima di qualsiasi altro strumento del crawler.

Cerca nei contenuti indicizzati dell’intranet e recupera le informazioni rilevanti in risposta alle query degli utenti. Ogni utente che può raggiungere lo strumento vede ogni pagina indicizzata. L’indice contiene solo ciò che l’account di crawling poteva raggiungere durante il crawling, quindi un attento scoping dell’account di crawling è fondamentale per prevenire un over-indexing. Non esiste un controllo dei permessi al momento della query.

Correggi una risposta — non l’indice. Usalo per suggerire una risposta migliore per un risultato di ricerca specifico. Il suggerimento viene instradato agli amministratori che possono revisionare, modificare e approvare le modifiche. Le correzioni accettate vengono indicizzate immediatamente e hanno la precedenza sui contenuti indicizzati nelle risposte future.

Restituisce informazioni sullo stato corrente del crawling, incluse le pagine indicizzate, l’ultimo orario di crawling e gli errori di crawling.

Il crawler opera come un server MCP personalizzato che configuri tramite il proprio pannello di amministrazione del crawler all’indirizzo https://mcp-servers.intric.ai/<cliente>-intranet/admin. Il pannello è in svedese come lingua principale con un toggle per l’inglese, ed è protetto dall’autenticazione HTTP Basic. Una volta configurato:

  1. Il crawler visita periodicamente gli URL configurati sul tuo intranet
  2. Si autentica utilizzando le credenziali che fornisci
  3. I contenuti vengono estratti, elaborati e indicizzati
  4. Gli assistenti con lo strumento crawler intranet abilitato possono cercare in questi contenuti
  5. Gli utenti possono suggerire correzioni tramite un’interfaccia dedicata
  6. Gli amministratori revisionano le correzioni nel pannello di amministrazione del crawler

Il crawler visita il tuo intranet direttamente su base programmata. I crawling programmati vengono eseguiti una volta al giorno alle 02:00 UTC come impostazione predefinita, con un crawling incrementale delle notizie aggiuntivo che viene eseguito ogni 30 minuti. La modifica di un intervallo richiede un riavvio del pod. Questa modalità richiede l’accesso alla rete al tuo intranet e le credenziali configurate durante la configurazione.

Una configurazione alternativa in cui il crawler non tocca mai la tua rete. Invece, crawli il tuo intranet con i tuoi strumenti e consegni un file di dati a Intric, che lo indicizza. Questa modalità:

  • Non richiede accesso alla rete al tuo intranet dal lato Intric
  • Non richiede credenziali di crawling
  • Utilizza aggiornamenti manuali (non programmati) — invia un nuovo file di dati quando i contenuti cambiano

Questa modalità è posizionata per clienti sensibili alla sicurezza che non possono concedere a Intric l’accesso al loro intranet. Avvertenza: un reindicizzazione nella modalità precrawled distrugge le correzioni accettate, poiché cancella la raccolta vettoriale e la sostituisce con una appena creata.

Il crawler opera sotto i permessi dell’account configurato durante la configurazione. Questo significa:

  • L’indice contiene solo i contenuti che l’account di crawling poteva raggiungere
  • Tutto il contenuto indicizzato diventa ricercabile da ogni utente di un assistente con lo strumento allegato — non esiste un filtraggio per utente al momento della query
  • Un attento scoping dell’account di crawling è fondamentale per prevenire un over-indexing

Importante: Rivedi il modello di permessi del tuo intranet prima di configurare il crawler. Se il tuo account di crawling ha diritti di accesso ampi, considera se tutto il contenuto indicizzato dovrebbe essere ricercabile da tutti gli utenti dell’assistente.

Le regole di classificazione della sicurezza si applicano allo strumento crawler intranet proprio come avviene per altri strumenti in Intric. Un assistente può utilizzare il crawler solo se soddisfa i requisiti di sicurezza dello Space a cui appartiene.

Quando un risultato di ricerca punta a un PDF o ad un altro documento, cliccando sulla citazione l’utente viene portato alla pagina padre che ha linkato il documento — non al documento stesso. Questo è intenzionale.

Sono disponibili opzioni di configurazione aggiuntive per casi d’uso specifici. Contattaci per dettagli su:

  • Fonti di crawling extra — indicizza un secondo sito autenticato nella stessa knowledge base, con le proprie credenziali
  • URL seed aggiuntivi — pagine che nessun link sul tuo intranet raggiunge
  • Crawling di link esterni — un passo fuori dall’intranet (disattivato per impostazione predefinita, limitato a 500 pagine)
  • Quarantena degli URL bloccati e purga delle pagine indesiderate
  • Rendering JavaScript forzato
  • Scoperta basata sulla ricerca SharePoint

Pronto a abilitare la ricerca nell’intranet per la tua organizzazione?

  • Contattaci su support@intric.ai per avviare la configurazione e coordinarti con il nostro team tecnico
  • Leggi l’articolo sottostante per comprendere il processo di configurazione e preparare le informazioni necessarie.