Confronto sistemi AI on premise (sistema totalmente in locale) VS sistemi SaaS (cloud esterno commerciale AI generalista) video 1
Chunks, Embeddings, aggiornamento testi e altro video 2

Studio di Fattibilità & Analisi di Spesa Hardware

Infrastruttura AI ad alte prestazioni per la PA (Versione 2x NVIDIA RTX 5090 - KV Cache Ottimizzata)

Il presente documento delinea la configurazione hardware definitiva ottimizzata per il chatbot istituzionale dell'Ente. L'architettura software prevede una gestione della memoria estremamente efficiente, in cui la KV Cache mantiene unicamente l'ultima interazione/risposta del cittadino o dell'operatore, liberando istantaneamente le risorse computazionali ad ogni completamento di output.

Svolta Tecnica: Predominanza della Velocità di Calcolo
Grazie all'architettura stateless (o quasi-stateless) della memoria di contesto, il vincolo principale del sistema non è più la capienza passiva di VRAM (per contenere ore di storici conversazionali), bensì la velocità pura di calcolo (tokens al secondo) necessaria a processare circa 15.000 richieste nelle 24 ore, gestendo i picchi di concordanza simultanea sul portale. L'adozione della serie flagship consumer RTX 5090 diventa quindi la scelta ideale per garantire risposte immediate e azzerare le code di attesa ma solo nel caso di posizionamento workstation in sede con adeguata FTTH, nel caso di posizionamento in datacenter la serie individuata sarà la a6000 nel respect accordo EULA Nvidia.

1. Configurazione Hardware e Preventivo Stimato (Linea Performance) per macchina in sede con connessione ftth

I prezzi indicati rappresentano stime per canali di fornitura aziendali/B2B (es. MEPA), IVA esclusa.

Componente Hardware Specifiche Tecniche Consigliate Motivazione Tecnica Prezzo Stimato (Senza IVA)
Schede Grafiche (GPU) 2x NVIDIA RTX 5090 32GB GDDR7 (Totale 64 GB VRAM) Architettura di ultimissima generazione. I 64 GB complessivi alloggiano comodamente Llama 3 70B (circa 42 GB) e lasciano oltre 20 GB per i batch simultanei. La memoria GDDR7 garantisce una velocità di risposta fulminea (1-2 secondi a query). Si richiede la selezione di modelli con dissipatore a liquido di fabbrica (AIO) per consentire l'installazione affiancata nel server. € 5.600,00
(~€ 2.800,00 cad.)
Processore (CPU) AMD Ryzen Threadripper 7000 Series (es. 7960X, 24 Core / 48 Thread) Garantisce la bandwidth e le linee PCIe necessarie a far comunicare le due GPU al massimo del potenziale, gestendo parallelamente le interrogazioni al database vettoriale (RAG). € 1.500,00
Scheda Madre ASUS Pro WS TRX50-SAGE WIFI (Chipset TRX50) Fornisce gli slot PCIe rinforzati e distanziati necessari per alloggiare la stabilità del sistema multi-GPU e il pieno supporto per memorie ECC professionali. € 850,00
Memoria RAM 128 GB (4x 32GB) DDR5 Registered ECC La correzione d'errore (ECC) su piattaforma Threadripper tutela il server da crash improvvisi del sistema operativo durante i picchi di 15.000 richieste giornaliere. € 650,00
Archiviazione (SSD) 2x 2TB NVMe PCIe Enterprise (in RAID 1) Unità NVMe ad alte prestazioni in modalità speculare (RAID 1) per la sicurezza dei dati del RAG e dei documenti della PA. € 400,00
Alimentatore (PSU) Alimentatore High-End Enterprise da 1600W - 2000W (80+ Platinum / Titanium) Necessario per gestire in totale sicurezza i picchi transitori di assorbimento energetico nativi delle schede video di classe RTX 5000 in pieno carico. € 450,00
Chassis e Dissipazione Case Server/Workstation Full Tower + Predisposizione Alloggiamento Radiatori Liquido GPU/CPU Spasio ingegnerizzato per ospitare i radiatori a liquido delle due RTX 5090 e il sistema di raffreddamento dedicato della CPU, garantendo temperature stabili h24. € 400,00
Continuità (UPS) Gruppo di Continuità Professionale Online Doppia Conversione (2000VA / 1600W) Protezione totale e filtraggio elettrico da sbalzi di tensione, dimensionato accuratamente per la potenza del server in pieno picco di calcolo. € 650,00
TOTALE ACQUISTO HARDWARE STIMATO (Esclusa IVA) € 10.500,00
TOTALE INSTALLAZIONE (SU SISTEMA DEBIAN 13 ) (Esclusa IVA) € 7.000,00
ASSISTENZA ANNUALE (OPZIONALE) (Esclusa IVA) € 3.000,00 anno

2. Configurazione Hardware e Preventivo Stimato (Linea Performance) per macchina in datacenter

I prezzi indicati rappresentano stime per canali di fornitura aziendali/B2B (es. MEPA), IVA esclusa.

Componente Hardware Specifiche Tecniche Consigliate Motivazione Tecnica Prezzo Stimato (Senza IVA)
Schede Grafiche (GPU) 2x NVIDIA RTX A6000 48GB GDDR6 (Totale 96 GB) Dissipazione nativa di tipo blower (coerente con i flussi dei rack). I 96 GB ospitano comodamente i modelli 8B/14B, lasciando fino a 70 GB di VRAM per la KV cache. Questo azzera i tempi di attesa anche durante i picchi sul portale. Rispetto accordo EULA nvidia € 9.000,00
(~€ 4.500,00 cad.)
Processore (CPU) AMD Ryzen Threadripper 7000 Series (es. 7960X, 24 Core / 48 Thread) Garantisce la bandwidth e le linee PCIe necessarie a far comunicare le due GPU al massimo del potenziale, gestendo parallelamente le interrogazioni al database vettoriale (RAG). € 1.500,00
Scheda Madre ASUS Pro WS TRX50-SAGE WIFI (Chipset TRX50) Fornisce gli slot PCIe rinforzati e distanziati necessari per alloggiare la stabilità del sistema multi-GPU e il pieno supporto per memorie ECC professionali. € 850,00
Memoria RAM 128 GB (4x 32GB) DDR5 Registered ECC La correzione d'errore (ECC) su piattaforma Threadripper tutela il server da crash improvvisi del sistema operativo durante i picchi di 15.000 richieste giornaliere. € 650,00
Archiviazione (SSD) 2x 2TB NVMe PCIe Enterprise (in RAID 1) Unità NVMe ad alte prestazioni in modalità speculare (RAID 1) per la sicurezza dei dati del RAG e dei documenti della PA. € 400,00
Alimentatore (PSU) Alimentatore High-End Enterprise da 1600W - 2000W (80+ Platinum / Titanium) Necessario per gestire in totale sicurezza i picchi transitori di assorbimento energetico nativi delle schede video di classe RTX 5000 in pieno carico. € 450,00
Chassis e Dissipazione Case Server Rack 4U (compatibile schede madri EEB) + Dissipatore ad Aria Professionale a profilo 4U per CPU (es. Noctua NH-D9 o similare). Configurazione ingegnerizzata per l'installazione standard in armadi Rack da Data Center. La dissipazione ad aria pura elimina il rischio di perdite di liquido (vietate nei data center) e sfrutta i flussi canalizzati del rack. € 300,00
Continuità (UPS) Gruppo di Continuità Professionale Online Doppia Conversione (2000VA / 1600W) Protezione totale e filtraggio elettrico da sbalzi di tensione, dimensionato accuratamente per la potenza del server in pieno picco di calcolo. € 650,00
TOTALE ACQUISTO HARDWARE STIMATO (Esclusa IVA) € 13.800,00
TOTALE INSTALLAZIONE (SU SISTEMA DEBIAN 13 ) (Esclusa IVA) € 7.000,00
ASSISTENZA ANNUALE (OPZIONALE) (Esclusa IVA) € 3.000,00 anno

3. Metriche del Servizio ed Esercizio Energetico

Partendo da una ipotesi di traffico 15.000 utenti/accessi con limite a 10 minutes a sessione, procediamo ad un calcolo esemplificativo ma accurato per un Ente tipo:

4. Analisi della Pipeline Software (llama.cpp) con KV Cache Ridotta

L'architettura software deve essere configurata per assecondare la logica stateless descritta, massimizzando il throughput hardware:

A. Velocità di Risposta Utente (User Experience)

Con la rtx 5090 e l'abbinamento tra la memoria GDDR7 e la potenza computazionale permette di elaborare ad esempio una risposta da 200 parole in un tempo stimato di 1,5 - 2,5 secondi. Con la A6000 e l'abbinamento tra la memoria GDDR6 permette di elaborare ad esempio una risposta da 200 parole in un tempo stimato di 2,5 - 4 secondi. Per il cittadino collegato al portale web dell'ente, sono in entrambi i casi tempi di latenza accettabili.

B. Sfruttamento Dinamico delle VRAM in entrambe le due soluzioni

Dato che la KV Cache non deve accumulare la cronologia di tutti i 10 minuti di sessione ma si svuota immediatamente dopo l'invio della singola risposta, i GB di VRAM eccedenti il modello (8B o 14B) diventano una risorsa dinamica eccezionale. Attraverso il parametro di Continuous Batching (`--cont-batching`) in `llama.cpp`, il server può parallelizzare le richieste di 30 utenti contemporaneamente, calcolando le risposte nello stesso identico ciclo di clock senza che l'hardware vada in saturazione (Out of Memory).

5. Sintesi dei Vantaggi per la Pubblica Amministrazione vs Cloud SaaS

  1. Risparmio Economico Radicale: Contenimento dei costi con investimento su hardware nessun costo a token. NOTA BENE: Se paragonato a delle API esterne (es. ChatGPT) per 15.000 richieste/giorno si genererebbero costi ricorrenti stimati tra i 14.000€ e i 25.000€ all'anno. Quindi in assenza di costi di licenza e di token ovvero servizi saas, la macchina con AI on premise (locale) si ripaga interamente in brevissimo tempo.

    costo annuale per i primi 5 anni calcolato sulla soluzione A6000 datacenter:
    1. 5.960 euro anno (ammortamento macchina + costo energia + costo installazione senza assistenza)
    2. 8.960 euro anno (ammortamento macchina + costo installazione + costo energia compreso assistenza)

    Dopo 5 anni:
    1. 1.800 euro anno (costo energia senza assistenza)
    2. 4.800 euro anno (costo energia con assistenza)

    Efficienza nel Servizio: Massima fluidità per la cittadinanza grazie a un'architettura che "smaltisce" i token a velocità tripla rispetto alle opzioni alternative.Sicurezza e Privacy Assoluta: Piena conformità alla normativa GDPR NIS2 AI ACT. Tutti i dati, i documenti dell ente inseriti nel RAG sono interni e le domande dei cittadini hanno durata effimera per sessione e non rimangono localmente all'interno del server dell'ente. Gli accessi al servizio sono anonimi senza richiesta dati personali. Il sistema viene fornito di default con chatbot su modello instruct per assistenza tecnica relativa alla infrastruttura in modo da facilitare tutte le operazioni di risoluzioni incidenti, verifiche logs per il tecnico incaricato. Tutti i front end e gli script da noi realizzati sono concessi con licenza MIT o apache 2. Le librerie utilizzate di Debian sono vanilla
//

Relazione Tecnica riassuntiva Infrastruttura OS e applicativo AI

Infrastruttura Intelligenza Artificiale Locale e Sicurezza Informatica dell'Ente

1. Modello Software e Filosofia di Design (Stateless UX)

  • Modello AI: Famiglia 8B o massimo 14B parametri rilasciata con licenza permissiva Apache 2.0 o MIT. I modelli sono altamente ottimizzati per il contesto multilingua con ottima comprensione della terminologia burocratico/amministrativa della Pubblica Amministrazione.
  • Core Engine: llama.cpp eseguito in modalità bare-metal (nativa) direttamente sul sistema operativo Host per l'annullamento dei tempi di overhead.
  • Politica di Streaming (Disattivata): Per garantire una lettura fluida, istituzionale e priva di distrazioni visive per il cittadino, il parametro di streaming è impostato tassativamente su "stream": false. Il sistema calcola l'output interamente in memoria e restituisce la risposta formattata in un unico blocco JSON compatto che contiene di default testo disclaimer di su avviso di utilizzo AI.
  • Gestione Stateless della Memoria: La KV Cache mantiene unicamente l'ultima interazione/risposta del cittadino o dell'operatore, liberando istantaneamente le risorse computazionali ad ogni completamento di output, massimizzando il throughput complessivo dell'hardware.
  • Sessioni effimere ed anonime: Le sessioni per informative al cittadino sono ad accesso anonimo ed effimere con una durata di max 10 minuti.

2. Architettura Rete e Sicurezza Logica (Virtualizzazione KVM)

L'infrastruttura implementa un principio di sicurezza per compartimentazione rigida, separando il motore di calcolo pesante dai servizi esposti al pubblico:

[ HOST FISICO "Bare-Metal": Debian 13 Vanilla ]
 │
 ├──► [CORE AI]: llama.cpp (Modelli 8B/14B e modelli embedding 2B) ── llama-server Curl accesso interno con proxy
 │
 ├──► [CORE WEB/RAG]: PHP-FPM ── Orchestrazione Pipeline RAG (BM25 + Cosine + Cache)
 │
 ├──► Sicurezza & Admin: Firewall + Fail2ban | Accesso RDP (3389) via IP Esclusivi (XFCE)
 ├──► Reverse Proxy: Apache (Mod_Proxy) ── Ascolta SOLO su Rete Isolata KVM (192.168.100.1)
 │
 └───► [ Hypervisor: Libvirt / KVM / Qemu ]
       ├──► [ VM 1: Golden Image ] (Spenta/Template)
       ├──► [ VM 2: Verifica Aggiornamenti ] (Ambiente di Staging/Test logici)
       └──► [ VM 3: PRODUTTIVA ] (IP e linea di rete dedicati)
             └─── Servizi: Front-End Chatbot (Licenza MIT/Apache 2)
                   └─── Invia le richieste alla pipeline RAG/AI dell'Host
            

Dettagli di Sicurezza del Sistema Informativo:

  1. Sistema Operativo: Debian 13 Vanilla configurato con ambiente desktop minimale ed efficiente XFCE.
  2. Accesso Amministrativo: Gestito tramite protocollo grafico RDP (porta 3389) blindato dal firewall dell'Ente e accessibile esclusivamente da indirizzi IP statici esplicitamente autorizzati.
  3. Pannello di Controllo: Virtualmin configurato con accesso vincolato unicamente a localhost (127.0.0.1). Esso è utilizzabile esclusivamente all'interno della sessione RDP protetta per la verifica dei log di sistema, la gestione dei pacchetti e il monitoraggio dei servizi.
  4. Isolamento della Comunicazione Interna: L'endpoint di llama.cpp e il backend di elaborazione non sono visibili dalla rete esterna o dalla LAN generale dell'Ente. La comunicazione avviene tramite una rete virtuale KVM Host-Only isolata (es. 192.168.100.0/24).

3. Pipeline RAG Avanzata e Orchestrazione (PHP-FPM)

L'orchestrazione logica del sistema, l'interrogazione documentale e la sicurezza dei prompt sono interamente governate dall'ambiente PHP-FPM (FastCGI Process Manager) installato sull'host, il quale garantisce tempi di esecuzione fulminei e un isolamento nativo dei processi utente.

La pipeline di Retrieval-Augmented Generation (RAG) agisce secondo una logica di recupero ibrido a due fattori (Hybrid Search):

  1. Recupero Lessicale (BM25): Lo script PHP-FPM esegue una prima scansione algoritmica basata sulla frequenza delle parole chiave (Algoritmo BM25) all'interno dei documenti comunali indicizzati, intercettando riferimenti normativi esatti o specifici codici di delibere.
  2. Recupero Semantico (Cosine Similarity): In parallelo, il testo della query viene convertito in vettori (Embedding) e confrontato tramite Cosine Similarity rispetto al database vettoriale, catturando l'intento logico e il significato della domanda del cittadino, anche in assenza di parole chiave esatte.
  3. Embedding Cache Layer: Per abbattere drasticamente i tempi di calcolo e non sovraccaricare le GPU, le interrogazioni ricorrenti (es. domande frequenti su orari, scadenze IMU, TARI) e i relativi embedding dei blocchi documentali stabili vengono salvati in un livello di Cache ultra-veloce gestito da PHP. Se un cittadino pone una domanda analoga a una già processata, il sistema recupera il contesto istantaneamente dalla cache senza interrogare nuovamente i modelli di embedding.
  4. Sintesi Finale: PHP-FPM unisce i risultati di BM25 e Cosine Similarity, valida la conformità del testo (filtrando eventuali dati sensibili o tentativi di prompt injection) e invia il prompt arricchito tramite il Reverse Proxy Apache (mod_proxy) verso l'endpoint locale di llama.cpp.
Nota di conformità:

L’architettura proposta adotta un approccio 'Secure by Design' pienamente allineato alle direttive europee e nazionali per la tutela della riservatezza dei dati e la continuità operativa dei servizi pubblici digitali.