Skip to content
Discutez avec un agent IA
Sur mesure vs plateforme

Acheter une appliance IA pour un petit bureau : la dimensionner selon le travail

Orange ITS — Équipe d’ingénierie IA 11 min de lecture

La démonstration de l’appliance fonctionne parfaitement lorsqu’un associé pose une brève question sur un PDF propre. La décision d’achat prend un autre visage le lendemain matin. Deux collaborateurs ouvrent de longs dossiers clients pendant que le scanner lance un lot d’indexation, et la première réponse tarde assez pour qu’un utilisateur retourne vers un outil web non approuvé.

Le matériel fonctionne peut-être exactement comme prévu. Le bureau a simplement acheté selon le nom d’un modèle et un chiffre de mémoire au lieu de partir du travail que les personnes doivent accomplir.

Une appliance IA pour un petit bureau doit être dimensionnée à partir de documents mesurés, du pic d’utilisation simultanée, d’objectifs de réponse et du temps de reprise. Les spécifications matérielles aident à expliquer un résultat. L’achat trouve sa valeur seulement lorsque le processus complet réussit un test d’acceptation propre au bureau.

Une mission ciblée de développement IA peut transformer un travail représentatif en test avant le bon de commande. L’économie plus large de la propriété du matériel d’inférence est présentée dans l’exploitation d’un cluster d’inférence local. Cet article reste centré sur une décision plus petite : choisir un appareil de bureau adapté au travail et récupérable après une panne.


Relever la charge de travail avant d’examiner les appareils

Commencez par un échantillon proposé de deux semaines de travail habituel. Consignez les demandes adressées à l’assistant et l’aspect réel des documents. Une fiche de dimensionnement doit couvrir la longueur typique et maximale des entrées, la longueur attendue des résultats, le nombre de pages par document, le volume OCR, les langues, la profondeur de recherche, les utilisateurs simultanés et les pics de traitement par lots.

Séparez le travail interactif du travail en arrière-plan. Un avocat qui attend une clause citée n’a pas la même exigence de latence qu’une indexation nocturne. Une fiduciaire examinant une exception salariale utilise la mémoire autrement qu’une équipe comparant une année de relevés bancaires. La même appliance peut traiter confortablement une charge et mettre l’autre en attente.

Fixez des objectifs propres au bureau pour :

  • Le délai jusqu’à la première réponse visible et jusqu’à la réponse complète
  • Le nombre maximal d’utilisateurs simultanés pendant l’heure la plus chargée
  • Le plus grand ensemble documentaire représentatif et le volume OCR quotidien
  • La qualité minimale des citations ou extractions qu’un réviseur acceptera
  • Le temps de reprise après l’indisponibilité de l’appareil ou d’un service dépendant

Il s’agit d’exigences d’acceptation propres au bureau plutôt que de benchmarks sectoriels. Un associé peut accepter 20 secondes pour une comparaison attentive de contrats et refuser le même délai pour une recherche documentaire courte. Le chiffre n’a de sens que par rapport au travail.

Incluez des échantillons en allemand, français, italien et anglais si le bureau sert ces langues. Comptez les scans, les tableaux et les textes manuscrits. Des PDF numériques propres donnent une image trop favorable de la mémoire, de la qualité de recherche et du temps de contrôle.

Construire un budget mémoire pour l’ensemble de la pile

Les poids du modèle ne forment que la première ligne du budget mémoire. Ajoutez les tampons de l’environnement d’exécution, le cache de contexte des sessions actives, le service d’embedding ou de reclassement, le processus OCR, le système d’exploitation, l’index documentaire et l’application. Gardez de l’espace de travail pour les mises à jour et les fichiers temporaires.

La quantification réduit l’empreinte mémoire du modèle en stockant les poids avec une précision inférieure. La documentation actuelle de llama.cpp décrit les options de quantification, plusieurs accélérateurs matériels et l’inférence hybride entre CPU et GPU. Ces techniques élargissent la gamme des modèles exécutables sur un appareil.

L’adéquation technique et l’adéquation pratique exigent des tests distincts. Déplacer une partie du modèle ou de sa charge vers la mémoire système peut permettre son chargement, tout en allongeant le temps de réponse au-delà de l’objectif du bureau. Un contexte plus long et davantage de sessions simultanées augmentent aussi l’usage de la mémoire active. Il faut donc mesurer ensemble l’appareil candidat, le modèle choisi, sa quantification, l’environnement d’exécution et la charge maximale réelle.

Utilisez une table de mémoire pendant la preuve :

ComposantMesure au reposMesure au picMarge requise
Modèle et environnement d’exécutionRelever sur le candidatRelever sur le candidatDéfinie par le plan de mise à jour
Contexte des sessions activesRelever à la longueur cibleRelever au pic d’utilisateursMarge pour une requête lente
Recherche, OCR et indexRelever pendant la rechercheRelever pendant l’indexationMarge pour le plus grand lot
Système d’exploitation et applicationRelever après redémarrageRelever pendant le test completMarge pour un service stable

Le bureau doit fixer la marge nécessaire selon son plan de changement et de reprise. Un pourcentage universel masquerait les différences entre environnements d’exécution et charges de travail.

Choisir une catégorie de matériel après le budget

Pour l’essai d’un appareil unique au bureau, comparez trois grandes catégories. Un serveur centré sur le CPU peut convenir aux petits modèles, aux embeddings, à l’OCR et à une rédaction avec peu d’utilisateurs simultanés. Un ordinateur à mémoire unifiée peut mettre un plus grand espace mémoire commun à la disposition du modèle et de l’application. Une station équipée d’un GPU dédié peut convenir aux charges qui tiennent dans la VRAM et profitent de sa pile d’accélération prise en charge.

Chaque catégorie présente une contrainte différente. Une inférence uniquement sur CPU peut manquer les objectifs de latence interactive. La mémoire unifiée est partagée entre le modèle, le système d’exploitation et l’index. La VRAM dédiée délimite la capacité des charges résidant sur le GPU. Un déchargement hybride peut étendre l’adéquation technique à la mémoire système, mais la latence et la simultanéité peuvent en souffrir. La station complète a aussi besoin d’une alimentation et d’un refroidissement adaptés.

Pour une spécification concrète, NVIDIA présente la GeForce RTX 5090 avec 32 Go de mémoire GDDR7 et une puissance graphique totale de 575 W, ainsi qu’une alimentation système requise de 1 000 W dans les détails de référence. Les conceptions des cartes additionnelles peuvent varier. Ces chiffres décrivent une catégorie de composant. Ils ne prédisent ni la qualité du modèle, ni le nombre d’utilisateurs simultanés, ni la consommation mesurée du système complet.

Le stockage et l’exploitation déterminent souvent le meilleur achat. L’appareil doit disposer d’assez d’espace pour le modèle actuel, une version approuvée antérieure, les index, les sauvegardes ou instantanés prévus, les journaux et les fichiers temporaires de mise à jour. Vérifiez la garantie, le délai de remplacement, la prise en charge des pilotes et la maîtrise de cette pile par l’administrateur.

Évitez d’acheter le plus grand chiffre de mémoire disponible par précaution. La capacité supplémentaire a de la valeur seulement si la charge d’acceptation l’utilise ou si la feuille de route approuvée l’exige.

Mesurer l’expérience utilisateur complète

Exécutez d’abord un benchmark de modèle reproductible, puis faites passer la même charge par l’interface réelle. La documentation de llama-bench explique comment l’outil mesure le traitement des prompts et la génération sur plusieurs répétitions. Ses résultats excluent le temps de tokenisation et d’échantillonnage. Ils ne doivent donc pas être présentés comme la latence de bout en bout perçue par l’utilisateur.

Pour chaque exécution, consignez le fichier du modèle, la quantification, le commit de l’environnement d’exécution, la longueur du contexte, le prompt, le matériel, le système d’exploitation et les réglages thermiques. Ajoutez ensuite le temps consacré à l’authentification, la recherche, le reclassement, l’OCR, la file d’attente et le rendu de l’interface dans l’application réelle.

Testez un utilisateur, deux utilisateurs et le nombre maximal prévu avec le même contexte et le même ensemble documentaire. Ajoutez le travail en arrière-plan effectué pendant les heures de bureau. Relevez :

  • Le temps d’attente, le délai jusqu’au premier token et la durée de la réponse complète
  • La performance médiane et celle des requêtes lentes par rapport à l’objectif écrit
  • L’utilisation maximale du CPU, du GPU et de la mémoire système
  • La puissance du système entier, la température, la réduction de fréquence et les erreurs

Les moyennes peuvent masquer la requête qui renvoie un utilisateur vers un service non géré. Relevez les résultats p50 et p95 pour le jeu de test du bureau, en précisant que tous deux correspondent à cette configuration. Ils ne promettent rien pour un autre modèle ou une autre charge.

Employer un jeu d’acceptation qui teste aussi la qualité

La vitesse ne sert à rien si la réponse cite la mauvaise page ou extrait le mauvais montant. Construisez un jeu d’acceptation proposé de 50 à 100 prompts représentatifs avec les preuves attendues. Cette plage constitue une taille de test pratique pour la preuve d’un bureau. Elle ne forme pas un seuil de suffisance universel.

Incluez des tâches courantes, des scans difficiles et des questions dont les réponses sont absentes. Évaluez la justesse des citations, l’exactitude des extractions, l’abstention et l’acceptabilité par le réviseur pour chaque tâche. Conservez les résultats par langue et type de fichier afin qu’une bonne moyenne générale ne dissimule pas un processus faible sur les scans en français.

Le même jeu doit inclure une utilisation simultanée. Une configuration réussit seulement lorsque la qualité et la latence restent acceptables au pic prévu. Répétez le test après toute modification du modèle, de la quantification, de l’environnement d’exécution, du prompt, de l’analyseur ou des réglages de recherche.

Associez au jeu de qualité des contrôles opérationnels sur une instance de test isolée avec des données synthétiques :

  1. Arrêtez le service d’identité et confirmez que l’application refuse la recherche protégée.
  2. Remplissez un volume de préparation de test et vérifiez l’alerte ainsi que le refus sécurisé.
  3. Interrompez l’accès réseau, redémarrez l’appareil et restaurez une sauvegarde de test.
  4. Passez à un nouveau modèle, exécutez le jeu et confirmez que le modèle précédemment approuvé reste disponible jusqu’à l’acceptation.

Ces tests sont contrôlés et disposent d’étapes de reprise préparées. Il ne faut jamais provoquer une panne d’alimentation ou de stockage sur une appliance active contenant des données de production.

Concevoir la reprise avant l’arrivée de l’appareil

Une appliance unique au bureau représente une dépendance opérationnelle unique. Mesurez le temps de redémarrage, de restauration d’une sauvegarde, de reconstruction de l’index et le comportement de l’application lorsque le stockage ou le service d’identité est indisponible. Décidez quels documents et quelles données dérivées doivent revenir ensemble pour rendre le système utilisable.

Conservez le modèle et la configuration précédemment approuvés jusqu’à ce qu’une mise à jour réussisse le jeu d’acceptation. Documentez qui applique les correctifs du système d’exploitation et de l’environnement d’exécution, qui surveille le stockage et les journaux, et qui décide qu’un service défaillant peut être remis en production.

Le chemin de continuité doit correspondre à la sensibilité du travail. Un processus manuel dans le système documentaire, comptable ou de gestion du cabinet constitue généralement l’option la plus simple. Il demande au personnel de travailler plus lentement sans envoyer les données vers une nouvelle destination.

Un repli par API convient uniquement si ce prestataire, ce contrat et ce chemin de traitement ont reçu une approbation explicite pour la même catégorie de données. Un basculement automatique vers un cloud public peut contredire sans bruit la raison du choix de l’exécution locale. Laissez-le désactivé en l’absence d’une approbation délibérée et d’un test.

Incluez la reprise dans la démonstration du fournisseur. Restaurer le modèle tout en perdant les métadonnées de droits ou l’historique d’audit constitue une reprise incomplète.

Calculer le coût de possession à partir de mesures

Construisez un modèle de possession sur trois ans avec le même soin que le test de charge. Incluez le matériel, le stockage chiffré, la sauvegarde, l’onduleur, les modifications réseau, l’installation, l’intégration du modèle et de l’environnement d’exécution, la surveillance, le support, le risque de remplacement, la formation du personnel et le temps de contrôle professionnel.

Mesurez à la prise la puissance du système entier pendant la charge d’acceptation. La puissance nominale d’un GPU ne permet pas de calculer à elle seule la consommation annuelle de la station. La Commission fédérale de l’électricité publie des données tarifaires par commune et catégorie de clients. Utilisez donc le tarif professionnel applicable au bureau plutôt qu’une estimation nationale.

Dans un calcul fictif, un appareil mesuré à 0,65 kW en moyenne pendant un service de 8 heures chacun des 220 jours ouvrés consomme 0,65 × 8 × 220 = 1 144 kWh. Avec un tarif fictif de CHF 0,24 par kWh, la consommation en service représente 1 144 × CHF 0,24 = CHF 274,56 par an. Ce montant fictif exclut la veille, le refroidissement et les charges de secours. Le capital, le support et l’administration doivent provenir du devis daté et des hypothèses de personnel propres au bureau.

Comparez un service privé géré au même volume de documents, au même objectif de qualité et à la même classification des données. Ajoutez l’administration interne aux deux options. Le matériel local peut supprimer des frais par token tout en ajoutant les correctifs et la reprise. Un service géré peut réduire l’exploitation tout en introduisant des questions relatives au prestataire, au contrat et à la juridiction.

Le modèle de coût total pour une solution sur mesure ou une plateforme fournit un cadre plus large. Pour cet achat, la charge mesurée et le responsable opérationnel nommé comptent davantage qu’une fourchette générique de matériel.

Acheter la plus petite configuration qui réussit

La décision d’achat doit aboutir à une fiche de résultats plutôt qu’à une liste de spécifications impressionnantes. Consignez l’appareil et la pile logicielle qui ont satisfait les objectifs de qualité, de simultanéité, de latence et de reprise du bureau. Notez la marge au pic ainsi que les tâches qui exigent encore le processus manuel.

L’inférence locale acquiert ainsi une valeur pratique. Le personnel dispose d’un assistant utile pour le travail sensible approuvé, et le bureau sait comment il se comporte lorsque plusieurs personnes l’utilisent ou qu’un composant tombe en panne. L’appareil est dimensionné selon un processus réel au lieu d’un classement de modèles.

Choisissez la plus petite configuration qui réussit avec une marge mesurée suffisante pour la charge prévue. Réexécutez les mêmes tests après toute modification significative. Cette discipline maintient l’utilité de l’appliance bien après la décision d’achat et fournit au bureau des preuves pour sa prochaine mise à niveau au lieu d’une nouvelle estimation.

Questions fréquentes

De combien de mémoire une appliance IA pour petit bureau a-t-elle besoin ?

La mémoire dépend du modèle et de sa quantification, du contexte maximal, des sessions simultanées, des composants de recherche, de l’OCR, de l’environnement d’exécution et du système d’exploitation. Mesurez l’ensemble sur l’appareil candidat à charge maximale. La taille du fichier du modèle ne suffit pas, car le contexte actif et les services applicatifs utilisent aussi de la mémoire, tandis qu’un transfert vers le CPU ou le GPU peut entraîner une latence inacceptable.

Combien de personnes peuvent utiliser simultanément un appareil IA local ?

Il n’existe aucun nombre universel d’utilisateurs pour un appareil local. Exécutez les mêmes tâches scénarisées avec un utilisateur, deux utilisateurs et le pic prévu du bureau. Relevez le temps d’attente, le délai jusqu’au premier token, la durée de la réponse complète, la mémoire et les erreurs pendant l’indexation ou l’OCR habituel. L’appliance réussit seulement si les requêtes lentes restent dans l’objectif écrit du bureau.

Un benchmark de modèle prédit-il le temps de réponse perçu par le personnel ?

Un benchmark de modèle permet de comparer des exécutions contrôlées, mais peut exclure la tokenisation, l’échantillonnage, la recherche, la file d’attente et le temps d’interface. Utilisez-le pour documenter le fichier du modèle, la quantification, l’environnement d’exécution et le matériel, puis répétez le test dans l’application complète. Les mesures de bout en bout sur des documents représentatifs prouvent l’expérience utilisateur que le bureau achète.

Quelle solution de repli un bureau sensible doit-il utiliser si l’appliance tombe en panne ?

Un processus manuel dans les systèmes sources existants constitue généralement le repli le plus simple. Une route par API convient uniquement si le bureau a explicitement approuvé ce prestataire et cette destination pour la même catégorie de données. Évitez un basculement automatique vers un cloud public pour le travail sensible. Documentez qui déclare la panne, comment traiter les tâches en attente et comment remettre l’appliance en service après la reprise.

Comment un bureau doit-il calculer le coût total d’une appliance IA ?

Utilisez un modèle sur trois ans couvrant le matériel, le stockage, la sauvegarde, l’onduleur, le réseau, l’installation, l’intégration, la surveillance, le support, le risque de remplacement, la formation du personnel et le temps de contrôle. Ajoutez l’électricité du système entier mesurée au tarif professionnel local. Comparez avec un service privé géré à charge égale et incluez le temps d’administration, la reprise et le coût de la solution de repli convenue.

Insights

Passez de l’idée à l’action

Un appel de 30 minutes suffit pour savoir si un agent IA s’intègre à votre flux de travail — et ce qu’il rapporterait.