Perplexity a annoncé le 25 août 2026 le lancement de Portable Computer, une version locale de sa plateforme agentique Computer, conçue pour exécuter des tâches d’intelligence artificielle sur le matériel possédé par l’utilisateur au lieu de les effectuer entièrement dans le cloud. La disponibilité commence sur les ordinateurs Nvidia DGX Spark et les appareils Linux équipés de processeurs graphiques Nvidia RTX, tandis que l’entreprise a déclaré que la prise en charge de Windows suivrait en septembre.
Le produit fonctionne avec les abonnements Pro, Max, Enterprise Pro et Enterprise Max. Il nécessite une carte RTX dotée d’au moins 24 Go de mémoire vidéo, ce qui équivaut approximativement à une GeForce RTX 3090 ou plus récente. Cette exigence signifie que l’exécution locale de la plateforme n’est pas accessible à la plupart des ordinateurs grand public, même si Perplexity la présente comme un moyen de simplifier l’exécution d’agents avancés par rapport à l’assemblage manuel de leurs composants.
Un ensemble local plutôt que plusieurs configurations
Portable Computer réunit dans une seule application les modèles locaux, le moteur d’inférence, l’agent d’orchestration des tâches, les outils, les connecteurs d’applications et un environnement d’isolation sécurisé. Le système peut examiner des dossiers de documents, analyser des données, préparer des rapports et accéder à des services tels que Google Drive, Gmail et GitHub, puis envoyer les résultats vers Slack grâce aux connecteurs disponibles.
Lors d’une démonstration présentée par l’entreprise, un agent fonctionnant avec le modèle Qwen 3.8 27B a examiné un ensemble de formulaires 1099 et de documents d’investissement sur un appareil DGX Spark, et a identifié des cas de paiement de frais inutiles. Comme l’exécution s’est déroulée sur l’appareil, le compteur de crédits d’utilisation cloud est resté à zéro. Perplexity affirme que chaque tâche commence localement et qu’aucune étape ne passe à un modèle cloud plus puissant sans demande d’autorisation.
Modèles locaux et conception spécifique pour les agents
Au lancement, les modèles Qwen 3.8 27B et PPLX 27B sont disponibles. Ce dernier a ensuite été entraîné par Perplexity pour être compatible avec l’architecture de son agent. Nvidia Nemotron 3.5 Lightning arrivera ultérieurement. La plateforme utilise vLLM pour héberger l’inférence, avec un mode avancé permettant à l’utilisateur de connecter son propre point de terminaison d’inférence.
Perplexity s’appuie sur l’idée que le modèle local et l’architecture de l’agent doivent être conçus conjointement. Selon un article de recherche publié par l’entreprise, des modèles comme Qwen 3.8 27B commencent à rencontrer des difficultés après environ 100 000 tokens, malgré l’annonce d’une fenêtre de contexte de 260 000 tokens. L’entreprise a donc adopté une invite système concise, un nombre limité d’outils et des « compétences » chargées à la demande, ainsi que des outils en ligne de commande consommant moins de contexte à la place de connecteurs MCP volumineux.
La plateforme impose en permanence une isolation au niveau du système d’exploitation et s’arrête également si l’environnement d’isolation n’est pas disponible, au lieu d’exécuter les outils avec les privilèges complets de l’utilisateur. Lorsqu’une aide d’un modèle cloud est demandée, le système examine le contexte à la recherche d’informations permettant d’identifier une personne et montre à l’utilisateur ce qui quittera l’appareil ; le modèle distant renvoie uniquement des instructions textuelles et n’accède ni aux fichiers ni aux outils locaux.
Qu’est-ce qui change concrètement ?
Le principal changement commercial consiste à transférer le coût d’utilisation du nombre de tokens consommés vers la capacité du matériel local. Un agent travaillant pendant des heures à examiner des documents ou à répéter une analyse n’accumulera pas, pendant l’exécution locale, de crédits d’utilisation cloud. Le fait que les données restent sur l’appareil peut également être utile aux organisations qui traitent des documents financiers, juridiques ou médicaux sensibles, la responsabilité de sécuriser et de gérer l’appareil restant toutefois à la charge de l’utilisateur ou de l’organisation.
Perplexity propose un modèle hybride plutôt qu’une rupture complète avec le cloud. Lors du test Terminal Bench 2.1, le modèle Qwen local a obtenu 59,6 % pour un coût marginal proche de zéro, et le score est passé à 73,0 % avec l’aide d’un conseiller Claude Opus 5, pour un coût estimé à 0,415 dollar par tâche, contre 82,4 % pour le modèle cloud seul, au coût de 0,65 dollar.
L’entreprise affirme que Computer a obtenu 82,6 % lors de son test interne Local Knowledge Work Bench, composé de 53 tâches, contre 77,6 % pour l’architecture Pi et 74,0 % pour Hermes avec le même modèle, tandis que PPLX 27B a porté le score à 85,4 %. Ces résultats proviennent toutefois des propres évaluations de Perplexity et nécessitent une vérification indépendante. L’entreprise reconnaît également que les modèles locaux restent inférieurs aux modèles avancés dans les raisonnements complexes et que l’escalade vers le cloud réduit l’écart sans le combler entièrement.
Limites et portée du partenariat
Le lancement relie l’objectif de Perplexity de proposer des agents plus privés et moins dépendants d’une facturation par token à celui de Nvidia de faire d’appareils comme DGX Spark des outils pratiques pour exécuter l’intelligence artificielle localement. Les deux entreprises avaient annoncé en juin 2025 une collaboration portant sur des modèles d’intelligence artificielle souverains destinés aux éditeurs et aux entreprises européennes de télécommunications.
Néanmoins, au lancement, Portable Computer reste limité à Linux et au matériel Nvidia avec un seuil élevé de mémoire vidéo, et ne comprend aucune voie annoncée pour la prise en charge d’Apple silicon. Le produit ne constitue donc pas une alternative générale aux services cloud ou à des outils comme Ollama, mais plutôt une tentative d’intégrer toute la couche agentique et d’inférence dans une expérience unique, avec un compromis clair entre la confidentialité et le coût d’une part, et les exigences matérielles ainsi que des performances plus faibles pour certaines tâches d’autre part.