Qu'est-ce que Browse AI ?
Browse AI est une plateforme hébergée d’extraction et de surveillance Web sans code. Un utilisateur installe l'enregistreur, fait une démonstration de navigation et sélectionne des champs ou des listes ; Browse AI convertit cette session en un « robot » capable d'accepter des entrées, de suivre des pages, d'extraire des lignes structurées, de prendre des captures d'écran et de répéter selon un calendrier. Les robots prédéfinis évitent d'enregistrer pour des sources communes sélectionnées.
Le résultat peut rester dans l'espace de travail ou se déplacer via CSV, Google Sheets, Airtable, Amazon S3, l'API REST, les webhooks, Zapier, Make, Pabbly et des flux de travail plus larges. Browse AI positionne également les pages extraites comme nouveau contexte pour les pipelines LLM et RAG. Cela en fait plus qu'un grattoir ponctuel : il peut devenir une source de données opérationnelle, avec des obligations correspondantes en matière de fiabilité, de licence, de confidentialité et de traçabilité.
Robots, surveillance et fiabilité
Un robot peut ouvrir une page, se connecter, cliquer, saisir des paramètres, exposer du contenu caché, paginer, visiter des pages de détails, capturer des champs et comparer des exécutions ultérieures. Le grattage approfondi est utile pour transformer une liste en une ligne par article plus des détails, mais chaque page de détail est une tâche et un centre de coûts distincts.
No-code ne signifie pas sans entretien. Un bouton renommé, un DOM modifié, une expérience, des paramètres régionaux, une boîte de dialogue de cookie, une session expirée, un proxy bloqué, un défilement infini ou un JavaScript retardé peuvent créer des données manquantes ou décalées. Le CAPTCHA et les proxys résidentiels peuvent améliorer l'accès à des sites plus difficiles, mais ils ne garantissent pas l'exhaustivité ou l'autorisation. Traitez les changements de sélecteur et les exécutions « réussies » suspectes comme des incidents.
Pour la production, définissez le nombre de lignes attendu et les champs obligatoires, validez les types et l'unicité, échantillonnez par rapport à la source, stockez l'URL de la source et l'heure d'extraction, alertez en cas de dérive, mettez en quarantaine les modifications importantes et conservez une solution de secours manuelle ou sous licence. Testez la même source dans tous les états déconnecté/connecté, bureau, région, pagination et erreur.
Tarification actuelle et calcul du crédit
Free fournit 50 crédits mensuels, deux domaines, trois utilisateurs, des robots illimités et un accès aux fonctionnalités. Personnel commence à 19 $ par mois, facturé 228 $ par an avec 12 000 crédits initiaux, cinq domaines et trois utilisateurs ; son option mensuelle de 2 000 crédits est de 48 $. Professionnel commence à 69 $ par mois, facturé 828 $ par an avec 60 000 crédits, dix domaines et dix utilisateurs ; le mois commence à 87 $ pour 5 000 crédits. Premium commence à 500 $ par mois, facturé annuellement pour plus de 600 000 crédits, limites personnalisées et configuration gérée.
Les plans exposent également des variantes de crédit plus élevées. Les extensions et recharges de domaine varient selon le forfait et les conditions de facturation. Les crédits annuels peuvent être dépensés à tout moment de l’année, mais les crédits inutilisés sont réinitialisés à la fin du cycle. La conservation standard des données est indiquée comme étant de 90 jours ; La prime est personnalisée.
Sur les sites standards, chaque tâche coûte au moins un crédit, dix lignes coûtent un crédit et une capture d'écran coûte un crédit. Les sources premium imposent un minimum/multiplicateur de deux à dix crédits. Une liste de 100 éléments coûte environ dix crédits, mais la visite de 100 pages de détails en ajoute au moins 100. La surveillance de dix pages de détails tous les trois jours représente environ 100 crédits par mois avant les multiplicateurs premium, les tentatives, les captures d'écran ou les étapes du flux de travail. Estimez avec un vrai pilote et ajoutez une marge d'échec/recyclage.
Identifiants, données extraites et sécurité
La politique de confidentialité indique que les robots peuvent collecter des URL d'origine, des noms d'utilisateur, des cookies de session, des paramètres de stockage local et des mots de passe lorsque l'accès est requis ; les mots de passe sont cryptés. Browse AI indique que les entrées cryptées sensibles ne sont pas enregistrées, que l'assistance ne peut pas voir les entrées cryptées et que l'accès de l'assistance aux robots nécessite une demande explicite et est surveillé. Il signale l’achèvement du SOC 2 Type II et propose un centre de confiance.
La tarification standard indique une conservation de 90 jours, tandis que la politique de confidentialité utilise des périodes basées sur des objectifs et des obligations légales pour des informations personnelles plus larges. Déterminez séparément la durée de conservation des résultats, des captures d'écran, des journaux d'exécution, des cookies, des informations d'identification, des sauvegardes, des exportations, des artefacts de support et des données de compte supprimé. Faites pivoter les informations d'identification, utilisez un compte source dédié avec le moindre privilège, évitez les connexions personnelles, restreignez les rôles dans l'espace de travail et les clés API et révoquez l'accès lorsqu'un robot s'arrête.
Les conditions de Browse AI stipulent que les clients conservent des droits sur les données client, mais accordent les droits de traitement nécessaires au fonctionnement et à l'amélioration du service et à la création de données agrégées. La politique de confidentialité indique spécifiquement que les données de l'API Google Workspace ne sont pas conservées pour développer, améliorer ou former des modèles IA/ML généralisés ; n'étendez pas cette déclaration étroite à une promesse générale de non-formation pour chaque classe de données. Examinez le DPA opérationnel et les preuves de confiance pour les déploiements sensibles.
Suppression de la loi, des droits à la source et de l'IA en aval
La possibilité de charger une page ne constitue pas une licence pour collecter, republier, profiler ou vendre son contenu. Avant l'automatisation, enregistrez le propriétaire de la source, la méthode d'accès, les conditions, les instructions des robots, les limites de débit, les droits d'auteur/de base de données, la base de données personnelles, les obligations de notification et de suppression, les restrictions contractuelles et l'objectif en aval autorisé. Les données de connexion, les profils des personnes, les informations sanitaires/financières, les mineurs, les médias protégés par le droit d'auteur et les rééditions concurrentes nécessitent un examen approfondi.
Utilisez des calendriers lents et prévisibles, mettez en cache les pages inchangées, collectez uniquement les champs nécessaires, honorez la suppression et la suppression et fournissez l'attribution si nécessaire. Si le résultat alimente un LLM, le fournisseur LLM devient une autre destination avec ses propres risques en matière de formation, de rétention, d'emplacement et d'injection rapide. Conservez la provenance par ligne et traitez les instructions récupérées comme des données non fiables plutôt que comme des commandes exécutables.
Verdict
Browse AI est un pont pratique entre la navigation manuelle et les pipelines de données techniques. Son enregistreur, sa surveillance, ses intégrations et son niveau sans friction le rendent solide pour prouver qu'une source autorisée peut prendre en charge un flux de travail utile.
Adoptez-le avec discipline de production : validez les schémas et l'exhaustivité, calculez les crédits à partir des pages de détails et de la fréquence, isolez les informations d'identification, raccourcissez la conservation, autorisez la source du document et régissez chaque exportation. Le meilleur robot n’est pas seulement celui qui continue de fonctionner ; c'est celui dont les données restent exactes, autorisées, traçables et économiques.
