Le nombre, les noms, les éditeurs, les prix, les entrées et les sorties des Data Apps changent en continu. Les outils du protocole MCP sont relativement stables. Cette page se concentre donc sur les contrats des outils et le flux général, et ne traite aucun instantané du catalogue comme une liste durable.
Deux niveaux de capacité
Pour une intégration à long terme avec une application fixe, notez son
app_id. namespace/app_name référence aussi une application, mais peut cesser de fonctionner si l’éditeur ou l’application est renommé.
Les six outils MCP
search_data_apps : chercher dans le catalogue
Découvrez des Data Apps avec des mots-clés métier. query accepte des mots-clés dans n’importe quelle langue. Laissez-le vide pour parcourir le catalogue qui vous est visible. Vous pouvez aussi filtrer avec type pour les applications de collecte ou de consultation (data) et de traitement (transform), et avec scope pour all, public, private ou shared.
Chaque carte de résultat comprend l’
app_id, le nom, le résumé, le mode d’exécution (sync / async), des indications d’entrée et de sortie, le prix de départ et la visibilité. Cherchez et comparez d’abord. N’exécutez pas avant confirmation.
get_data_app_details : lire le contrat complet
Appelez cet outil avant d’exécuter. Transmettez un app_id ou <namespace>/<app_name> pour obtenir :
input_schema: le JSON Schema standard que cette exécution doit respecter.output_schema: les champs qui peuvent être retournés.knowledge: limites de la capacité, latence attendue et points d’attention.pricing: description de la facturation.examples: exemples d’entrées à utiliser comme point de départ.
run_data_app : lancer une exécution
Transmettez app, un input conforme à l’input_schema et, si nécessaire, max_records pour plafonner le nombre de résultats. Si l’entrée ne correspond pas au contrat, l’outil retourne immédiatement [invalid-input] et signale le champ problématique.
Les valeurs de retour courantes incluent run_id, state, progress, usage, billing et next_step. Utilisez un petit max_records lors du premier essai pour vérifier les données, la durée et le coût.
get_run_status : vérifier le statut de l’exécution
Transmettez un run_id pour vérifier la progression, les détails d’échec, l’utilisation et le coût, sans lire les données. Pour les tâches asynchrones, utilisez wait_seconds (0-60) pour un long polling. Attendez 60 secondes par appel plutôt que d’interroger rapidement sans pause.
Les états courants sont QUEUED, RUNNING, SUCCEEDED, PARTIALLY_SUCCEEDED, FAILED et CANCELLED. En cas d’échec, consultez error.code, error.category, error.message et error.retryable.
get_run_result : lire les résultats
Lit au maximum 50 enregistrements par appel. Paginez avec offset, et utilisez fields pour demander un sous-ensemble de champs séparés par des virgules, comme title,price,url, afin que les champs volumineux inutiles n’encombrent pas la conversation.
Lorsque la réponse contient un handoff, le résultat est volumineux ou inadapté à une pagination supplémentaire dans la conversation. Suivez la commande SDK ou REST indiquée dans le handoff pour exporter un fichier, plutôt que de faire déplacer le JSON complet par l’agent à répétition.
cancel_run : annuler une exécution
Transmettez un run_id pour annuler une tâche en attente ou en cours. Une tâche en cours peut prendre quelques secondes pour s’arrêter de façon coopérative. Les résultats partiels déjà produits sont conservés et peuvent encore être lus avec get_run_result. Seules les données produites sont facturées.
Flux de travail standard
Applications synchrones et asynchrones
Recevoir un
run_id pour une tâche asynchrone ne signifie pas que l’extraction a réussi. Confirmez l’état final avant de lire les résultats, et ne soumettez pas à nouveau la même cible à cause de l’attente.
Comment travailler avec les Data Apps
Les Data Apps sont les capacités de données concrètes de Data Hub. De nouvelles arrivent et les existantes changent : cette page ne tient donc aucune liste figée. Avant utilisation, cherchez avecsearch_data_apps et confirmez les entrées, sorties, prix et limites actuels avec get_data_app_details.
Conseils de connexion et d’utilisation
- Application pas encore choisie : suivez Connexion générale : choisir une application dans l’agent pour connecter d’abord le MCP Data Hub, puis chercher, comparer et confirmer.
- Application fixe utilisée à long terme : utilisez Codex : connecter une application spécifique ou Claude Code : connecter une application spécifique pour réduire le périmètre des outils.
- Coûts ou gros volumes de données en jeu : appelez d’abord l’outil de détails pour vérifier
pricingetexamples, testez avec un petit volume de données et traitez lehandofflorsque vous avez besoin d’un résultat volumineux.
Le MCP général Data Hub est basé sur
https://mcp-v2.octoparse.com et prend en charge la clé API ou OAuth. La configuration de connexion et les paramètres actuels sont ceux que génère la Data Hub Open Platform. Il est différent du serveur MCP de scraping Octoparse de la navigation principale. Ne mélangez pas leurs adresses, leur authentification ni leurs noms d’outils.