RoboNews
← Retour aux actualités

PRD — RoboNews : Plateforme d'actualités Robotique × IA

**Version :** 1.0 · **Date :** 11 juin 2026 · **Statut :** Draft pour validation

**Auteurs :** Lead Architect / Product Manager

  • --

1. Vision produit

RoboNews est le média de référence francophone (extensible multilingue) sur la **convergence Robotique / Intelligence Artificielle** : humanoïdes, manipulation, VLA models (Vision-Language-Action), sim-to-real, edge AI, cobotique industrielle.

**Proposition de valeur unique :** chaque sujet est lisible à **trois niveaux de profondeur** — Grand Public, Décideurs, Ingénieurs — depuis la même base éditoriale. Un lecteur choisit sa "lentille", pas son média.

**Modèle éditorial hybride :** des agents de veille automatisée (ArXiv, GitHub, blogs labs, flux presse) alimentent un pipeline de pré-rédaction ; un **curateur humain** valide, édite et publie. L'IA propose, l'humain dispose.

  • --

2. Personas et défis utilisateurs

2.1 Persona A — "Camille", Grand Public curieux

  • **Profil :** 25-55 ans, suit la tech via réseaux sociaux et podcasts, pas de bagage technique.
  • **Défis :**
  • L'actualité robotique/IA est soit sensationnaliste, soit incompréhensible (jargon, papers).
  • Difficulté à distinguer hype et avancée réelle.
  • **Solutions produit :**
  • Niveau de lecture **"Essentiel"** : 3-5 paragraphes, analogies, zéro jargon non défini, visuel d'illustration.
  • Encadré systématique "Pourquoi c'est important" et "Hype-mètre" (évaluation curateur : démonstration vs produit déployé).
  • Glossaire contextuel : termes techniques cliquables avec définition inline.

2.2 Persona B — "Karim", Décideur (CTO, VC, dir. innovation, acheteur industriel)

  • **Profil :** comprend les enjeux, manque de temps, raisonne en marché, coûts, maturité, risques.
  • **Défis :**
  • Besoin de signaux business (levées, TRL, partenariats, supply chain) noyés dans le contenu technique.
  • Pas d'outil pour suivre un domaine précis (ex : "manipulation dextre") dans la durée.
  • **Solutions produit :**
  • Niveau de lecture **"Stratégique"** : impact marché, acteurs, maturité technologique (échelle TRL), chiffres clés, timeline d'adoption estimée.
  • Briefs hebdomadaires thématiques par email (digest généré depuis les tags, validé par le curateur).
  • Pages "Dossiers" agrégeant tous les articles d'un thème avec frise chronologique.

2.3 Persona C — "Lin", Ingénieur·e / Chercheur·se

  • **Profil :** roboticienne ML, lit les papers, veut le détail reproductible.
  • **Défis :**
  • La presse tech ne cite pas les sources primaires (paper, repo, dataset, benchmark).
  • Veille fragmentée entre ArXiv, GitHub Trending, X/Bluesky, Discord.
  • Recherche par mot-clé inefficace pour des concepts ("apprentissage par imitation pour préhension" ≠ littéral).
  • **Solutions produit :**
  • Niveau de lecture **"Technique"** : architecture des modèles, benchmarks chiffrés, code blocks, formules (LaTeX), liens paper/repo/dataset obligatoires.
  • **Recherche sémantique vectorielle** : requêtes en langage naturel, résultats par similarité conceptuelle.
  • Métadonnées structurées : modèle, framework, licence, hardware cible, liens DOI/ArXiv ID.
  • --

3. Fonctionnalités détaillées

F1 — Système de tags et niveaux de lecture

**Principe :** un **Article** (l'unité éditoriale, un sujet) contient jusqu'à trois **Renditions** (Essentiel / Stratégique / Technique). Les trois renditions partagent titre maître, sources, tags ; chacune a son propre corps, titre adapté, et méta SEO.

  • **Sélecteur de niveau persistant** : toggle global (header) mémorisé (cookie + profil si connecté). Changement de niveau **sans rechargement** ni perte de position dans l'article (ancres sémantiques partagées entre renditions).
  • **Règles éditoriales :**
  • Une rendition "Essentiel" est obligatoire pour publier (porte d'entrée universelle).
  • Renditions manquantes : fallback affiché avec bandeau "Version technique en cours de rédaction" + CTA notification.
  • **Taxonomie à trois axes (tags structurés) :**

1. **Domaine** (hiérarchique) : `humanoïdes`, `manipulation`, `locomotion`, `perception`, `VLA/foundation-models`, `simulation`, `cobotique`, `drones`, `médical`, `agriculture`…

2. **Type de contenu** : `breaking`, `analyse`, `dossier`, `interview`, `paper-review`, `release-radar` (sorties GitHub/modèles).

3. **Maturité** : `recherche`, `prototype`, `pilote-industriel`, `produit`, `déployé-à-l'échelle` (alimente le Hype-mètre).

  • Tags gérés dans le CMS comme entités (pas chaînes libres) : slug, description par niveau, image, relations.

F2 — Moteur de recherche vectoriel

  • **Recherche hybride** : combinaison score vectoriel (similarité cosinus sur embeddings) + score lexical (BM25 / full-text) avec fusion RRF (Reciprocal Rank Fusion). Le lexical rattrape les requêtes exactes (noms propres, références "RT-2", "π0"), le vectoriel rattrape les requêtes conceptuelles.
  • **Indexation par chunks** : chaque rendition est découpée (~300-500 tokens, overlap 15 %), chaque chunk embedé avec métadonnées (article, rendition/niveau, tags, date). Permet de pointer vers la **section** pertinente, pas seulement l'article.
  • **Filtrage par niveau de lecture** : la recherche respecte le niveau actif de l'utilisateur (un Grand Public ne reçoit pas des chunks "Technique" en premier) mais propose un élargissement explicite.
  • **Pages "Similaires"** : recommandations en fin d'article par proximité vectorielle (même index, requête = embedding de l'article courant), filtrées par récence.
  • **UX :** recherche instantanée (debounce 200 ms) avec réponses < 300 ms P95 ; suggestions de requêtes ; mise en évidence du passage correspondant.

F3 — Gestion des flux d'actualités (veille agents + curation)

  • **Sources ingérées (v1) :** ArXiv (cs.RO, cs.AI, cs.LG, cs.CV), GitHub (releases + trending sur topics robotique), flux RSS/Atom (blogs labs : DeepMind, NVIDIA, Figure, Boston Dynamics, 1X, Unitree…, presse spécialisée), Hugging Face (nouveaux modèles VLA/robotique), YouTube (chaînes labs, métadonnées seulement).
  • **Pipeline en 4 étapes :**

1. **Collecte** : agents connecteurs par source, exécution planifiée, normalisation en format pivot (`RawItem`).

2. **Scoring & dédoublonnage** : similarité vectorielle inter-items (un même sujet couvert par 5 sources = 1 cluster), score de pertinence (proximité avec la ligne éditoriale, vélocité sociale, nouveauté).

3. **Pré-rédaction** : pour les clusters au-dessus du seuil, un agent LLM génère un **brouillon structuré** (proposition des 3 renditions + tags + sources citées) déposé dans le CMS en statut `draft-agent`.

4. **Curation humaine** : file de revue dans le CMS ; le curateur édite, complète, vérifie les sources, publie ou rejette (le rejet alimente le scoring en feedback).

  • **Garde-fous :** aucun contenu agent publié sans validation humaine (v1) ; traçabilité complète (chaque brouillon lié à ses `RawItems` sources) ; attribution et liens vers sources primaires obligatoires.
  • **File de veille "Radar"** : page publique listant les signaux bruts validés rapidement (titre + lien + 1 phrase), entre le tweet et l'article — couvre l'exhaustivité sans coût éditorial complet.

F4 — Expérience de lecture technique

  • Code blocks avec coloration syntaxique (Shiki), copie 1-clic, nom de fichier, diff highlighting.
  • Formules mathématiques LaTeX (KaTeX, rendu serveur).
  • Schémas : Mermaid (rendu build-time) + images/SVG zoomables.
  • Notes de bas de page, citations académiques formatées (BibTeX export sur les paper-reviews).
  • Table des matières flottante, temps de lecture par rendition, mode sombre.

F5 — Comptes et personnalisation (v1 léger)

  • Compte optionnel : niveau de lecture par défaut, thèmes suivis, newsletter.
  • Sans compte : tout reste accessible, préférences en cookie.

F6 — Optimisation SEO et Structure Métadonnées

  • **URL Unique & Canonique** : Chaque article dispose d'une URL unique `/article/[slug]`. Les trois niveaux de lecture sont servis sur cette même URL (par exemple via un paramètre de requête `?level=essentiel` ou en adaptant la réponse SSR selon les cookies/headers), avec une balise `<link rel="canonical">` pointant systématiquement vers la version par défaut (`/article/[slug]`).
  • **Métadonnées Dynamiques** : Les balises `<title>`, `<meta name="description">` et les tags Open Graph sont dynamiquement mis à jour côté serveur (SSR/ISR) selon le niveau de lecture demandé pour maximiser le CTR (Taux de clic) dans les moteurs de recherche.
  • **Balisage Schema.org (Structured Data)** :
  • **Essentiel / Stratégique** : Balisé en `NewsArticle`.
  • **Technique** : Balisé en `TechArticle` avec intégration de propriétés spécifiques (`dependencies`, `proficiencyLevel: "Expert"`, `citation`).
  • **Indexabilité** : Pour s'assurer que les trois niveaux de lecture sont indexés par Google sans pénalité de "duplicate content" (car le contenu technique et grand public diffèrent totalement) :
  • La version par défaut (par exemple, "Essentiel") est indexée sur l'URL principale.
  • Les versions alternatives sont accessibles via des URLs propres pour les moteurs de recherche (ex: `/article/[slug]/technique`, `/article/[slug]/strategique`) avec des balises alternatives `<link rel="alternate" href="..." hreflang="...">` ou des annotations sémantiques claires pour indiquer qu'il s'agit de déclinaisons de profondeur d'un même sujet.
  • --

4. Critères de succès et KPIs

4.1 Engagement

KPIDéfinitionCible M+6Cible M+12
Visiteurs uniques / moisGA4 / Plausible30 000120 000
Taux d'usage du sélecteur de niveau% sessions avec ≥ 1 changement de niveau≥ 15 %≥ 20 %
Profondeur de lecture% scroll ≥ 75 % sur articles≥ 45 %≥ 55 %
Recherches / sessionusage moteur sémantique≥ 0,4≥ 0,7
CTR "Similaires"clics recommandations fin d'article≥ 8 %≥ 12 %
Abonnés newsletterinscrits actifs (open rate > 35 %)3 00015 000

4.2 Rétention technique (persona Ingénieur)

KPIDéfinitionCible M+6
Rétention hebdo cohorte "Technique"% lecteurs niveau Technique revenant sous 7 j≥ 25 %
Clics sources primairesCTR liens paper/repo par article technique≥ 30 %
Durée session niveau Techniquemoyenne≥ 4 min
Précision recherche% recherches suivies d'un clic top-3≥ 60 %

4.3 SEO & Performance

KPIDéfinitionCible
Core Web VitalsLCP / INP / CLS (P75 mobile)LCP < 2,0 s · INP < 200 ms · CLS < 0,1
Trafic organique% du trafic total à M+12≥ 50 %
Indexationpages indexées / pages publiées≥ 95 %
Positions top-10requêtes cibles ("actualité robotique", noms de modèles/robots)50 requêtes à M+12
Rich resultsarticles éligibles schema.org `NewsArticle`/`TechArticle`100 %

4.4 Efficacité du pipeline éditorial

KPIDéfinitionCible
Délai signal → publicationmédiane détection agent → article publié< 24 h (breaking < 4 h)
Taux d'acceptation brouillons agentsbrouillons publiés (après édition) / générés≥ 40 %
Temps curateur / articleédition d'un brouillon agent vs rédaction from scratch−50 %
  • --

5. Hors périmètre v1

  • Commentaires / communauté (v2).
  • Application mobile native (PWA suffit en v1).
  • Traduction automatique multilingue (préparé dans le schéma, non activé).
  • Publication automatique sans validation humaine.

6. Risques produit

RisqueMitigation
Coût éditorial des 3 renditionsEssentiel seul obligatoire ; pré-rédaction agent ; renditions ajoutées selon traction du sujet
Hallucinations dans les brouillons agentsvalidation humaine systématique, citations sources obligatoires, vérification des chiffres en checklist de revue
Dépendance API sources (rate limits, CGU)connecteurs modulaires, caches, respect robots.txt/CGU, fallback RSS
SEO : contenu proche entre renditionsURL canonique unique par article, renditions servies sur la même URL (voir TAD §6)