PRD — RoboNews : Plateforme d'actualités Robotique × IA
**Version :** 1.0 · **Date :** 11 juin 2026 · **Statut :** Draft pour validation
**Auteurs :** Lead Architect / Product Manager
- --
1. Vision produit
RoboNews est le média de référence francophone (extensible multilingue) sur la **convergence Robotique / Intelligence Artificielle** : humanoïdes, manipulation, VLA models (Vision-Language-Action), sim-to-real, edge AI, cobotique industrielle.
**Proposition de valeur unique :** chaque sujet est lisible à **trois niveaux de profondeur** — Grand Public, Décideurs, Ingénieurs — depuis la même base éditoriale. Un lecteur choisit sa "lentille", pas son média.
**Modèle éditorial hybride :** des agents de veille automatisée (ArXiv, GitHub, blogs labs, flux presse) alimentent un pipeline de pré-rédaction ; un **curateur humain** valide, édite et publie. L'IA propose, l'humain dispose.
- --
2. Personas et défis utilisateurs
2.1 Persona A — "Camille", Grand Public curieux
- **Profil :** 25-55 ans, suit la tech via réseaux sociaux et podcasts, pas de bagage technique.
- **Défis :**
- L'actualité robotique/IA est soit sensationnaliste, soit incompréhensible (jargon, papers).
- Difficulté à distinguer hype et avancée réelle.
- **Solutions produit :**
- Niveau de lecture **"Essentiel"** : 3-5 paragraphes, analogies, zéro jargon non défini, visuel d'illustration.
- Encadré systématique "Pourquoi c'est important" et "Hype-mètre" (évaluation curateur : démonstration vs produit déployé).
- Glossaire contextuel : termes techniques cliquables avec définition inline.
2.2 Persona B — "Karim", Décideur (CTO, VC, dir. innovation, acheteur industriel)
- **Profil :** comprend les enjeux, manque de temps, raisonne en marché, coûts, maturité, risques.
- **Défis :**
- Besoin de signaux business (levées, TRL, partenariats, supply chain) noyés dans le contenu technique.
- Pas d'outil pour suivre un domaine précis (ex : "manipulation dextre") dans la durée.
- **Solutions produit :**
- Niveau de lecture **"Stratégique"** : impact marché, acteurs, maturité technologique (échelle TRL), chiffres clés, timeline d'adoption estimée.
- Briefs hebdomadaires thématiques par email (digest généré depuis les tags, validé par le curateur).
- Pages "Dossiers" agrégeant tous les articles d'un thème avec frise chronologique.
2.3 Persona C — "Lin", Ingénieur·e / Chercheur·se
- **Profil :** roboticienne ML, lit les papers, veut le détail reproductible.
- **Défis :**
- La presse tech ne cite pas les sources primaires (paper, repo, dataset, benchmark).
- Veille fragmentée entre ArXiv, GitHub Trending, X/Bluesky, Discord.
- Recherche par mot-clé inefficace pour des concepts ("apprentissage par imitation pour préhension" ≠ littéral).
- **Solutions produit :**
- Niveau de lecture **"Technique"** : architecture des modèles, benchmarks chiffrés, code blocks, formules (LaTeX), liens paper/repo/dataset obligatoires.
- **Recherche sémantique vectorielle** : requêtes en langage naturel, résultats par similarité conceptuelle.
- Métadonnées structurées : modèle, framework, licence, hardware cible, liens DOI/ArXiv ID.
- --
3. Fonctionnalités détaillées
F1 — Système de tags et niveaux de lecture
**Principe :** un **Article** (l'unité éditoriale, un sujet) contient jusqu'à trois **Renditions** (Essentiel / Stratégique / Technique). Les trois renditions partagent titre maître, sources, tags ; chacune a son propre corps, titre adapté, et méta SEO.
- **Sélecteur de niveau persistant** : toggle global (header) mémorisé (cookie + profil si connecté). Changement de niveau **sans rechargement** ni perte de position dans l'article (ancres sémantiques partagées entre renditions).
- **Règles éditoriales :**
- Une rendition "Essentiel" est obligatoire pour publier (porte d'entrée universelle).
- Renditions manquantes : fallback affiché avec bandeau "Version technique en cours de rédaction" + CTA notification.
- **Taxonomie à trois axes (tags structurés) :**
1. **Domaine** (hiérarchique) : `humanoïdes`, `manipulation`, `locomotion`, `perception`, `VLA/foundation-models`, `simulation`, `cobotique`, `drones`, `médical`, `agriculture`…
2. **Type de contenu** : `breaking`, `analyse`, `dossier`, `interview`, `paper-review`, `release-radar` (sorties GitHub/modèles).
3. **Maturité** : `recherche`, `prototype`, `pilote-industriel`, `produit`, `déployé-à-l'échelle` (alimente le Hype-mètre).
- Tags gérés dans le CMS comme entités (pas chaînes libres) : slug, description par niveau, image, relations.
F2 — Moteur de recherche vectoriel
- **Recherche hybride** : combinaison score vectoriel (similarité cosinus sur embeddings) + score lexical (BM25 / full-text) avec fusion RRF (Reciprocal Rank Fusion). Le lexical rattrape les requêtes exactes (noms propres, références "RT-2", "π0"), le vectoriel rattrape les requêtes conceptuelles.
- **Indexation par chunks** : chaque rendition est découpée (~300-500 tokens, overlap 15 %), chaque chunk embedé avec métadonnées (article, rendition/niveau, tags, date). Permet de pointer vers la **section** pertinente, pas seulement l'article.
- **Filtrage par niveau de lecture** : la recherche respecte le niveau actif de l'utilisateur (un Grand Public ne reçoit pas des chunks "Technique" en premier) mais propose un élargissement explicite.
- **Pages "Similaires"** : recommandations en fin d'article par proximité vectorielle (même index, requête = embedding de l'article courant), filtrées par récence.
- **UX :** recherche instantanée (debounce 200 ms) avec réponses < 300 ms P95 ; suggestions de requêtes ; mise en évidence du passage correspondant.
F3 — Gestion des flux d'actualités (veille agents + curation)
- **Sources ingérées (v1) :** ArXiv (cs.RO, cs.AI, cs.LG, cs.CV), GitHub (releases + trending sur topics robotique), flux RSS/Atom (blogs labs : DeepMind, NVIDIA, Figure, Boston Dynamics, 1X, Unitree…, presse spécialisée), Hugging Face (nouveaux modèles VLA/robotique), YouTube (chaînes labs, métadonnées seulement).
- **Pipeline en 4 étapes :**
1. **Collecte** : agents connecteurs par source, exécution planifiée, normalisation en format pivot (`RawItem`).
2. **Scoring & dédoublonnage** : similarité vectorielle inter-items (un même sujet couvert par 5 sources = 1 cluster), score de pertinence (proximité avec la ligne éditoriale, vélocité sociale, nouveauté).
3. **Pré-rédaction** : pour les clusters au-dessus du seuil, un agent LLM génère un **brouillon structuré** (proposition des 3 renditions + tags + sources citées) déposé dans le CMS en statut `draft-agent`.
4. **Curation humaine** : file de revue dans le CMS ; le curateur édite, complète, vérifie les sources, publie ou rejette (le rejet alimente le scoring en feedback).
- **Garde-fous :** aucun contenu agent publié sans validation humaine (v1) ; traçabilité complète (chaque brouillon lié à ses `RawItems` sources) ; attribution et liens vers sources primaires obligatoires.
- **File de veille "Radar"** : page publique listant les signaux bruts validés rapidement (titre + lien + 1 phrase), entre le tweet et l'article — couvre l'exhaustivité sans coût éditorial complet.
F4 — Expérience de lecture technique
- Code blocks avec coloration syntaxique (Shiki), copie 1-clic, nom de fichier, diff highlighting.
- Formules mathématiques LaTeX (KaTeX, rendu serveur).
- Schémas : Mermaid (rendu build-time) + images/SVG zoomables.
- Notes de bas de page, citations académiques formatées (BibTeX export sur les paper-reviews).
- Table des matières flottante, temps de lecture par rendition, mode sombre.
F5 — Comptes et personnalisation (v1 léger)
- Compte optionnel : niveau de lecture par défaut, thèmes suivis, newsletter.
- Sans compte : tout reste accessible, préférences en cookie.
F6 — Optimisation SEO et Structure Métadonnées
- **URL Unique & Canonique** : Chaque article dispose d'une URL unique `/article/[slug]`. Les trois niveaux de lecture sont servis sur cette même URL (par exemple via un paramètre de requête `?level=essentiel` ou en adaptant la réponse SSR selon les cookies/headers), avec une balise `<link rel="canonical">` pointant systématiquement vers la version par défaut (`/article/[slug]`).
- **Métadonnées Dynamiques** : Les balises `<title>`, `<meta name="description">` et les tags Open Graph sont dynamiquement mis à jour côté serveur (SSR/ISR) selon le niveau de lecture demandé pour maximiser le CTR (Taux de clic) dans les moteurs de recherche.
- **Balisage Schema.org (Structured Data)** :
- **Essentiel / Stratégique** : Balisé en `NewsArticle`.
- **Technique** : Balisé en `TechArticle` avec intégration de propriétés spécifiques (`dependencies`, `proficiencyLevel: "Expert"`, `citation`).
- **Indexabilité** : Pour s'assurer que les trois niveaux de lecture sont indexés par Google sans pénalité de "duplicate content" (car le contenu technique et grand public diffèrent totalement) :
- La version par défaut (par exemple, "Essentiel") est indexée sur l'URL principale.
- Les versions alternatives sont accessibles via des URLs propres pour les moteurs de recherche (ex: `/article/[slug]/technique`, `/article/[slug]/strategique`) avec des balises alternatives `<link rel="alternate" href="..." hreflang="...">` ou des annotations sémantiques claires pour indiquer qu'il s'agit de déclinaisons de profondeur d'un même sujet.
- --
4. Critères de succès et KPIs
4.1 Engagement
| KPI | Définition | Cible M+6 | Cible M+12 |
|---|---|---|---|
| Visiteurs uniques / mois | GA4 / Plausible | 30 000 | 120 000 |
| Taux d'usage du sélecteur de niveau | % sessions avec ≥ 1 changement de niveau | ≥ 15 % | ≥ 20 % |
| Profondeur de lecture | % scroll ≥ 75 % sur articles | ≥ 45 % | ≥ 55 % |
| Recherches / session | usage moteur sémantique | ≥ 0,4 | ≥ 0,7 |
| CTR "Similaires" | clics recommandations fin d'article | ≥ 8 % | ≥ 12 % |
| Abonnés newsletter | inscrits actifs (open rate > 35 %) | 3 000 | 15 000 |
4.2 Rétention technique (persona Ingénieur)
| KPI | Définition | Cible M+6 |
|---|---|---|
| Rétention hebdo cohorte "Technique" | % lecteurs niveau Technique revenant sous 7 j | ≥ 25 % |
| Clics sources primaires | CTR liens paper/repo par article technique | ≥ 30 % |
| Durée session niveau Technique | moyenne | ≥ 4 min |
| Précision recherche | % recherches suivies d'un clic top-3 | ≥ 60 % |
4.3 SEO & Performance
| KPI | Définition | Cible |
|---|---|---|
| Core Web Vitals | LCP / INP / CLS (P75 mobile) | LCP < 2,0 s · INP < 200 ms · CLS < 0,1 |
| Trafic organique | % du trafic total à M+12 | ≥ 50 % |
| Indexation | pages indexées / pages publiées | ≥ 95 % |
| Positions top-10 | requêtes cibles ("actualité robotique", noms de modèles/robots) | 50 requêtes à M+12 |
| Rich results | articles éligibles schema.org `NewsArticle`/`TechArticle` | 100 % |
4.4 Efficacité du pipeline éditorial
| KPI | Définition | Cible |
|---|---|---|
| Délai signal → publication | médiane détection agent → article publié | < 24 h (breaking < 4 h) |
| Taux d'acceptation brouillons agents | brouillons publiés (après édition) / générés | ≥ 40 % |
| Temps curateur / article | édition d'un brouillon agent vs rédaction from scratch | −50 % |
- --
5. Hors périmètre v1
- Commentaires / communauté (v2).
- Application mobile native (PWA suffit en v1).
- Traduction automatique multilingue (préparé dans le schéma, non activé).
- Publication automatique sans validation humaine.
6. Risques produit
| Risque | Mitigation |
|---|---|
| Coût éditorial des 3 renditions | Essentiel seul obligatoire ; pré-rédaction agent ; renditions ajoutées selon traction du sujet |
| Hallucinations dans les brouillons agents | validation humaine systématique, citations sources obligatoires, vérification des chiffres en checklist de revue |
| Dépendance API sources (rate limits, CGU) | connecteurs modulaires, caches, respect robots.txt/CGU, fallback RSS |
| SEO : contenu proche entre renditions | URL canonique unique par article, renditions servies sur la même URL (voir TAD §6) |