Le bot SereneReader
Ce que fait notre collecteur de flux, comment il se présente, et comment le bloquer.
Ce qu'est SereneReader
SereneReader est un lecteur de flux. Quand quelqu'un s'abonne à votre flux RSS ou Atom, nos serveurs le récupèrent en son nom et lui affichent les nouveaux articles.
Pour afficher une image d'aperçu, nous récupérons également chaque page d'article une fois afin de lire sa balise og:image, ainsi que le favicon de votre site pour la barre latérale.
User-Agent
Chaque requête émise par nos serveurs s'identifie avec cette chaîne :
SereneReader/1.0 (+https://serenereader.com/bot)Ce que nous récupérons
- Les URL de flux auxquelles des personnes se sont abonnées.
- Chaque page d'article, une seule fois, en lisant au plus 1 Mo de HTML pour trouver la balise og:image.
- Le favicon de votre site.
Nous n'explorons jamais un site, ne suivons jamais les liens des pages d'articles et ne récupérons rien auquel personne n'est abonné.
Fréquence
Les flux sont actualisés selon un calendrier. Lorsque votre serveur envoie un en-tête ETag ou Last-Modified, l'actualisation suivante transmet If-None-Match ou If-Modified-Since, de sorte qu'un flux inchangé ne génère qu'une réponse 304 sans corps.
Chaque page d'article est récupérée une seule fois pour son image d'aperçu. Si la page est inaccessible, nous nous arrêtons : un échec permanent tel qu'une erreur 404 est mémorisé pendant 30 jours, et un échec temporaire comme un délai dépassé ou une erreur serveur est retenté jusqu'à trois fois avec un délai croissant, puis ignoré pendant au moins une heure.
Un code 429 ou 503 nous indique de ralentir. Pour les flux, nous repoussons la prochaine actualisation avec un délai progressif et, en cas de 429, d'au moins la valeur de votre Retry-After. Pour les pages d'articles, nous pouvons réessayer jusqu'à trois fois sur environ dix minutes, puis attendre au moins une heure, ou aussi longtemps que votre Retry-After le demande, jusqu'à sept jours.
robots.txt
Avant de récupérer une page d'article ou un favicon, nous lisons votre robots.txt et respectons les règles Disallow ainsi que le crawl-delay pour User-agent: SereneReader, en revenant au groupe * si nécessaire.
Les URL de flux sont différentes. Un flux est récupéré au nom d'un lecteur qui s'y est abonné ; nous le traitons donc comme le Feedfetcher de Google : les règles Disallow du groupe * ne lui sont pas appliquées. Un groupe User-agent: SereneReader qui interdit le chemin du flux est toujours respecté, et le délai d'exploration s'applique aux flux exactement comme au reste.
Si votre robots.txt est inaccessible en raison d'une erreur serveur, nous considérons que la récupération est autorisée. Un abonnement est un consentement explicite de la part d'un lecteur, et un fichier robots défaillant ne devrait pas interrompre son flux.
Comment nous bloquer
Bloquez ou limitez le User-Agent ci-dessus au niveau de votre serveur ou pare-feu, ou écartez-nous dans robots.txt avec un groupe qui nous désigne. Une règle visant tous les bots ne bloque pas les récupérations de flux ; celle-ci, si :
User-agent: SereneReader
Disallow: /Bloquer l'URL de votre flux arrête les actualisations pour tous les abonnés, pas seulement pour un lecteur.
Signatures de requêtes
Les requêtes sont signées avec Web Bot Auth (signatures de messages HTTP, RFC 9421) afin que vous puissiez vérifier qu'elles proviennent bien de nous. Nos clés publiques sont publiées à l'adresse :
https://serenereader.com/.well-known/http-message-signatures-directoryAdresses IP sortantes
Les actualisations planifiées des flux et les récupérations d'images d'aperçu proviennent de ces adresses statiques. La récupération unique effectuée lorsqu'un utilisateur ajoute un flux pour la première fois provient de nos serveurs web et ne figure pas dans cette liste — une liste blanche basée uniquement sur l'IP la rejettera.
162.220.234.241
152.55.180.242
152.55.180.243Liste lisible par machine/bot/ips.json
Contact
Des questions sur notre trafic, ou quelque chose à nous signaler ? Contactez-nous.