NuntixBot
Wenn Sie das hier lesen, ist NuntixBot vermutlich in Ihren Server-Logs aufgetaucht und Sie wollen wissen, was das ist. Diese Seite ist die kurze Antwort.
NuntixBot sammelt Material für nuntix.net, eine zweisprachige Technik-Nachrichtenseite. Betrieben wird er von derselben Person, die die Seite herausgibt; die Kontaktdaten stehen im Impressum.
Woran Sie ihn erkennen
NuntixBot/0.1 (+https://nuntix.net/en/bot.html)
Das ist die vollständige User-Agent-Zeichenkette. Alles andere, was sich
NuntixBot nennt, sind nicht wir — die Kennung lässt sich trivial fälschen, und
wir können das nicht verhindern. Wenn es darauf ankommt, prüfen Sie das
Verhalten, nicht den Namen.
Was er abruft
Drei Dinge, sonst nichts:
- RSS- und Atom-Feeds von Publikationen, die eine Redakteurin oder ein Redakteur ausdrücklich als Quelle eingetragen hat. Das ist der Großteil.
- Artikelseiten aus diesen Feeds, wenn der Feed nur eine Überschrift oder einen Zweizeiler liefert. Ein Abruf pro Artikel, und nur dann, wenn der Feed-Eintrag zu dünn zum Arbeiten ist.
- Gelegentlich Seiten aus einer Websuche, wenn die Redaktion zu einer Meldung mit nur einer Quelle nach weiterer Berichterstattung sucht. Höchstens fünf Seiten pro Anfrage, und nur auf Knopfdruck eines Menschen.
Er crawlt nicht. Es gibt kein Verfolgen von Links, kein Ablaufen einer Seite, kein Entdecken von Seiten jenseits dieser drei Fälle.
Wie Sie ihn stoppen
Tragen Sie das in Ihre robots.txt ein:
User-agent: NuntixBot
Disallow: /
Wir holen die robots.txt vor jedem der oben genannten Abrufe, halten sie je
Host sechs Stunden vor und befolgen, was darin steht — einschließlich eines
Crawl-delay, wenn Sie eines setzen, das länger ist als unser eigenes. Ein
Disallow mit dem Namen NuntixBot wirkt binnen sechs Stunden.
Ist Ihre robots.txt vorübergehend nicht erreichbar, behandeln wir die Seite
als offen und nicht als gesperrt, und vermerken das im Log. Wenn Ihnen lieber
wäre, dass wir eine Störung als Verbot lesen, schreiben Sie uns, dann tun wir
das.
Wenn es schneller gehen soll als sechs Stunden, oder ganz und unabhängig von
der robots.txt, erreichen Sie über das Impressum einen
Menschen.
Wie stark er zieht
- Bedingte Anfragen: wir senden
If-None-MatchundIf-Modified-Since, ein unveränderter Feed kostet Sie also ein304und keinen Inhalt. - Das Abrufintervall richtet sich danach, wie oft eine Quelle tatsächlich veröffentlicht: fünf Minuten im schnellsten, sechs Stunden im langsamsten Fall.
- Mindestens eine Sekunde zwischen zwei Anfragen, mehr wenn Ihre
robots.txtdarum bittet. - Wiederholte Fehlschläge vergrößern den Abstand, statt härter zu wiederholen.
Was wir damit machen
Artikel auf nuntix.net entstehen aus mehreren Quellen zugleich, KI-gestützt und vor der Veröffentlichung von einem Menschen geprüft. Jeder veröffentlichte Artikel nennt die Publikationen, aus denen er entstanden ist, und verlinkt sie.
Drei Dinge tun wir nicht, weil sie die üblichen Gründe sind, einen Bot zu sperren:
- Wir veröffentlichen Ihren Text nicht weiter. Quellmaterial ist internes Arbeitsmaterial. Die Datenbankrolle, die die öffentliche Seite bedient, hat auf die betreffende Spalte kein Zugriffsrecht — keine öffentliche Seite kann ihn also enthalten, auch nicht versehentlich.
- Wir verkaufen und teilen ihn nicht, und er ist kein Trainingsmaterial. Er dient dazu, einen Artikel zu schreiben und zu belegen, und bleibt danach, wo er ist.
- Wir sind kein Aggregator. Kein Strom Ihrer Überschriften, kein Einrahmen Ihrer Seiten. Was erscheint, ist eigener Text, der Sie zitiert.
Mehr dazu, wie die Seite arbeitet, steht auf der Seite Über uns.