EN·DE

NuntixBot

Wenn Sie das hier lesen, ist NuntixBot vermutlich in Ihren Server-Logs aufgetaucht und Sie wollen wissen, was das ist. Diese Seite ist die kurze Antwort.

NuntixBot sammelt Material für nuntix.net, eine zweisprachige Technik-Nachrichtenseite. Betrieben wird er von derselben Person, die die Seite herausgibt; die Kontaktdaten stehen im Impressum.

Woran Sie ihn erkennen

NuntixBot/0.1 (+https://nuntix.net/en/bot.html)

Das ist die vollständige User-Agent-Zeichenkette. Alles andere, was sich NuntixBot nennt, sind nicht wir — die Kennung lässt sich trivial fälschen, und wir können das nicht verhindern. Wenn es darauf ankommt, prüfen Sie das Verhalten, nicht den Namen.

Was er abruft

Drei Dinge, sonst nichts:

  1. RSS- und Atom-Feeds von Publikationen, die eine Redakteurin oder ein Redakteur ausdrücklich als Quelle eingetragen hat. Das ist der Großteil.
  2. Artikelseiten aus diesen Feeds, wenn der Feed nur eine Überschrift oder einen Zweizeiler liefert. Ein Abruf pro Artikel, und nur dann, wenn der Feed-Eintrag zu dünn zum Arbeiten ist.
  3. Gelegentlich Seiten aus einer Websuche, wenn die Redaktion zu einer Meldung mit nur einer Quelle nach weiterer Berichterstattung sucht. Höchstens fünf Seiten pro Anfrage, und nur auf Knopfdruck eines Menschen.

Er crawlt nicht. Es gibt kein Verfolgen von Links, kein Ablaufen einer Seite, kein Entdecken von Seiten jenseits dieser drei Fälle.

Wie Sie ihn stoppen

Tragen Sie das in Ihre robots.txt ein:

User-agent: NuntixBot Disallow: /

Wir holen die robots.txt vor jedem der oben genannten Abrufe, halten sie je Host sechs Stunden vor und befolgen, was darin steht — einschließlich eines Crawl-delay, wenn Sie eines setzen, das länger ist als unser eigenes. Ein Disallow mit dem Namen NuntixBot wirkt binnen sechs Stunden.

Ist Ihre robots.txt vorübergehend nicht erreichbar, behandeln wir die Seite als offen und nicht als gesperrt, und vermerken das im Log. Wenn Ihnen lieber wäre, dass wir eine Störung als Verbot lesen, schreiben Sie uns, dann tun wir das.

Wenn es schneller gehen soll als sechs Stunden, oder ganz und unabhängig von der robots.txt, erreichen Sie über das Impressum einen Menschen.

Wie stark er zieht

  • Bedingte Anfragen: wir senden If-None-Match und If-Modified-Since, ein unveränderter Feed kostet Sie also ein 304 und keinen Inhalt.
  • Das Abrufintervall richtet sich danach, wie oft eine Quelle tatsächlich veröffentlicht: fünf Minuten im schnellsten, sechs Stunden im langsamsten Fall.
  • Mindestens eine Sekunde zwischen zwei Anfragen, mehr wenn Ihre robots.txt darum bittet.
  • Wiederholte Fehlschläge vergrößern den Abstand, statt härter zu wiederholen.

Was wir damit machen

Artikel auf nuntix.net entstehen aus mehreren Quellen zugleich, KI-gestützt und vor der Veröffentlichung von einem Menschen geprüft. Jeder veröffentlichte Artikel nennt die Publikationen, aus denen er entstanden ist, und verlinkt sie.

Drei Dinge tun wir nicht, weil sie die üblichen Gründe sind, einen Bot zu sperren:

  • Wir veröffentlichen Ihren Text nicht weiter. Quellmaterial ist internes Arbeitsmaterial. Die Datenbankrolle, die die öffentliche Seite bedient, hat auf die betreffende Spalte kein Zugriffsrecht — keine öffentliche Seite kann ihn also enthalten, auch nicht versehentlich.
  • Wir verkaufen und teilen ihn nicht, und er ist kein Trainingsmaterial. Er dient dazu, einen Artikel zu schreiben und zu belegen, und bleibt danach, wo er ist.
  • Wir sind kein Aggregator. Kein Strom Ihrer Überschriften, kein Einrahmen Ihrer Seiten. Was erscheint, ist eigener Text, der Sie zitiert.

Mehr dazu, wie die Seite arbeitet, steht auf der Seite Über uns.

Stand: 28.07.2026