01 — LA SALA DE CONTROL DE TU CONTENIDOcada mensaje inspeccionado, anotado, clasificado

El contenido
entra.
Los malos actores
no.

Tus moderadores dejan de filtrar spam a mano. Solo ven lo que el pipeline no ha podido decidir por sí solo.

[ UNIRME A LA LISTA DE ESPERA ]

ModShield es una API de moderación de contenido que puntúa cada publicación, registro y mensaje enviado a tu comunidad mediante ocho motores de detección — ML, reglas, confianza y reputación de identidades — y devuelve en menos de 100 ms un veredicto explicable: permitir, revisar o bloquear.

MODERACIÓN DE CONTENIDO EXPLICABLE API-FIRST · FAIL-OPEN · MODO SOMBRA
PIPELINE DE DETECCIÓN · TRAZA EN VIVO
MENSAJE ENTRANTE1/4 · lang=es
"Muy buen artículo — explicación clarísima de los pasos de migración. Me lo guardo."
RAW INPUT· · ·
TOKENIZE· · ·
ML CLASSIFY· · ·
RULES ENGINE· · ·
TRUST ENGINE· · ·
VERDICT· · ·
02 — TRES VEREDICTOS POSIBLEScada decisión se explica, no solo se dicta

ALLOW

Contenido limpio, autor de confianza, en tema. Pasa sin fricción.
"Muy buen artículo — explicación clarísima de los pasos de migración. Me lo guardo."
score
7
confidence
0.93
action
allow

REVIEW

Señales ambiguas. Retenido para un moderador antes de publicar.
"Great post! Check my profile for more tips — link in bio 🔗"
SELF_PROMOTIONFIRST_POST_LINK
score
55
confidence
0.41
action
send_to_review

BLOCK

Spam de alta confianza. Rechazado antes de que llegue a la comunidad.
"Je vends des comptes vérifiés, offre limitée, contactez-moi en DM"
COMMERCE_OFFERURGENCY_TRIGGEROFFSITE_REDIRECT
score
94
confidence
0.96
action
block
03 — PARA QUIÉN

Hecho para quienes limpian detrás de los spammers.

ModShield está dirigido a equipos que ya moderan a mano y no dan abasto, no a sitios que quieren una caja negra que decida por ellos.

FOROS COMUNITARIOS

Moderadores voluntarios pasan las tardes borrando los mismos anuncios de venta de cuentas, y una oleada de registros a las 3 de la madrugada queda sin respuesta hasta la mañana siguiente.

Flarum, Discourse, phpBB — conector o API REST
SAAS CON CONTENIDO DE USUARIOS

Comentarios, perfiles y formularios de contacto son una puerta abierta, y una lista de palabras prohibidas bloquea a tus clientes reales tan a menudo como a los spammers.

API REST, una llamada por evento
EQUIPOS CON OBLIGACIONES DE CUMPLIMIENTO

Tienes que justificar una eliminación ante un usuario, un cliente o un regulador — y «lo decidió el filtro» no es una respuesta.

Razones legibles por máquina, traza de auditoría completa, modo sombra
04 — 8 MOTORES DE DETECCIÓN EN SERIEfail-open: una caída degrada la puntuación, nunca el tráfico

Cada mensaje recorre una cadena completa antes de una decisión.

Los motores se ejecutan en secuencia y se enriquecen entre sí. Cada etapa puede añadir motivos. La decisión final refleja toda la cadena, no una sola señal.

01
FEATURE EXTRACTION
Características estructurales y de texto normalizado añadidas al evento antes de la puntuación.
40+ features
02
ML CLASSIFIER
Modelo de spam multilingüe fastText con respaldo heurístico basado en palabras clave. Fail-open.
multilingual fastText
03
TOPIC FIT
Relevancia por comunidad: contenido fuera de tema, perfil de publicación inusual, dominios no vistos.
per-community
04
RULES ENGINE
Reglas definidas por el tenant aplicadas tras el ML. Da a las comunidades control directo sobre las políticas.
tenant-defined
05
TRUST ENGINE
Historial de aprobación, spam y falsos positivos por actor, ponderado a lo largo del tiempo.
decays over time
06
IDENTITY REPUTATION
Directorio de identificadores e IP cifrados con HMAC entre tenants. Corroborado y luego decaído.
cross-tenant
07
SCORING ENGINE
Combina ML + reglas + confianza + reputación en una única puntuación numérica.
weighted combine
08
DECISION ENGINE
Compara la puntuación con los umbrales de SitePolicy. Emite veredicto, acción, severidad y motivos.
per-site policy
Beta privada abierta — reserva tu plaza.UNIRSE A LA LISTA DE ESPERA →
05 — UN ENDPOINT. UNA RESPUESTA EXPLICABLE.

POST.
Obtén un veredicto.
Sabe por qué.

Una sola llamada a la API devuelve no solo un veredicto, sino el desglose de la puntuación y cada motivo que contribuyó a la decisión. Tu equipo de moderación puede auditar, anular y entrenar desde el primer día.

AUTENTICACIÓN
Clave de API por sitio
FORMATO
JSON, REST
OBJETIVO DE LATENCIA
< 100ms p95
SI FALLA EL ML
Fail-open, motivo registrado
REQUEST
POST /api/v1/check HTTP/1.1
Host: api.modshield.net
X-Api-Key: ms_live_Kx9vTmL4pRqN8hZ2
Content-Type: application/json
{
"event_id": "post-842",
"platform": "flarum",
"event_type": "post.created",
"actor": { "external_id": "usr_4f2a9c" },
"content": { "body": "Je vends des comptes vérifiés,
offre limitée, contactez-moi en DM" }
}
RESPONSE
HTTP/1.1 200 OK
Content-Type: application/json
{
"decision_id": "dec_9f31c2",
"score": 94,
"computed_verdict": "block",
"effective_action": "block",
"assessment": "violating",
"severity": "high",
"confidence": 0.96,
"shadow": false,
"reasons": [
"COMMERCE_OFFER",
"OFFSITE_REDIRECT",
"URGENCY_TRIGGER",
"VELOCITY_BURST"
],
"model_version": "fasttext-multilingual-v1"
}

06 — LO QUE IMPORTA

< 100ms
Objetivo de latencia p95
8
Motores en serie en cada mensaje
100%
Decisiones con motivos legibles por máquina
0
Tráfico bloqueado cuando el modelo ML no está disponible

La cifra de latencia es el objetivo de ingeniería con el que construimos y probamos durante la beta privada, medido en nuestra propia infraestructura: no es un SLA contractual. Publicaremos cifras de producción medidas cuando el volumen de la beta las haga significativas. Las otras tres son propiedades del diseño: ocho motores, un motivo adjunto a cada decisión y ningún tráfico bloqueado cuando el modelo no está disponible.

07 — FAIL-OPEN POR DISEÑO

Una caída nunca bloquea tu tráfico.

Si el modelo de ML no está disponible, ModShield degrada la calidad de la puntuación, nunca la disponibilidad. Cada degradación se registra en reasonsJson con el motivo exacto.

ML CLASSIFIERstub fallback · score=0.5DOWN
TOPIC FITtopic_fit=0.71OK
RULES ENGINE1 rule matchedOK
TRUST ENGINEtrust_score=+0.2OK
DECISION ENGINEreason: ml_unavailableDEGRADED
VEREDICTOREVISAR (degradado)

08 — PREGUNTAS

¿Qué pasa con el contenido que ModShield marca?

Nada que no hayas pedido. Cada sitio tiene un modo: en modo sombra las decisiones se registran pero nunca se aplican, para que puedas compararlas con lo que habrían hecho tus moderadores. Cuando activas la aplicación, el veredicto determina la acción que ejecuta tu conector.

¿Cuánto costará?

El acceso a la beta privada es gratuito y todavía no hay ninguna cifra publicada: los planes se están dimensionando con el uso real de la beta en lugar de adivinarlos por adelantado. Los precios se anunciarán antes de la disponibilidad general, primero a quienes estén en la lista de espera, y no se cobrará nada de lo consumido durante la beta.

¿Se almacenan datos personales de mis usuarios?

Los correos, nombres de usuario, números de teléfono y dominios de enlaces se cifran con HMAC-SHA256 antes de almacenarse, usando un secreto (pepper) que guarda tu instancia, y la reputación se construye sobre esos hashes, no sobre los valores originales. Las direcciones IP se tratan aparte: nunca se almacenan en eventos individuales, y una dirección solo se registra cuando acumula reputación propia o proviene de una lista de bloqueo tuya o de un feed público.

¿Qué idiomas cubre la detección?

El modelo incluido es un clasificador fastText entrenado con ejemplos en inglés, francés y chino, no un conjunto de reglas exclusivo del inglés. La cobertura es más sólida en esos tres idiomas; en los demás, las señales de reputación, velocidad y reglas siguen aplicándose, y puedes añadir reglas para patrones específicos de cada idioma.

¿De dónde sale la cifra de menos de 100 ms?

Es el objetivo de ingeniería con el que se construye y se somete a pruebas de carga la API, medido en nuestra propia infraestructura; no es un SLA contractual ni una cifra tomada de tráfico de producción de clientes, porque todavía no lo hay. Tu propio cliente mide el ida y vuelta, y el panel muestra la latencia del modelo observada en tu tráfico, de modo que puedes comprobar la afirmación en lugar de creerla; publicaremos p95 medidos cuando el volumen de la beta los haga significativos.

¿Con qué plataformas funciona ModShield?

Un conector oficial para Flarum está en beta privada. Cualquier otra plataforma — Discourse, phpBB, un foro propio o cualquier sitio con contenido de usuarios — se integra mediante la API REST: una llamada POST por contenido, una respuesta JSON con el veredicto, la puntuación y las razones.

¿Qué pasa si el modelo ML se cae?

Nada bloqueante: ModShield es fail-open por diseño. Si el modelo no está disponible, los demás motores — reglas, reputación, velocidad — siguen funcionando. La calidad de la puntuación se degrada, la disponibilidad nunca, y cada degradación queda registrada con su razón exacta.

¿Cuánto tarda la integración?

Un solo endpoint. Con el conector de Flarum, minutos: una instalación con composer y una clave API. Mediante la API REST, calcula alrededor de un día para conectar tus eventos — publicaciones, registros, mensajes — y probarlo todo en modo sombra antes de aplicar nada.

¿Cómo consigo acceso?

ModShield está en beta privada. Apúntate a la lista de espera con tu email — indicarnos tu plataforma y qué necesitas proteger nos ayuda a priorizar tu acceso. Abrimos de forma progresiva, por orden de llegada.

¿Puedo probarlo sin afectar a mi comunidad?

Sí — para eso existe el modo sombra. Envía tráfico real, recibe decisiones reales, sin aplicar nada. Los informes te muestran exactamente qué se habría bloqueado.

Protege tu comunidad. Explica cada decisión.

BETA PRIVADA — LISTA DE ESPERA
TU PLATAFORMA — OPCIONAL
¿QUÉ HAY QUE PROTEGER? — OPCIONAL

Guardamos tu dirección de correo para contactarte sobre el acceso a ModShield, y nada más. Sin newsletter, sin terceros, puedes darte de baja respondiendo. Política de privacidad

El acceso a la beta privada es gratuito. Los precios se publicarán antes de la disponibilidad general y quienes estén en la lista de espera los conocerán primero.

VER LA FAQ →
DESPLIEGA EN MINUTOS
# 1. Install the Flarum connector
composer require modshield/flarum-connector
# 2. Add your site API key
php flarum modshield:configure \
--key=ms_live_Kx9vTmL4pRqN8hZ2
# 3. Every post is now checked.

Conectores en beta privada — el acceso API llega primero, los conectores después.