# robots.txt — LapsoWork (https://lapsowork.com) # # Estructura deliberadamente minimalista (RFC 9309): un único grupo `User-agent: *`. # NO crear grupos por bot: un crawler que encuentra su propio grupo DEJA DE HEREDAR # los Disallow del grupo `*`, así que cada Disallow futuro habría que replicarlo en # todos los grupos (bug real que tuvimos en trackia y petazeta). # # Todos los bots de buscadores y de IA están permitidos. Los que nos interesan # (citación en vivo y presencia en los modelos), documentados aquí: # Búsqueda/citación: Googlebot, Bingbot, OAI-SearchBot, ChatGPT-User, # Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User, # DuckAssistBot, Amazonbot, Applebot, MistralAI-User, YouBot # Entrenamiento (presencia de marca en los pesos): GPTBot, ClaudeBot, CCBot, # meta-externalagent, Applebot-Extended, Google-Extended # No usar tokens muertos o inexistentes: el opt-in real de Gemini/AI Overviews es # Google-Extended (no existe variante con prefijo Googlebot-), los antiguos # tokens de Anthropic están deprecados y el de Cohere nunca se documentó. User-agent: * Allow: / # Ruta interna de Cloudflare (email-decode, challenges), sin contenido propio. Disallow: /cdn-cgi/ # Restos del WordPress que Google sigue rastreando y devuelven 404 correctos: # la REST API y el CSS de Complianz con el placeholder {banner_id} literal # (esa URL nunca existió). Bloquearlos los saca del informe de 404 de GSC. Disallow: /wp-json/ Disallow: /wp-content/uploads/complianz/ Sitemap: https://lapsowork.com/sitemap-index.xml # llms.txt: https://lapsowork.com/llms.txt # llms.txt (EN): https://lapsowork.com/en/llms.txt # llms.txt (FR): https://lapsowork.com/fr/llms.txt # llms.txt (CA): https://lapsowork.com/ca/llms.txt # llms.txt (GL): https://lapsowork.com/gl/llms.txt