
HTML, siglas de HyperText Markup Language, es el lenguaje de marcado que define la estructura y el significado del contenido de un documento web. Utiliza elementos y atributos para representar encabezados, párrafos, enlaces, imágenes, formularios y otras partes que el navegador puede procesar.
HTML describe el contenido, pero no concentra todas las funciones de una página. La presentación visual suele corresponder a CSS, mientras que JavaScript aporta comportamiento programable. HTML5 fue una etapa decisiva de su evolución; el estándar actual se mantiene de forma continua y se denomina simplemente HTML.
Índice de contenidos
Origen de HTML
Tim Berners-Lee desarrolló las primeras formas de HTML en el CERN a partir de 1990 para publicar y enlazar documentos en la Web. El lenguaje evolucionó durante los años noventa mediante distintas especificaciones y extensiones, hasta que el W3C coordinó versiones como HTML 3.2 y HTML 4. La compatibilidad entre navegadores fue una necesidad central de esa normalización.
Estándar actual
HTML 4.01, XHTML y después HTML5 reflejan etapas diferentes. HTML5 reunió la evolución del lenguaje con funciones necesarias para aplicaciones web, multimedia y formularios. La recomendación de 2014 marcó un hito, pero no congeló el desarrollo. El modelo vigente es el HTML Living Standard de WHATWG, actualizado de manera continua.
Por ello, HTML5 sigue siendo una búsqueda y una denominación extendida, aunque no describe una versión futura que deba suceder a otra de forma periódica. En la documentación actual, HTML moderno engloba el lenguaje vivo, sus reglas de análisis y las interfaces relacionadas que implementan los navegadores.
Estructura de un documento HTML
Un documento organiza su información mediante una jerarquía de elementos. Las etiquetas delimitan muchos de ellos, los atributos añaden datos y el anidamiento establece relaciones entre unas partes y otras. Una estructura mínima diferencia la información del documento de su contenido visible:
- Doctype: Indica al navegador que debe utilizar el modo de estándares para interpretar el documento.
- Elemento html: Contiene el documento y puede declarar su idioma mediante el atributo
lang. - Elemento head: Reúne título, codificación, metadatos y referencias a recursos que no forman el contenido principal.
- Elemento body: Contiene el material que se presenta en la página, como texto, imágenes, controles y enlaces.
- Elementos internos: Organizan el contenido de acuerdo con modelos de anidamiento y significados definidos por el estándar.
Las etiquetas no son los objetos finales que maneja el navegador. Son parte de la sintaxis serializada del archivo. Un elemento puede incluir texto, otros elementos y atributos como href, src o alt, siempre dentro de las reglas aplicables a cada tipo.
Cuando el navegador recibe un documento con tipo text/html, un analizador aplica las reglas de HTML y construye una representación en memoria. Esa representación forma parte del Document Object Model o DOM, un árbol de nodos que puede ser consultado y modificado por scripts.
HTML está diseñado para procesar numerosos errores de sintaxis de forma predecible. Esto permite mostrar documentos imperfectos, pero no convierte cualquier código en correcto. Un marcado válido reduce ambigüedades, facilita el mantenimiento y evita resultados distintos de los que pretendía quien creó la página.
Después del análisis, el navegador combina el DOM con las reglas de estilo y otros recursos para calcular la presentación. La ficha de renderizado web cubre ese proceso más amplio. HTML aporta la estructura de partida, pero no determina el aspecto final, la ejecución de scripts ni la comunicación con el servidor.
Semántica del marcado
La semántica expresa qué función cumple cada parte del contenido. Elementos como <nav>, <main>, <article>, <button> o los encabezados comunican una función reconocible, mientras que <div> y <span> son contenedores genéricos sin ese significado específico.
Accesibilidad web
Una elección semántica adecuada puede alimentar el árbol de accesibilidad que utilizan lectores de pantalla y otras tecnologías de asistencia. La accesibilidad web también depende de nombres comprensibles, orden lógico, navegación por teclado, contraste y otros factores. HTML es una base necesaria, no una garantía automática de accesibilidad.
Interpretación por buscadores
Los buscadores analizan el contenido y la estructura HTML para descubrir enlaces, interpretar encabezados, obtener metadatos y comprender la página. En una estrategia de SEO, conviene distinguir lo que aporta cada recurso:
- Title: Identifica el documento y suele ser una fuente para el título mostrado en resultados de búsqueda.
- Encabezados: Organizan secciones y ayudan a expresar la jerarquía editorial sin exigir una cantidad fija.
- Enlaces: Conectan recursos y proporcionan contexto mediante el destino y el texto enlazado.
- Texto alternativo: Describe imágenes relevantes cuando no pueden percibirse y aporta contexto sobre su función.
- Datos estructurados: Añaden anotaciones legibles por máquinas cuando representan fielmente información visible.
Ninguna etiqueta aislada garantiza posiciones. La calidad técnica depende también de que el contenido sea útil, rastreable, indexable y coherente con la intención de búsqueda, además del rendimiento y otros sistemas que quedan fuera de HTML.
Ecosistema web
HTML, CSS y JavaScript tienen responsabilidades relacionadas, pero distintas. HTML representa el significado y la estructura, CSS controla la presentación y JavaScript puede responder a eventos, modificar el DOM y coordinar lógica. Esta separación de responsabilidades facilita mantener y adaptar una interfaz.
Algunos elementos HTML ofrecen funciones integradas, como formularios, audio, vídeo o <canvas>. Otras capacidades, entre ellas geolocalización o almacenamiento, proceden de APIs web a las que accede el código. Aunque convivan en una aplicación, esas capacidades externas no forman parte del marcado HTML.
El resultado es un documento que puede funcionar como página informativa o como interfaz de una aplicación compleja. HTML actúa como estructura común para navegadores, buscadores, herramientas de asistencia y scripts, mientras las tecnologías complementarias amplían su presentación y comportamiento.
