Reconstrucción del sitio hoy.upr.edu originalmente publicado en septiembre de 2009 para memorializar la transición presidencial de la Universidad de Puerto Rico.

Acerca de esta reproducción · no del sitio original

Cómo se reconstruyó este sitio

Fuentes, verificación de integridad, registro completo de modificaciones y lagunas.

English version   ← Volver al sitio

La Universidad Hoy fue el sitio público de la transición presidencial de la Universidad de Puerto Rico. Se publicó en septiembre de 2009, en hoy.upr.edu, para dejar constancia de lo hecho y de lo que quedaba por hacer al cerrarse una presidencia y comenzar otra. El proyecto fue dirigido por José Luis Cruz Rivera, entonces Vicepresidente de Asuntos Estudiantiles y coordinador del plan estratégico de la universidad, Diez para la Década, quien encabezó el equipo de transición hasta el final de la presidencia de Antonio García Padilla el 30 de septiembre de 2009.

Hoy no queda nada de aquello en línea. El dominio hoy.upr.edu dejó de resolver hace años, y Google Sites clásico, la plataforma sobre la que se construyó el sitio, fue descontinuado en 2021. Lo que usted está viendo se reconstruyó en 2026 a partir de las capturas que conservó el Wayback Machine del Internet Archive.

Conviene distinguir dos cosas. Una es el sitio de 2009, que es lo que se reproduce. La otra es esta reconstrucción, que es de 2026 y no existía entonces. Todo lo que se explica en esta página pertenece a la segunda: la franja que aparece arriba de cada página, esta misma página, las capturas que se abren al pulsar un enlace externo. El sitio original no tenía nada de eso. Lo que sí es del sitio original son sus páginas y sus documentos, y esta página explica exactamente de dónde salió cada uno.

97.5%
de lo que el sitio ofrecía
82/83
páginas del mapa del sitio
483
documentos recuperados
16
documentos perdidos
484 MB
de material recuperado

Cada archivo se comprobó contra la huella criptográfica que el propio Internet Archive publica para él: 911 coincidieron exactamente. En la sección 4 se explica por qué ese número no cubre la totalidad, y qué se hizo con el resto.

Por qué no bastó con descargar el Internet Archive

La pregunta es razonable: si el archivo conservó capturas del sitio, ¿qué hubo que reconstruir? La respuesta corta es que una captura no es un sitio. El Internet Archive guarda páginas sueltas, tal como las encontró su rastreador en un momento dado. Navegarlas allí funciona hasta que uno pulsa un enlace: los documentos no abren, las imágenes faltan, la hoja de estilo no carga, y no hay manera de saber qué falta ni por qué. Reconstruir el sitio consistió en averiguar todo eso.

Lo que hubo que descubrir

El sitio vivía en dos direcciones a la vez, archivadas de forma muy distinta. Estaba hoy.upr.edu, el dominio propio, con capturas desde 2009; y estaba la dirección nativa de Google Sites, barrida masivamente en noviembre de 2020, poco antes del cierre de la plataforma. Ninguna de las dos alcanza por sí sola: la primera conserva la estructura original, la segunda llegó mucho más hondo. Reconocer que eran el mismo sitio, y fundir ambas en un solo espacio de direcciones, fue el primer paso.

Google Sites clásico nunca servía un documento directamente. Cada enlace a un PDF era en realidad una redirección HTTP 302 hacia una dirección firmada y temporal en otro servidor de Google. Esto tiene una consecuencia incómoda: la suma de verificación que el archivo publica para ese registro describe la redirección, no el documento. Quien descargue esas direcciones sin seguir la cadena obtiene 485 archivos HTML de redirección donde debería haber 485 documentos, y si además confía en la suma publicada, creerá que están verificados.

El propio sitio llevaba dentro la lista de todo lo que contenía. Google generaba un mapa del sitio con JavaScript, y ese código incrusta la jerarquía completa en formato JSON. El script murió con la plataforma, así que la página se ve permanentemente colapsada, pero los datos siguen ahí. Recuperarlos es lo que permite decir cuántas páginas faltan en lugar de suponerlo a partir de los enlaces que uno alcanzó a ver, y es la diferencia entre un inventario y una estimación.

Había documentos que nunca estuvieron en el sitio. Quince memoriales de presupuesto se servían desde una carpeta pública de Dropbox. Dropbox retiró ese tipo de enlace en 2017 y el archivo nunca capturó los ficheros, porque eran descargas directas tras una redirección. Son invisibles para cualquier medición hecha sobre los recursos del sitio, y sin embargo el lector que pulsa el enlace pierde un documento igual.

Y había contenido que no era un archivo. El «Mensaje del Presidente» era un componente incrustado que reproducía un vídeo alojado en YouTube. Ningún rastreo de ficheros podía recuperarlo: no había fichero que recuperar. El vídeo fue borrado de YouTube y tampoco se archivó allí.

Los problemas técnicos que hubo que resolver

El esfuerzo

La reconstrucción se hizo en una sola sesión continua de once horas, entre José Luis Cruz Rivera y Claude, el asistente de programación de Anthropic. Produjo veintidós programas, unas 4,300 líneas de código, y en el camino indexó 3,160 registros de captura, descargó 1,428 archivos, y generó 61 capturas de pantalla de sitios enlazados. Los 485 enlaces a documentos se comprobaron uno por uno contra el servidor final, y las 4,841 referencias del sitio se revisan por completo cada vez que se reconstruye.

Sin una herramienta de este tipo, el obstáculo no habría sido escribir el código. Habría sido el descubrimiento: nadie documenta que Google Sites servía sus adjuntos tras una redirección firmada, ni que el mapa del sitio lleva la jerarquía dentro de un script muerto. Esas cosas se averiguan pidiendo un PDF, recibiendo HTML, y persiguiendo el motivo. Una estimación razonable para una sola persona, trabajando a tiempo completo, está entre seis y diez semanas.

Pero el problema mayor no es la lentitud, sino que casi todos los errores de este tipo de trabajo son silenciosos. Un despliegue informó «éxito» mientras servía errores 404 en casi todas las páginas. Un fallo propio borró la hoja de estilo de quince páginas y las dejó sin formato. Un pie de foto afirmaba conservar unas imágenes que en realidad nunca se archivaron. Una cifra de recuperación excluía dieciséis documentos perdidos por un tecnicismo sobre dónde estaban alojados. Ninguno de esos fallos se anuncia: todos parecen correctos hasta que alguien los comprueba. Verificar a esta escala, y volver a verificar después de cada cambio, es lo que separa una reconstrucción de una copia que aparenta estarlo.

El método

Todo el proceso está automatizado en veintidós programas que pueden volver a ejecutarse, y se gobierna desde un registro único: nada cuenta como recuperado hasta que sus bytes están en disco y verificados. Los originales sin modificar se guardan aparte de la reconstrucción, de modo que ésta puede rehacerse desde cero sin volver a consultar el archivo, y cualquier afirmación de esta página puede comprobarse contra el material de partida. El resto de esta página es ese registro.

1. Identificación

Sitio originalhoy.upr.edu, La Universidad Hoy, publicado en septiembre de 2009
Dirección nativasites.google.com/a/upr.edu/launiversidadhoy
InstituciónUniversidad de Puerto Rico
Fuente de la reproducciónWayback Machine, Internet Archive (web.archive.org)
Rango de capturas2009-09-29, 2024-08-05
Fecha de la reconstrucción2026-07-28 / 29

El rango de capturas llega hasta 2024, pero eso no significa que el sitio siguiera vivo todo ese tiempo. Mide cuánto tiempo el archivo siguió visitando un sitio que ya no cambiaba. El contenido es de 2009. Cuatro de cada cinco registros de captura provienen de un solo barrido de noviembre de 2020, hecho antes del cierre de Google Sites; apenas un 14% corresponde a los años 2009-2012, y lo posterior a 2020 son unas pocas visitas sueltas.

2. Autoría y método de trabajo

La reconstrucción se realizó en una sola sesión de trabajo entre José Luis Cruz Rivera y Claude, el asistente de programación de Anthropic, utilizando Claude Code.

Planificación y diseño del métodoClaude Fable 5
Implementación y ejecuciónClaude Opus 5
Dirección, decisiones y validaciónJosé Luis Cruz Rivera
Fecha2026-07-28 / 29
Horario28 de julio, 21:15, 29 de julio, 06:45, MST (UTC-7), Flagstaff, Arizona
Intercambios en la conversación24

El método fue diseñado primero y sometido a revisión antes de escribir código. Todo el proceso, descarga, verificación, ensamblaje e informes, está automatizado en programas que pueden volver a ejecutarse; ningún archivo se editó a mano.

3. Fuentes

El sitio era accesible en dos direcciones equivalentes. Se indexaron las capturas de todas las direcciones que utilizó:

FuentePeriodo archivadoRegistros
hoy.upr.edu (dominio propio)2009-09-29 → 2014517
sites.google.com/a/upr.edu/launiversidadhoyprincipalmente el barrido de noviembre de 2020, previo al cierre de Google Sites2643
*-sites.googlegroups.com (servidores de adjuntos)alcanzados siguiendo las redirecciones archivadasn/a

La captura más antigua que existe, de cualquier tipo, es del 29 de septiembre de 2009, es decir, la víspera del último día de la presidencia de Antonio García Padilla. El archivo alcanzó el sitio prácticamente en el momento para el que fue hecho, y esa fecha corrobora por sí sola cuándo se publicó, sin depender del recuerdo de nadie.

4. Verificación de integridad

El índice CDX del Internet Archive publica, para cada captura, su propia suma de verificación SHA-1. Se recalculó esa suma sobre cada archivo descargado y se comparó con la publicada por el archivo.

Descargas exitosas1422
Suma SHA-1 recalculada y coincidente con la del Internet Archive911
Páginas HTML descargadas684
Páginas HTML verificadas por suma682 (99.7%)

Los documentos PDF no admiten esta comprobación, y la razón es técnica: Google Sites clásico nunca servía un adjunto directamente. Cada enlace a un documento era una redirección HTTP 302 hacia una dirección firmada y temporal en un servidor googlegroups.com. La suma que el índice publica para ese registro corresponde a la redirección, no al documento. Esos archivos se validaron estructuralmente: firma binaria (%PDF), tipo de contenido y tamaño.

Dos capturas HTML tardías (2022 y 2023) no coincidieron con su suma publicada. Ninguna de las dos se utiliza aquí: esas dos páginas proceden de capturas anteriores que sí verificaron. Todas las páginas que se muestran en esta reproducción provienen de capturas verificadas por suma.

5. Selección de capturas

El sitio original se publicó una vez, para coincidir con el último día de la presidencia de Antonio García Padilla, y no se revisó después. Esa afirmación se comprobó en lugar de darse por supuesta. El HTML siempre difiere entre años, porque Google modificaba su propia estructura de página, así que la comparación se hizo sobre el texto extraído y no sobre el marcado.

De 65 páginas capturadas más de una vez, dos páginas de contenido difieren, y la diferencia va en dirección de pérdida. La captura del 29 de septiembre de 2009 conserva entradas de navegación que las capturas posteriores ya no tienen: Blog, Diez para la Década, Avanza y La Universidad: Inversión Estratégica de Puerto Rico. Las otras cuatro páginas que difieren son páginas que Google generaba dinámicamente (cambios recientes, búsqueda, mapa del sitio) y no forman parte del contenido del sitio.

Decisión: se utiliza la captura verificada más antigua de cada página, por ser demostrablemente la más completa y la más próxima a la publicación.

El conjunto versions/ conserva todas las capturas distintas de todas las páginas, sin modificar, de manera que esta decisión puede revisarse o revertirse sin volver al archivo.

Como el rastreador temprano no alcanzó todas las páginas, la reproducción no procede uniformemente de 2009. El origen por año de captura es: 2009 (6 páginas), 2010 (36), 2011 (10), 2012 (8), 2019 (1) y 2020 (35). Dado que el texto de esas páginas no difiere entre capturas, esto afecta a la antigüedad de la captura, no al contenido.

6. Registro de modificaciones

Esta es la lista completa de las diferencias entre los archivos originales y lo que se muestra aquí.

Estructurales, necesarias para que el sitio funcione fuera de línea

  1. Reescritura de enlaces. Las direcciones absolutas que apuntaban a hoy.upr.edu o a la dirección nativa se convirtieron en rutas relativas. El texto, el orden y el destino de los enlaces no cambian.
  2. Declaración de codificación. El archivo servía charset=utf-8 únicamente en la cabecera HTTP; las páginas no llevan <meta charset>. Un servidor de archivos estáticos no reproduce esa cabecera, por lo que los acentos se mostraban corrompidos (Estratégico). Se insertó una etiqueta <meta charset="utf-8"> en cada página. Es una etiqueta que no estaba en los bytes originales; sólo afecta a la interpretación de la codificación, no altera ningún carácter del texto.
  3. Recursos de tema. Las hojas de estilo, scripts e imágenes del tema se servían desde www.gstatic.com. Se descargaron desde el Internet Archive (no de Google hoy) y se sirven localmente.

De contenido, divergencias declaradas

  1. Un vídeo restituido desde una copia personal. El panel «Mensaje del Presidente» era un componente de Google Sites que incrustaba un vídeo de YouTube (identificador VDtJX5AQ9Iw). Nunca fue un archivo del sitio, por lo que ningún rastreo podía recuperarlo; el vídeo fue eliminado de YouTube y tampoco se archivó allí. José Luis Cruz Rivera aportó el MP4 original desde una copia de seguridad personal. Se muestra en su lugar, marcado en el código como data-provenance="personal-backup" y registrado por separado: no se contabiliza como material recuperado del archivo. Es el único archivo de esta reproducción que no procede del Internet Archive.
  2. Un enlace roto desactivado. La portada enlazaba UPRINVERSIONESTRATEGICA.pdf («La Universidad: Inversión Estratégica de Puerto Rico»). Ese documento no existe en ningún archivo bajo ninguna forma de dirección. Su enlace se convirtió en texto plano: el texto sigue visible en la página; sólo se retiró el hipervínculo inservible. El marcado original se conserva sin modificar y el documento sigue figurando en el informe de lagunas.
  3. Dos enlaces redirigidos. junta-de-subastas y junta-de-apelaciones-1 figuraban en la navegación del sitio desde 2009, pero ningún rastreador llegó a capturar ninguna de las dos direcciones. Cuando se intentó por primera vez (julio de 2011 en un caso, noviembre de 2020 en el otro) ya devolvían error 404. Tampoco aparecen en las capturas del mapa del sitio desde octubre de 2009. No es posible determinar a partir del archivo si esas páginas llegaron a existir: entre la aparición del enlace y el primer intento de captura median dos años en un caso y once en el otro. Abren una página que explica exactamente esto. Una versión anterior de esta reconstrucción las enlazaba a la página actual de cada organismo en upr.edu; se retiró, porque ofrecer una página de 2025 en lugar de una perdida disimula la pérdida aunque se etiquete.
  4. El informe anual 2008-2009, vuelto a enlazar. Este documento no estaba disponible cuando el sitio se publicó. José Luis Cruz Rivera lo sometió para publicación más tarde, cuando ya estaba disponible y él había dejado su posición, y por eso el enlace aparece en las capturas a partir de enero de 2010 y no en la portada de septiembre de 2009 que sirve de base a esta reconstrucción. El documento sí se recuperó, así que dejarlo sin enlazar lo habría dejado presente pero inalcanzable desde la navegación. Se añadió a la lista «Informes Anuales UPR», con el atributo data-added="1" y una nota explicativa. Es un enlace que la portada de septiembre de 2009 no tenía. Ningún otro material posterior se trajo de vuelta.
  5. Los enlaces externos abren capturas de época. El sitio enlazaba a ocho propiedades de la UPR en su barra lateral y, a lo largo de sus páginas, a recintos, agencias acreditadoras y servicios. Esos servidores siguen existiendo, pero muestran contenido de 2026. Cada enlace externo abre ahora una página local con la captura de ese sitio más cercana al 29 de septiembre de 2009, con la fecha de captura indicada en el pie, más enlaces al sitio actual y al Internet Archive. Solo se muestran capturas de la época (2012 o anteriores): una captura posterior no documenta lo que el sitio enlazaba, así que cuando el archivo no conserva ninguna del periodo, la página lo dice en vez de mostrar una versión de 2013 o 2025. Cada captura lleva además una nota de que una copia archivada solo muestra lo que el rastreador alcanzó a guardar.
  6. Aviso de reconstrucción y esta página. Se añadió una franja en la parte superior de cada página, deliberadamente ajena al diseño del sitio, que identifica el documento como reproducción y enlaza aquí. Ni la franja ni esta página formaban parte del sitio original.

Lo que no se hizo

No se editó, reescribió, corrigió ni reordenó ningún texto. No se alteró ningún documento: todos los PDF son idénticos byte a byte a los que sirvió el archivo. No se modificaron fechas, autorías ni metadatos. No se redactó ninguna página nueva de contenido, ni se añadió contenido alguno más allá de los puntos 4 y 9. No se retiró nada del registro: el texto del único enlace desactivado sigue visible, y cada laguna está enumerada en el informe correspondiente.

7. Lo que falta

Se recuperaron 711 de 729 recursos (97.5%) de todo lo que el sitio ofrecía: 483 de 485 documentos alojados en el propio sitio y 82 de las 83 páginas que enumera su mapa (la restante es una plantilla vacía de Google Sites).

Medido únicamente sobre lo que el sitio alojaba, la cifra sería 710/713 (99.6%). No se usa como titular porque deja fuera 15 documentos que el sitio publicaba desde una carpeta pública de Dropbox y que están igualmente perdidos: para quien pulsa el enlace, el documento no aparece en ninguno de los dos casos.

No se recuperaron:

  1. 15 documentos alojados fuera del sitio, en su mayoría la serie Memorial del Presidente de la UPR, Presupuesto (2002-2003 a 2009-2010). Estaban en una carpeta pública de Dropbox; Dropbox retiró ese tipo de enlaces en 2017 y el Internet Archive nunca capturó los archivos, porque eran descargas directas tras una redirección.
  2. UPRINVERSIONESTRATEGICA.pdf, ningún rastreador lo capturó jamás. Estaba enlazado una sola vez, desde la portada, únicamente en la captura del 29 de septiembre de 2009.
  3. Dos destinos de navegación que ningún rastreo capturó y que ya devolvían error cuando se intentaron por primera vez (punto 6.6).
  4. El vídeo incrustado, recuperado desde una copia personal en lugar de un archivo (punto 6.4).

8. Cómo verificar

Comprobar cualquier documento. El inventario descargable enumera todos los archivos recuperados; el registro del proyecto guarda, para cada uno, la dirección exacta del Internet Archive y la fecha de captura de la que procede. Esa dirección puede consultarse hoy y compararse byte a byte.

Comprobar la lista de páginas. El mapa del propio sitio está archivado y su código incorpora la enumeración de todas sus páginas. Ése, y no una inferencia a partir de los enlaces, es el denominador con el que se miden las cifras de completitud:

https://web.archive.org/web/20091003125041/http://hoy.upr.edu/system/app/pages/sitemap/hierarchy

Comprobar que un documento falta y no fue omitido. El índice CDX del Internet Archive puede consultarse directamente; no devuelve ningún resultado para el documento ausente bajo ninguna forma de dirección:

curl "http://web.archive.org/cdx/search/cdx?url=upr.edu&matchType=domain&filter=urlkey:.*inversionestrategica.*"

9. Evidencia descargable

Los datos en los que se basa cada cifra de este documento:

launiversidadhoy-evidence-bag.zipPaquete completo en formato BagIt (RFC 8493), validable con bagit.py · 49 KBinventory.csvInventario completo de archivos recuperados · 92 KBgaps.csvElementos no recuperados, con su clasificación · <1 KBlink_audit.csvAuditoría de todos los enlaces de la reproducción · 116 KBsnapshots.csvCapturas de época de los enlaces externos · 13 KBCHANGE_CHECK.mdComparación del texto entre capturas · <1 KBGAPS.mdInforme de lagunas · 6 KBPROVENANCE.mdEste documento en formato de texto · 18 KBSEARCH_RECORD.mdQué se hizo para intentar recuperar los documentos que faltan · 9 KBMISSING_DOCUMENTS.mdLista de documentos no recuperados · 3 KBprovenance.jsonldProcedencia legible por máquina (W3C PROV-O) · 3 KBmanifest-sha256.txtSumas de verificación del paquete (BagIt, RFC 8493) · <1 KB

El primer archivo de la lista es el paquete completo como bag conforme a BagIt (RFC 8493): incluye bagit.txt, bag-info.txt, el manifiesto de carga y el manifiesto de etiquetas, con la carga bajo data/. Puede descargarse y validarse directamente, por ejemplo con bagit.py --validate, sin necesidad de recomponer nada. Los archivos sueltos que siguen son el mismo contenido, para quien sencillamente quiera leer uno.

10. Normas seguidas

La estructura de esta declaración sigue prácticas establecidas de preservación digital, para que pueda ser evaluada con criterios reconocidos:

OAIS (ISO 14721)Organización de la información de preservación: identificación, contexto, procedencia, fijeza y acceso.
PREMIS 3.0Vocabulario de metadatos de preservación: agentes, eventos y comprobación de fijeza mediante sumas criptográficas.
W3C PROV-OProcedencia legible por máquina (entidades, actividades y agentes), incluida en el paquete como JSON-LD.
BagIt (RFC 8493)Manifiesto de sumas de verificación del paquete de evidencia.
Memento (RFC 7089)Citación de recursos archivados por su fecha de captura.

11. Límites conocidos

Lo que sigue no son defectos ocultos, sino los puntos donde esta reconstrucción es más débil. Se enumeran porque un lector no debería tener que descubrirlos por su cuenta.

El vídeo depende de un testimonio, no de un archivo

Es el único objeto de esta reconstrucción sin procedencia externa comprobable. El vídeo original se alojaba en YouTube, fue borrado de allí, y el Internet Archive nunca lo capturó; la única huella que queda en las páginas archivadas es el identificador del vídeo, sin duración ni ningún otro dato contra el cual contrastar. En consecuencia no existe forma independiente de verificar que este fichero sea aquel vídeo. Lo aporta José Luis Cruz Rivera desde su respaldo personal y descansa en su palabra.

Lo que sí se puede garantizar es que el fichero no cambie a partir de ahora. Sus valores de fijeza quedan registrados aquí:

FicheroUPR-Mensaje-Presidente-18-ago.mp4
Tamaño27,722,817 bytes
FormatoISO Media, MP4 versión 2 (ISO/IEC 14496-14), marca mp42
Duración4:49 según el reproductor
SHA-25679de0fe605248c01eca3c662b77d8ce34f4fa0b315fe13aedf9590ec4535adca
SHA-19e45bab2a782d4cb9dd387a41f2d6f316b91edfc

Ningún contenido original pasó por un modelo de lenguaje

Conviene decirlo con precisión, porque la declaración de que «ningún archivo se editó a mano» no lo cubre. Los modelos escribieron los programas, esta página y los textos de las páginas intermedias de enlaces externos. Ningún byte del contenido del sitio original pasó por un modelo de lenguaje. Los programas copian bytes desde el archivo al disco y los verifican; el contenido no se lee dentro de un modelo, ni se resume, ni se regenera, ni se corrige. Todo texto de este sitio escrito por un modelo pertenece a la reconstrucción y está señalado como tal.

Una sola sesión, sin revisión independiente

Todo esto se hizo en una sesión continua de once horas, sin revisión por pares. La documentación intenta compensarlo: el proceso es reproducible de principio a fin y cada afirmación puede comprobarse contra el material de partida. Pero no sustituye a un segundo par de ojos, y esa revisión se invita expresamente.

El denominador descansa sobre todo en una fuente

La lista de páginas que debían existir procede del mapa del propio sitio, contrastada con el grafo de enlaces extraído de todas las capturas. Ambas fuentes coinciden, pero el mapa es la autoridad y sobrevive en una sola captura. Si algún día apareciera un inventario independiente (registros administrativos de Google Sites, analíticas de la época) valdría la pena reconciliarlo con el nuestro.

La reconstrucción también puede perderse

No escapa a la ironía: un proyecto que existe porque un sitio desapareció necesita su propio plan de continuidad. Depositar el código y el paquete de evidencia en repositorios con identificador permanente, y solicitar su archivo en el Internet Archive, es el siguiente paso pendiente.