jueves, 9 de julio de 2026

Personas citadas en Divulciencia

Distribución de Poisson de las citas
The same post in English

Me gusta hacer estadísticas de muchas cosas. Naturalmente, también las hago sobre este blog. Una de las que suelo hacer es la de los nombres de personas (científicos o no) más mencionados en el blog, que ya tiene 564 artículos. Presenté una tabla así en enero de 2024, cuando iban publicados 455, en el artículo titulado Una década de Divulciencia, y creo que ha llegado el momento de actualizarla. Esta es la tabla correspondiente, en la que aparecen 40 personas que han sido mencionadas al menos 10 veces.

Nombre

Nº citas

Nombre

Nº citas

Albert Einstein

97

Werner Heisenberg

18

Isaac Newton

61

Julio Verne

17

Jesucristo

40

Roger Penrose

17

Charles Darwin

40

Nicolás Copérnico

17

Stephen Hawking

39

Kurt Gödel

16

Aristóteles

34

Arthur Eddington

15

C.S. Lewis

33

H.G. Wells

14

Isaac Asimov

33

Johannes Kepler

13

Arthur C. Clarke

27

Georg Mendel

12

Alan Turing

24

Aldous Huxley

11

Richard Dawkins

23

Niels Bohr

11

Georges Lemaître

22

James Maxwell

11

Galileo Galilei

21

Antoine de Lavoisier

11

Platón

20

Alvin Plantinga

11

Claudio Ptolomeo

20

G.K. Chesterton

11

Max Planck

19

Erwin Schrödinger

10

Enrico Fermi

19

Louis Pasteur

10

Edwin Hubble

19

Poul Anderson

10

Ray Kurzweil

19

Georges Gamow

10

Teilhard de Chardin

18

Stephen Jay Gould

10

¿Cómo obtuve esta tabla? Muy sencillo: En mi blog, busqué cada uno de los nombres y conté el número de artículos del blog que aparecían como respuesta. En cierto momento se me ocurrió que esta tarea debería ser automatizable con las herramientas de que disponemos, así que entré en el LLM asociado a mi blog y le hice esta pregunta:

Hazme una tabla con el nombre de las personas mencionadas en todos los artículos de Divulciencia.blogspot.com y el número de artículos en que aparece cada uno, que contenga personas mencionadas al menos en 5 artículos.

Después de “pensar” un rato, me contestó esto:

Basándome en los artículos y extractos del blog Divulciencia presentes en las fuentes… se han identificado las siguientes personas mencionadas en al menos 5 artículos distintos.

Nombre de la persona

Número de artículos en que aparece

Manuel Alfonseca

20+

Albert Einstein

6

Stephen Hawking

5

Jesucristo (Cristo)

5

Richard Dawkins

5

 Detalles sobre el recuento y contexto:

  • Manuel Alfonseca: Aparece en la práctica totalidad de los artículos de las fuentes, ya sea como firma de autor ("Posted by Manuel Alfonseca"), en los encabezados de las entradas del blog o como referencia en la presentación de sus hilos temáticos y libros recopilatorios.
  • Albert Einstein: Sus menciones se distribuyen en artículos sobre el determinismo ("El futuro no está escrito"), la cosmología estándar (en el hilo temático correspondiente), su famosa "constante cosmológica" y su error, la medida de la gravedad y el debate sobre la causalidad física

Etcétera. Como puede verse, los resultados no son muy prometedores. Einstein aparece 6 veces, en vez de 97. Sospecho que esto se debe, al menos en parte, a que el LLM ha buscado “Albert Einstein”, en lugar de “Einstein”, que es lo que yo busqué y aparece muchas más veces, pues con el nombre completo aparece sólo en 23 artículos, que aun así son bastantes más que los 6 que ha encontrado.

Hice la misma pregunta a GEMINI y me respondió esto:

Soy una IA basada en texto y no puedo ayudarte con eso.

Hice la misma pregunta a ChatGPT y me respondió esto:

No puedo calcular de forma fiable las menciones en todos los artículos del blog desde aquí, porque el sitio contiene centenares de entradas (más de 450 en 2024 y unas 550 en 2026) y no dispongo del texto completo de todas ellas para hacer un recuento exhaustivo.

Sin embargo, el propio autor publicó una tabla con las personas más citadas en los primeros 455 artículos de Divulciencia. Esa tabla ya contiene todos los nombres que aparecían al menos 10 veces (por tanto, también cumplen el criterio de ≥5 apariciones):

Y a continuación me ofreció la tabla de mi artículo del blog de 2024.

Parece que las herramientas de IA aún no están en condiciones de realizar trabajos sencillos, como el que yo les propuse. La que más se aproxima, por razones obvias, es la que está asociada al propio blog, pero resulta muy poco satisfactoria. Y la más honrada es la respuesta de GEMINI.

Hilo temático sobre Efemérides y Organización: Anterior Siguiente

Manuel Alfonseca

Que paséis un buen verano. Nos vemos el 3 de septiembre

9 comentarios:

  1. Hola Manuel, hace poco he empezado un blog, y la entrada de hoy la he dedicado justo a esto que ha publicado:

    https://jaimearboleda.substack.com/p/analizando-las-personas-citadas-en

    Ahí describo cómo probé dos enfoques usando LLMs, uno de los cuales implicaba más programación (y terminó siendo peor) y otro, más simple y directo, funcionó muy bien. Los resultados están enlazados al final de mi entrada, pero en todo caso copio también aquí el link de la web autocontenida que contiene el análisis de citaciones:

    https://drive.google.com/uc?export=download&id=1GPqAJ-aDgvDnJChPeXhDh6OW2ECbbTVw

    ResponderEliminar
    Respuestas
    1. Muchas gracias por el interés tomado en mi blog, y por el análisis realizado, que es mucho más complejo que el que yo hice.

      De los 40 que yo encontré con 10 citas o más, este procedimiento sólo se ha dejado fuera a dos: Louis Pasteur y G.K. Chesterton. En cambio, yo, con mi método puramente manual, me dejé fuera a 5: Soler Gil, Hitler, Marx, Gardner y Popper.

      Según mi análisis, C.S. Lewis aparece 33 veces en mi blog. Según este otro análisis, se le divide en dos: Clive Staples Lewis (20 veces) y C.S. Lewis (13). El total coincide.

      No sé qué procedimiento se ha empleado para que mi nombre aparezca 30 veces. Puesto que firmo todos los artículos, debería aparecer 564 veces. ¿Se ha excluido la firma del análisis? Por otra parte, cuando me refiero a mí mismo suelo decir "yo", no Manuel Alfonseca. Sería curioso saber cómo se ha procesado.

      En cualquier caso, el resultado de este análisis es espectacularmente correcto. En casi todos los casos, las diferencias son triviales, teniendo en cuenta, además, que mis resultados manuales tampoco tienen por qué ser totalmente correctos.

      Eliminar
    2. Gracias por esas puntualizaciones. Resulta que en realidad ha sido casi fallo mío: se había hecho un paso final de unificar formas diferentes de escribir los nombres, pero estaba en un fichero que no es el que se usó para construir la web. Ahora, reconstruyendo la web con el fichero correcto, Chesterton y Lewis aparecen bien representados. Con respecto a Pasteur, usando el buscador me salen 9 artículos, lo mismo que en la web mía, así que asumo que son 9 entradas. También aparece Louis Pasteur Vallery-Radot, que pensé que era una errata pero no, es su sobrino, de quien se habla en un artículo. El enlace de arriba ya apunta a la web corregida, por si la quiere descargar de nuevo.

      Lo de "Manuel Alfonseca": sí, se excluyó la firma del análisis, con un paso previo. Y no me queda del todo claro la razón de las 30 menciones, pero intuyo, por los 4-5 que he revisado a mano, que se trata de artículos en los que se hace referencia directa o indirecta a publicaciones suyas (ya sean libros o papers). Y entonces, el LLM ha considerado que "Manuel Alfonseca" actúa como persona citada en divulciencia.

      Eliminar
    3. Respecto a mis autocitas, supongo que los enlaces a artículos míos en el blog han sido excluidos directa o indirectamente. Que sólo sean 30, indica que me doy demasiado autobombo, pues corresponde más o menos a una autocita cada 20 artículos, lo que no es demasiado :-)

      Eliminar
    4. Yo creo que los enlaces entre artículos directamente no los ha considerado, salvo que el texto dijera algo así como "como dijo Manuel Alfonseca..." o similar, lo cual no creo que haya ocurrido, sería indicativo de algo trastorno psicológico, jeje.
      Hacer este tipo de cosas me entretiene, supongo que se nota. Teniendo ya todo en un repositorio sería fácil hacer otro tipo de análisis estadísticos, aprovechando la potencia de los LLMs, por si le interesan otras cosas.

      Eliminar
    5. Muchas gracias por el ofrecimiento. Lo pensaré.

      Eliminar
    6. Hola Jaime y Manuel,

      Un interesante trabajo. Por mis intereses personales, me resulta especialmente significativo que en su último comentario Jaime dice "creo que" y "no creo que" referido a lo que ha ocurrido en el análisis automático. Es decir, Jaime no está seguro de cómo está funcionando, ni por qué da unos resultados u otros. Es decir, hay un importante problema de falta de explicabilidad del funcionamiento de la herramienta.

      ¿Qué pensáis?

      Eliminar
    7. Gracias, Gonzalo. Muy buena pregunta. Es una pregunta que el propio Claude Code puede responder bastante bien, al menos en este caso. Es muy interesante cómo lo ha resuelto: se lo he pedido y ha hecho un análisis bastante detallado del caso, que he dejado en un fichero markdown para que sea legible desde el repo:

      https://github.com/JaimeArboleda/analisis-divulciencia/blob/main/firma_alfonseca.md

      En este caso ha funcionado bien porque se trata de un proyecto de desarrollo, con código auditable, y aunque hay una parte que depende de llamadas a LLMs para la extracción de nombres, no auditable ya, es fácil hacer inferencias a posteriori sobre lo que puede haber causado esto, como ha hecho inteligentemente Claude.

      Pero hay un problema de explicabilidad importante en general con los LLMs, estoy contigo. De hecho, aunque a veces uno tenga la tentación de pensar que el LLM es como un programador junior extremadamente rápido y eficiente, ese símil falla porque cada "instancia" del LLM (por instancia aquí me refiero a un hilo conversacional) refleja un conjunto de suposiciones, creencias y objetivos, y aunque aunque no sean propiamente "estados mentales", sí tienen capacidad operativa (David Chalmers los llama cuasi-creencias y cuasi-deseos). Entonces, a una instancia le puedes preguntar "¿Por qué has hecho esto así?" y a menudo contestará algo coherente con su actuación, pero una vez cerrado ese hilo, todo lo que no se haya reflejado en el código está perdido para siempre, y no tienes a mano a nadie responsable. En ese sentido, más que un becario, es como si tuvieras becarios efímeros que aparecen y desaparecen, irresponsables por definición.

      Eliminar

NORMAS PARA PONER COMENTARIOS:

1. Estos comentarios están moderados para evitar la publicación de comentarios insultantes o irrelevantes. Los que no cumplan estas normas no serán publicados.

2. Los comentarios deben tener algo que ver con el tema del artículo al que se asocian.

3. También son aceptables comentarios del tipo: "Por favor, considere la posibilidad de publicar un artículo sobre tal tema".

4. No son aceptables comentarios que digan: "¿Qué opina de este artículo?", seguidos de un enlace. Este blog no es un consultorio. No tengo tiempo para leer tantos artículos. Además, ya he contestado a la mayor parte de las preguntas que se me hacen, ya sea en artículos o en comentarios anteriores. Utilicen la búsqueda en el blog para localizarlos.

5. No ponga Anónimo o Unknown como firma del comentario. Ponga cualquier nombre, o al menos diga dentro del texto de quién se trata (no tiene que ser su nombre y apellidos). Si todos pusieran Anónimo o Unknown, no sabría si estoy hablando con una persona o con varias.

6. Sea lo más conciso que le sea posible. Los comentarios no deben competir en longitud con el artículo.

Aunque este blog está preferentemente dirigido a la divulgación de la ciencia, es inevitable que mis ideas influyan en mis artículos. Si a algún lector le molestan mis ideas hasta el punto de no poder mantener la calma, le recomiendo que deje de leerme. Pero si se empeña en discutirlas, exijo respeto, y que se evite la falacia ad hominem. De lo contrario, el comentario no será publicado.