Palabrería de LLM: GeoSpatial ML encuentra 15 de 22 mediante auditoría de citas
Puntos Clave
- Audita las referencias antes del envío, especialmente las citas que respaldan afirmaciones centrales o resúmenes de trabajos relacionados.
- Los revisores deberían tratar a los autores fabricados y las citas irrelevantes como señales fuertes para un escrutinio más profundo.
- La verificación de citas es un control de calidad práctico, no un sustituto de la evaluación de la novedad, los métodos y la reproducibilidad.
Una pequeña muestra de revisores muestra por qué las verificaciones de referencias se están convirtiendo en un control de calidad útil para las conferencias de ML.
Una pequeña muestra de revisores muestra por qué las comprobaciones de referencias se están convirtiendo en un control de calidad útil para las conferencias de ML.
La revisión por pares solía significar comprobar afirmaciones, líneas base y si la Figura 4 era en secreto tres gráficos con una gabardina. Ahora también significa hacer una pregunta más sencilla: ¿existe esta cita en el mismo plano de realidad que el artículo? No es un trabajo glamuroso, pero las pruebas unitarias tampoco lo son, y de algún modo la civilización continúa. Caleb Robinson e Isaac Corley, de GeoSpatial ML, pusieron una cifra concreta al problema en una publicación del 30 de julio de 2026. Según GeoSpatial ML, revisaron 22 envíos a conferencias de aprendizaje automático este verano y encontraron 15, o el 68 por ciento, con citas completamente fabricadas, listas de autores fabricadas para artículos existentes o escritura claramente generada por LLM. La lección útil no es entrar en pánico. Es que las bibliografías se han convertido en una superficie práctica de auditoría.
Qué encontró GeoSpatial ML
Según GeoSpatial ML, las asignaciones de revisión de Robinson y Corley se repartieron entre NeurIPS, WACV y TerraBytes, un taller geoespacial en ECCV. Los errores que describen no eran simples quejas de estilo sobre una prosa que olía ligeramente a autocompletado. Incluían citas fabricadas, autores alucinados, jerga técnica alucinada, escritura sin sentido y citas irrelevantes. Los autores llamaron a ese trabajo estar en las “trincheras del slop”, una imagen por desgracia muy vívida y que además suena como un taller de conferencia al que nadie debería asistir antes del café.
El paso importante es lo que ocurrió después de la queja. GeoSpatial ML dice que Robinson y Corley publicaron la auditoría de referencias de artículos que ahora ejecutan, incluido un skill bib-audit creado por Isaac Corley. Eso convierte una sospecha difusa del revisor en algo más parecido al control de calidad: verificar que las obras citadas existen, que las listas de autores coinciden y que la referencia realmente respalda la afirmación que la rodea. En términos de ML, la bibliografía es ahora un conjunto de evaluación, excepto que se supone que las etiquetas no deben ser imaginarias.
Por qué las auditorías de citas superan a la detección
por intuición El artículo de arXiv listado como Phantom References: Hallucinated Citations That Survive Peer Review at Top Tier Conferences plantea el mismo modo de fallo a un nivel más amplio: las citas alucinadas pueden parecer lo bastante académicas como para pasar por la revisión. Eso importa porque las referencias falsas son inusualmente fáciles de auditar en comparación con la prosa vaga. No necesitas adivinar si una oración fue asistida por un LLM a partir de su aura. Puedes comprobar si el artículo nombrado, los autores y la afirmación citada encajan.
El artículo de Rachel So, The Economics of AI Slop, ofrece la historia de incentivos detrás del desorden. So sostiene que el costo marginal de generar un artículo de investigación con LLMs ha caído de miles de dólares en tiempo de investigadores a unos pocos dólares de cómputo, creando presión hacia la cantidad por encima de la calidad. En ese contexto, los revisores se convierten en el limitador de velocidad, el pobre pequeño endpoint de API golpeado por envíos baratos. Las auditorías de citas no son una defensa completa contra el trabajo débil, pero elevan el costo de hacer pasar la erudición sintética como erudición verificada.
Qué deberían hacer ahora revisores y autores
La publicación de GeoSpatial ML es más útil como empujón de flujo de trabajo para investigadores que como tanque de humillación. Antes de enviar, los autores deberían auditar las referencias del mismo modo que auditan los experimentos: confirmar que el artículo citado existe, confirmar que la lista de autores pertenece a ese artículo y confirmar que la cita es relevante para la oración que la usa. Si un LLM ayudó a redactar una sección de trabajos relacionados, la lista de referencias merece escrutinio adicional, porque los modelos son bibliotecarios famosamente seguros de sí mismos que a veces archivan Atlantis bajo visión por computadora.
Para los revisores, la auditoría puede ser triaje en lugar de una excavación heroica de fin de semana. Empieza con las citas que respaldan afirmaciones centrales, declaraciones inusualmente amplias de trabajos relacionados y referencias que se ven extrañamente formateadas o contextualmente irrelevantes. Si esas fallan, la revisión puede centrarse en la reproducibilidad y la contribución con mejor evidencia. Esto no es anti-IA. Es pro-procedencia, que es la virtud menos sexy de la revisión por pares y posiblemente la más útil.
La presión editorial más grande
Ranjit Singh, de Data & Society, describió arXiv como enfrentando una afluencia de slop de IA donde el pulido superficial compite con la sustancia, y el ensayo señala que arXiv endureció la moderación el 31 de octubre. Ese contexto importa porque las conferencias y los repositorios lidian con la misma asimetría: generar texto plausible es barato, mientras que comprobar la erudición es lento. Cuando la superficie se vuelve más lisa, los revisores necesitan más comprobaciones mecánicas, no intuiciones más afiladas.
Lo siguiente que hay que observar es si la auditoría de citas se convierte en higiene normal de conferencias. La pequeña muestra de GeoSpatial ML no es un censo de la publicación en ML, y no debería tratarse como tal. Pero 15 envíos con fallos de 22 asignaciones de revisión bastan para justificar un nuevo reflejo: confiar menos en el PDF, revisar antes la bibliografía. El modelo puede escribir con fluidez, pero las referencias todavía tienen que mostrar identificación en la puerta.
