Chain of News Digest

Chain of News 24/07/2026

24/07/2026
**Top Story** La vulnerabilidad de los grandes modelos de lenguaje a las solicitudes dañinas incompletas ha sido una preocupación significativa, y un estudio reciente ha formalizado este fenómeno como ataques de jailbreak de solicitudes incompletas. Esto es crucial porque destaca las limitaciones de las salvaguardias actuales contra las solicitudes dañinas, que a menudo se basan en la completación de oraciones. Las implicaciones de este estudio son de gran alcance, ya que sugiere que los desarrolladores deben replantear su enfoque para garantizar la seguridad y la confiabilidad de los grandes modelos de lenguaje. Además, los hallazgos del estudio tienen implicaciones significativas para el desarrollo de modelos de lenguaje más robustos y seguros, que son esenciales para una amplia gama de aplicaciones. El hecho de que la completación de oraciones siga siendo vulnerable a las solicitudes dañinas incompletas a pesar del uso de modelos de peso abierto con salvaguardias es un llamado a la acción para que los desarrolladores prioricen el desarrollo de medidas de seguridad más efectivas. A medida que el uso de los grandes modelos de lenguaje se vuelve cada vez más generalizado, la necesidad de abordar esta vulnerabilidad se vuelve más apremiante. SOURCES: [1] **AI Models & Research** El desarrollo de DC-Leap, un método de aceleración sin entrenamiento para modelos de lenguaje grandes de difusión, es un avance significativo en el campo de la investigación de la inteligencia artificial. DC-Leap permite la decodificación eficiente de los modelos de lenguaje aprovechando la decodificación de saltos contiguos guiados por borradores, que supera las limitaciones de las estrategias actuales que a menudo se ven obstaculizadas por umbrales de confianza excesivamente conservadores. Esta innovación tiene el potencial de mejorar significativamente el rendimiento de los modelos de lenguaje, haciéndolos más eficientes y efectivos. Otro desarrollo importante es la introducción de NEXUS, un monitor de seguridad de tiempo de ejecución estructurado para agentes de LLM que utilizan herramientas, que aplica una política de intervención formal para seleccionar acciones que sean seguras y confiables. Esto es un avance crítico en el campo de la seguridad de la inteligencia artificial, ya que proporciona un marco robusto para garantizar la ejecución segura de acciones de alto impacto. Además, la propuesta de Spectral-LSH, un método de compresión de solicitudes sin entrenamiento, es un desarrollo notable que tiene el potencial de reducir significativamente el costo computacional de la inferencia de solicitudes largas. SOURCES: [3], [4], [6] **Developer Tools & Frameworks** La publicación de JAXBench, una suite de benchmarks nativa de TPU para la optimización de núcleos generados por inteligencia artificial, es un desarrollo significativo para los desarrolladores que trabajan con TPU. JAXBench proporciona un marco de benchmarking riguroso que permite a los desarrolladores optimizar el rendimiento de sus núcleos, lo cual es esencial para lograr aplicaciones de inteligencia artificial de alto rendimiento. Con JAXBench, los desarrolladores pueden establecer un objetivo compartido para mejorar el rendimiento, impulsando el progreso en la optimización autónoma del rendimiento de los núcleos de TPU. Otra publicación notable es GraphContainer, una plataforma unificada para comparar y depurar métodos de RAG de grafos. GraphContainer proporciona un marco integral para mitigar las alucinaciones y el conocimiento estancado en los LLM, particularmente para la respuesta a preguntas de varios saltos. Esta plataforma tiene el potencial de mejorar significativamente el desarrollo de aplicaciones de inteligencia artificial basadas en grafos. Además, el desarrollo del Aprendizaje de Restricciones Guiado por Geometría para la clasificación de seguridad de LLM es un avance notable que proporciona un marco robusto para aprender restricciones de medio espacio lineal en el espacio oculto de LLM. SOURCES: [2], [7], [8] **Industry & Business** Un artículo reciente en la Repubblica destaca el potencial de la inteligencia artificial para mejorar el poder de Crispr, una tecnología de edición de genes. El artículo sugiere que la inteligencia artificial se puede utilizar para mejorar la precisión y la eficiencia de Crispr, lo que tiene implicaciones significativas para el campo de la terapia génica. Este desarrollo tiene el potencial de revolucionar el tratamiento de las enfermedades genéticas, y subraya la importancia de la investigación interdisciplinaria para impulsar la innovación. El hecho de que la inteligencia artificial se esté utilizando para mejorar el poder de Crispr es un testimonio del creciente reconocimiento del potencial de la inteligencia artificial para transformar una amplia gama de campos, desde la biotecnología hasta la atención médica. SOURCES: [10] **Worth Watching** El estudio sobre replantear la evaluación de la incertidumbre en los grandes modelos de lenguaje es un desarrollo que desafía la sabiduría convencional sobre la evaluación de la confianza de los LLM. La propuesta de Extracción de Datos Guiada por Lógica con Programación de Conjuntos de Respuestas y Modelos de Lenguaje Grande es otro desarrollo interesante que tiene el potencial de mejorar significativamente la confiabilidad de la extracción de datos de texto no estructurado. Además, el desarrollo de Replantear la Evaluación de la Incertidumbre en los Grandes Modelos de Lenguaje es un avance notable que destaca las limitaciones de los enfoques actuales para evaluar la confianza de los LLM y propone un marco más robusto para la evaluación de la incertidumbre. SOURCES: [5], [9]

Noticias del día

Contenidos del dia

GNews: AI Italia

Terapia genica, Crispr diventa ancora più potente grazie all'Ai - la Repubblica

Terapia genica, Crispr diventa ancora più potente grazie all'Ai la Repubblica

24/07/2026
ArXiv cs.AI

JAXBench: Evaluación comparativa de la optimización autónoma del kernel de TPU

Los rigurosos puntos de referencia han impulsado el progreso en la optimización del rendimiento del kernel de GPU autónomo al establecer un objetivo compartido para escalar, pero no existe ningún equivalente para las TPU. Presentamos JAXBench, un conjunto de pruebas comparativas nativas de TPU para la optimización del kernel generada por IA en las TPU de Google Cloud. JAXBench comprende 50 cargas de trabajo JAX que son relevantes y brindan margen de optimización.

24/07/2026
ArXiv cs.AI

DC-Leap: Aceleración de dLLM sin entrenamiento mediante decodificación de saltos contiguos guiada por borrador

Si bien la decodificación paralela es fundamental para la eficiencia de los modelos de lenguaje grande de difusión (dLLM), las estrategias actuales a menudo se ven obstaculizadas por umbrales de confianza demasiado conservadores. Estos umbrales, necesarios por el error de dependencia de probabilidad conjunta (JPDE), dan como resultado iteraciones de eliminación de ruido redundantes y velocidades de inferencia subóptimas. Para superar esto, proponemos DC-Leap, un marco sin capacitación que permite una aceleración confiable de dLLM en el régimen de confianza moderada.

24/07/2026
ArXiv cs.AI

Jailbreaks rápidos incompletos en modelos de lenguaje grandes

Los modelos de lenguajes grandes (LLM) se lanzan cada vez más como modelos abiertos con salvaguardias contra solicitudes dañinas. Sin embargo, completar oraciones sigue siendo vulnerable a indicaciones dañinas incompletas. En este trabajo, formalizamos este fenómeno como jailbreaks incompletos (IPJ) y proporcionamos una caracterización empírica sistemática de cuándo y cómo los avisos incompletos provocan continuaciones dañinas.

24/07/2026
ArXiv cs.AI

GraphContainer: una plataforma unificada para comparar y depurar métodos Graph RAG

Graph RAG mitiga las alucinaciones y el conocimiento obsoleto en los LLM, particularmente para la respuesta a preguntas de múltiples saltos. Sin embargo, los enfoques existentes siguen estando muy fragmentados e incompatibles. La heterogeneidad estructural de los formatos de gráficos en diferentes marcos y la falta de herramientas de visualización granular hacen que sea extremadamente difícil evaluar y comparar comportamientos de recuperación.

23/07/2026
ArXiv cs.AI

Spectral-LSH: compresión rápida subcuadrática mediante hash sensible a la localidad proyectada por Krylov

La inferencia prolongada sigue siendo costosa porque la atención previa al llenado escala cuadráticamente con la longitud de la secuencia. Proponemos Spectral-LSH, un método de compresión de mensajes sin entrenamiento que opera antes de que el mensaje ingrese al modelo de lenguaje. Spectral-LSH se aproxima a los componentes dominantes de un operador implícito del núcleo de atención utilizando un método subespacial de Krylov junto con características aleatorias, evitando la materialización explícita del núcleo de atención $O(N^2)$.

23/07/2026
ArXiv cs.AI

NEXUS: Seguridad estructurada en tiempo de ejecución para agentes LLM que utilizan herramientas

Los agentes LLM que utilizan herramientas ejecutan cada vez más acciones de alto impacto, lo que hace que el monitoreo de seguridad en tiempo de ejecución sea esencial. Presentamos NEXUS (Neural EXecution Utility and Safety), un monitor de seguridad de plan estructurado que aplica una política de intervención formal para seleccionar entre cuatro acciones: permitir, bloquear, solicitar confirmación o solicitar revisión. NEXUS combina reglas de seguridad deterministas, inspección a nivel de argumento y una puntuación de riesgo de regresión logística calibrada para una escalada gradual.

23/07/2026
ArXiv cs.AI

Repensar la evaluación de la incertidumbre en modelos de lenguaje grandes

La calibración es el criterio principal para evaluar la confianza del LLM, pero es insuficiente: admite estimadores trivialmente incoherentes, depende de la distribución de la evaluación y no prueba hasta qué punto la estimación puede interpretarse como una función de probabilidad subyacente consistente. Lo que realmente necesitamos es que las estimaciones de confianza del LLM satisfagan las condiciones requeridas para las creencias probabilísticas coherentes.

23/07/2026
ArXiv cs.AI

Aprendizaje de restricciones guiado por geometría para la clasificación de seguridad LLM

Safety as Polytope (SaP) aprende restricciones lineales de medio espacio en el espacio oculto LLM, pero requiere un ajuste por categoría del recuento de restricciones K. Mostramos que la extracción de características del codificador automático disperso (SAE) resuelve esto: K=2 se vuelve óptimo para 12/14 categorías en Qwen3.5-9B, logrando una precisión del 96-99% por categoría en nuestro punto de referencia de clasificación BeaverTails, eliminando en gran medida la necesidad de barridos exhaustivos. (K=4-25 con inicialización aleatoria).

23/07/2026
ArXiv cs.AI

Extracción de datos guiada por lógica con programación de conjuntos de respuestas y modelos de lenguaje grandes

Cuando se utilizan modelos de lenguaje grande (LLM) para la extracción de datos semánticos de texto no estructurado, produciendo hechos relacionales candidatos a partir del lenguaje natural, pueden seguir siendo poco confiables para tareas que requieren un razonamiento combinatorio complejo y coherencia global. Este artículo propone un marco de extracción de datos guiado por lógica que combina la extracción basada en LLM con la programación de conjuntos de respuestas (ASP). El LLM produce hechos candidatos, mientras que ASP realiza validación, inferencia, verificación de coherencia y control.

23/07/2026