Chain of News Digest

Chain of News 24/07/2026

24/07/2026
**Top Story** El desarrollo de Modelos de Lenguaje Grande (LLMs) ha sido un enfoque significativo en la comunidad de inteligencia artificial, con varios enfoques explorados para mejorar su rendimiento y confiabilidad. Uno de los desafíos clave en el uso de LLMs para la extracción de datos semánticos es su falta de confiabilidad para tareas que requieren razonamiento combinatorio complejo y coherencia global. Un estudio reciente propone utilizar Extracción de Datos Guiada por Lógica con Programación de Conjuntos de Respuestas y Modelos de Lenguaje Grande para abordar este problema. Este enfoque tiene el potencial de mejorar significativamente la precisión y confiabilidad de los LLMs en tareas de extracción de datos, lo que es crucial para muchas aplicaciones. Las implicaciones de este desarrollo son sustanciales, ya que podría permitir el uso de LLMs en una gama más amplia de tareas e industrias. Además, este enfoque también podría conducir al desarrollo de sistemas de inteligencia artificial más avanzados que puedan razonar y aprender de manera más efectiva. A medida que la comunidad de inteligencia artificial continúa explorando nuevas formas de mejorar los LLMs, este estudio destaca la importancia de abordar las limitaciones de los modelos actuales. SOURCES: [1] **AI Models & Research** El estudio sobre Aprendizaje de Restricciones Guiadas por Geometría para la Clasificación de Seguridad de LLM es un desarrollo significativo en el campo de la investigación de inteligencia artificial. Este estudio propone un nuevo enfoque para el aprendizaje de restricciones lineales de medio espacio en el espacio oculto de LLM, lo que puede mejorar la seguridad y confiabilidad de los LLMs. El uso de extracción de características de autoencoder disperso (SAE) es una innovación clave en este enfoque, ya que permite resolver el recuento de restricciones K. Otro estudio importante es el que se centra en Reevaluar la Evaluación de Incertidumbre en Modelos de Lenguaje Grande, que destaca las limitaciones de los enfoques actuales para evaluar la confianza de los LLMs. Este estudio propone un nuevo marco para evaluar la incertidumbre en los LLMs, lo que podría conducir a modelos más precisos y confiables. Además, el estudio sobre Spectral-LSH: Compresión de Prompts Sub-Cuadrática a través de Hashing de Localidad-Sensibilidad Proyectado por Krylov es un desarrollo notable, ya que propone un nuevo método para comprimir prompts largos en LLMs, lo que puede mejorar la eficiencia y escalabilidad de estos modelos. SOURCES: [2], [3], [4] **Developer Tools & Frameworks** El desarrollo de nuevas herramientas y marcos es crucial para el avance de la investigación y las aplicaciones de inteligencia artificial. La plataforma GraphContainer es un desarrollo significativo en este área, ya que proporciona una plataforma unificada para comparar y depurar métodos de grafos RAG. Esta plataforma puede ayudar a mitigar alucinaciones y conocimientos obsoletos en los LLMs, particularmente para tareas de respuesta a preguntas de varios saltos. Otro desarrollo notable es la plataforma NEXUS, que proporciona un monitor de seguridad de planes estructurados para agentes de LLM que utilizan herramientas. Esta plataforma puede ayudar a garantizar la seguridad y confiabilidad de los LLMs en aplicaciones de alto impacto. Además, el conjunto de datos FineServe y la caracterización de cargas de trabajo de servidores de LLM globales es un recurso importante para los desarrolladores, ya que proporciona información sobre el rendimiento y la eficiencia de los LLMs en aplicaciones del mundo real. SOURCES: [6], [5], [10] **Industry & Business** El uso de guardrails de inteligencia artificial es un desarrollo significativo en la industria de la ciberseguridad, ya que puede ayudar a prevenir el mal uso de modelos de inteligencia artificial. Sin embargo, algunos investigadores de ciberseguridad han expresado preocupaciones de que estos guardrails están obstaculizando su trabajo, ya que limitan la capacidad de probar y desarrollar nuevas herramientas de ciberseguridad. Esto destaca la necesidad de un equilibrio entre seguridad e innovación en el desarrollo de modelos de inteligencia artificial. Además, la implementación de LLMs como servicios en línea siempre activos es una tendencia significativa en la industria, ya que requiere arquitecturas de servidores eficientes y escalables. El desarrollo de nuevos conjuntos de datos y caracterizaciones de cargas de trabajo de servidores de LLM puede ayudar a informar el diseño de estas arquitecturas y mejorar su rendimiento. SOURCES: [7], [10] **Worth Watching** El estudio sobre Mitigación del Colapso de Andamiaje en Tutores Socráticos a través de Alineación de Representaciones es un desarrollo interesante en el campo de la educación de inteligencia artificial. Este estudio propone un nuevo enfoque para mitigar el colapso de andamiaje en tutores socráticos basados en LLM, lo que puede ayudar a mejorar la eficacia de estos tutores en la guía de estudiantes a través de preguntas de varios giros. Otro desarrollo notable es el estudio sobre Más allá del Seguimiento o Atajo: Estados Predictivos Acotados por Composición en Modelos Autoregresivos de Póker, que explora el uso de sondas de estado oculto en modelos de secuencia de información imperfecta. Este estudio destaca la importancia de comprender las limitaciones y posibles sesgos de los modelos de inteligencia artificial en tareas complejas. Además, el desarrollo de nuevos enfoques para evaluar la incertidumbre en los LLMs es un área que merece la pena vigilar, ya que puede conducir a modelos más precisos y confiables. SOURCES: [9], [8], [3]

Noticias del día

Contenidos del dia

TechCrunch AI

Cómo las barreras de seguridad de la IA están impidiendo el trabajo de los investigadores de ciberseguridad ofensiva

Hablamos con varios investigadores de ciberseguridad, que buscan vulnerabilidades desconocidas y desarrollan herramientas para explotarlas, sobre cómo las barreras de seguridad de OpenAI y Anthropic afectan su trabajo.

24/07/2026
ArXiv cs.AI

Mitigar el colapso del andamiaje en tutores socráticos mediante la alineación de la representación

Los tutores socráticos basados ​​en modelos de lenguaje grande (LLM) guían cada vez más a los estudiantes a través de preguntas de varios turnos, pero pueden sufrir el colapso del andamiaje: bajo la presión sostenida de los estudiantes, un tutor abandona gradualmente la investigación guiada y revela soluciones directamente. Las defensas previas limitan principalmente las respuestas observables a través de indicaciones, optimización de preferencias o filtrado, dejando en gran medida sin abordar la deriva de representación interna que precede al colapso a nivel de trayectoria.

23/07/2026
ArXiv cs.AI

Más allá del seguimiento o el atajo: estados predictivos delimitados por la composición en modelos autorregresivos de póquer

Las sondas de estados ocultos a menudo recuperan etiquetas latentes en modelos de secuencia de información imperfecta, pero esto por sí solo no establece que un modelo mantenga una distribución de creencias posterior sobre los estados ocultos. Este artículo estudia esta ambigüedad en un modelo autorregresivo de Limit Hold'em sin rango entrenado sólo en objetivos de acción y valor, no en la mano o el rango del oponente.

23/07/2026
ArXiv cs.AI

Spectral-LSH: compresión rápida subcuadrática mediante hash sensible a la localidad proyectada por Krylov

La inferencia prolongada sigue siendo costosa porque la atención previa al llenado escala cuadráticamente con la longitud de la secuencia. Proponemos Spectral-LSH, un método de compresión de mensajes sin entrenamiento que opera antes de que el mensaje ingrese al modelo de lenguaje. Spectral-LSH se aproxima a los componentes dominantes de un operador implícito del núcleo de atención utilizando un método subespacial de Krylov junto con características aleatorias, evitando la materialización explícita del núcleo de atención $O(N^2)$.

23/07/2026
ArXiv cs.AI

Repensar la evaluación de la incertidumbre en modelos de lenguaje grandes

La calibración es el criterio principal para evaluar la confianza del LLM, pero es insuficiente: admite estimadores trivialmente incoherentes, depende de la distribución de la evaluación y no prueba hasta qué punto la estimación puede interpretarse como una función de probabilidad subyacente consistente. Lo que realmente necesitamos es que las estimaciones de confianza del LLM satisfagan las condiciones requeridas para las creencias probabilísticas coherentes.

23/07/2026
ArXiv cs.AI

Aprendizaje de restricciones guiado por geometría para la clasificación de seguridad LLM

Safety as Polytope (SaP) aprende restricciones lineales de medio espacio en el espacio oculto LLM, pero requiere un ajuste por categoría del recuento de restricciones K. Mostramos que la extracción de características del codificador automático disperso (SAE) resuelve esto: K=2 se vuelve óptimo para 12/14 categorías en Qwen3.5-9B, logrando una precisión del 96-99% por categoría en nuestro punto de referencia de clasificación BeaverTails, eliminando en gran medida la necesidad de barridos exhaustivos. (K=4-25 con inicialización aleatoria).

23/07/2026
ArXiv cs.AI

Extracción de datos guiada por lógica con programación de conjuntos de respuestas y modelos de lenguaje grandes

Cuando se utilizan modelos de lenguaje grande (LLM) para la extracción de datos semánticos de texto no estructurado, produciendo hechos relacionales candidatos a partir del lenguaje natural, pueden seguir siendo poco confiables para tareas que requieren un razonamiento combinatorio complejo y coherencia global. Este artículo propone un marco de extracción de datos guiado por lógica que combina la extracción basada en LLM con la programación de conjuntos de respuestas (ASP). El LLM produce hechos candidatos, mientras que ASP realiza validación, inferencia, verificación de coherencia y control.

23/07/2026
ArXiv cs.AI

GraphContainer: una plataforma unificada para comparar y depurar métodos Graph RAG

Graph RAG mitiga las alucinaciones y el conocimiento obsoleto en los LLM, particularmente para la respuesta a preguntas de múltiples saltos. Sin embargo, los enfoques existentes siguen estando muy fragmentados e incompatibles. La heterogeneidad estructural de los formatos de gráficos en diferentes marcos y la falta de herramientas de visualización granular hacen que sea extremadamente difícil evaluar y comparar comportamientos de recuperación.

23/07/2026
ArXiv cs.AI

NEXUS: Seguridad estructurada en tiempo de ejecución para agentes LLM que utilizan herramientas

Los agentes LLM que utilizan herramientas ejecutan cada vez más acciones de alto impacto, lo que hace que el monitoreo de seguridad en tiempo de ejecución sea esencial. Presentamos NEXUS (Neural EXecution Utility and Safety), un monitor de seguridad de plan estructurado que aplica una política de intervención formal para seleccionar entre cuatro acciones: permitir, bloquear, solicitar confirmación o solicitar revisión. NEXUS combina reglas de seguridad deterministas, inspección a nivel de argumento y una puntuación de riesgo de regresión logística calibrada para una escalada gradual.

23/07/2026
ArXiv cs.AI

FineServe: un conjunto de datos detallados y caracterización de cargas de trabajo de servicios de LLM globales

Los modelos de lenguajes grandes (LLM) se implementan cada vez más como servicios en línea siempre activos, lo que hace que los LLM eficientes atiendan un desafío crítico para los sistemas. Lograr una baja latencia y un alto rendimiento bajo una demanda volátil requiere una comprensión profunda de las cargas de trabajo del mundo real; sin embargo, los estudios existentes a menudo se basan en rastros proxy o caracterizaciones generales que no logran capturar la heterogeneidad de las plataformas LLM multimodelo modernas.

23/07/2026