Deloitte lanza capacidades de agentes de inteligencia artificial (IA) conectados en su plataforma global Omnia - Líder Legal
Deloitte lanza capacidades de agentes de inteligencia artificial (IA) conectados en su plataforma global Omnia Líder Legal
Deloitte lanza capacidades de agentes de inteligencia artificial (IA) conectados en su plataforma global Omnia Líder Legal
Una nueva herramienta de identificación de sistemas de IA utilizados para crear vídeos falsos Levante-EMV
La verificación funcional domina el esfuerzo de ingeniería inicial de los circuitos integrados (CI), y un solo error pasado por alto que se escape al silicio puede desencadenar una costosa repetición. Los modelos de lenguajes grandes (LLM) recientes ofrecen nuevas oportunidades para automatizar este proceso; sin embargo, los enfoques existentes basados en LLM generan cada componente a través de llamadas independientes de un solo turno sin contexto compartido, lo que deja discrepancias en la interfaz sin detectar y la cobertura informada desconectada de los requisitos de especificación.
Las metodologías de evaluación de modelos lingüísticos combinan cada vez más múltiples señales, desde métricas automatizadas y calificaciones de LLM como juez hasta evaluaciones humanas y resultados de conjuntos de pruebas comparativas. Cuando estas señales se agregan mediante un promedio, la confianza de la evaluación puede exceder sustancialmente la confiabilidad de la señal más débil: un fenómeno que llamamos inflación de la confianza en la evaluación.
Los agentes de codificación contemporáneos basados en LLM producen código como salidas de caja negra: la lógica detrás de cada línea está oculta, la evolución del código a través de la reparación basada en puntos de referencia es efímera y la auditoría post-hoc es imposible.
Los sistemas multiagente impulsados por Large Language Models (LLM) se implementan cada vez más en entornos de motivos mixtos, donde los agentes operan bajo información asimétrica y engaño estratégico debido a objetivos conflictivos u ocultos. En estos entornos, la desalineación con los objetivos colectivos se convierte en una preocupación central. Proponemos un marco novedoso para evaluar la desalineación de objetivos utilizando el juego de deducción social Werewolf, modificando el objetivo de un solo agente preservando su rol asignado.
Los agentes de ciencia de datos clínicos deben transformar registros longitudinales heterogéneos en análisis auditables, pero los puntos de referencia existentes aíslan en gran medida las respuestas a preguntas médicas, el razonamiento de tablas estructuradas o los repositorios científicos genéricos. Presentamos CLINLENS, un punto de referencia de 200 tareas ejecutables en cinco recursos MIMIC vinculados que abarcan registros médicos electrónicos estructurados, notas, electrocardiogramas, radiografías de tórax y ecocardiogramas.
Las guías de práctica clínica (GPC) codifican criterios de diagnóstico, pero los sistemas LLM generalmente recuperan el texto de las guías o lo absorben mediante capacitación en lugar de ejecutar sus reglas. Presentamos GuideSkill, una capa de razonamiento externo que compila criterios específicos de enfermedades en funciones ejecutables que devuelven puntuaciones ordinales de apoyo al diagnóstico. GuideSkill-Zero se inicializa a partir de pautas, mientras que GuideSkill-Evo utiliza pares de casos y diagnósticos para refinar las habilidades cubiertas y agregar diagnósticos faltantes.
Se ha demostrado cada vez más que los grandes modelos de razonamiento entrenados mediante aprendizaje por refuerzo (RL) superan a sus homólogos supervisados y afinados (SFT) en tareas de razonamiento matemático; Sin embargo, la base mecanicista de esta ventaja sigue sin estar clara. Por lo tanto, preguntamos: ¿qué diferencias representacionales internas permiten el rendimiento superior de los modelos RL?
Un resultado de referencia de IA rara vez llega a un reclamo consecuente en un solo paso. Los evaluadores lo generalizan a otros casos, lo interpretan como evidencia de capacidad, lo extrapolan a nuevas tareas, lo transportan a otro sistema o sitio y lo combinan con suposiciones sobre la revisión humana y las consecuencias posteriores. Los enfoques centrados en la validez requieren evidencia para cada afirmación. Este artículo identifica otro problema epistémico: los eslabones garantizados no forman automáticamente una cadena garantizada.
Escribe al menos 2 caracteres
Este sitio utiliza cookies esenciales para su funcionamiento y cookies de analisis para mejorar la experiencia. Puedes aceptar todas, solo las esenciales, o personalizar tus preferencias. Politica de Cookies | Politica de Privacidad