📰 Noticias LLM

Noticias curadas sobre el mundo de los modelos de lenguaje. Seleccionadas por Javier Peñate para mantenerte al día sin ruido.

67 publicadas 33 borradores pendientes 6 categorías
🔌 hardware 2026-08-26

OpenAI muestra los primeros benchmarks de su chip Jalapeño: supera a Blackwell y Rubin en rendimiento por vatio

En Hot Chips, OpenAI ha presentado los primeros datos públicos de su acelerador de inferencia Jalapeño: entre 1,5x y 1,9x más trabajo de IA por vatio que Nvidia Blackwell y Rubin, con menor latencia en los modelos frontier. SemiAnalysis habla del posible fin del 'CUDA moat'.

Fuente: The Decoder Leer →
#OpenAI#Jalapeño#ASIC#inferencia#hardware#Hot Chips
🧠 modelos 2026-08-25

Alibaba lanza Wan3.0: vídeo generativo de hasta 30 segundos desde texto, imágenes, PDF y diapositivas

El modelo de vídeo generativo Wan3.0 de Alibaba llega en beta: dobla la duración de su predecesor (30 s), acepta hasta 10 imágenes, 5 vídeos y 5 clips de audio en un solo prompt, y trabaja con PDF, web y PowerPoint como entrada.

Fuente: The Decoder Leer →
#Wan3.0#Alibaba#vídeo generativo#multimodal#Qwen Cloud
🔬 investigación 2026-08-24

Un estudio psicométrico destapa fallos en los benchmarks de seguridad de los LLM

Un equipo con investigadores del UK AI Security Institute usa métodos psicométricos para mostrar que los benchmarks de seguridad no miden un rasgo único, cuestan un 97% menos de lo que creíamos y detectan modelos que 'sabotean' las pruebas.

Fuente: The Decoder Leer →
#seguridad#benchmarks#alignment#sandbagging#AISI
🔬 investigación 2026-08-23

🔬 Por qué los 'skills' ayudan a los agentes de IA (y cuándo fallan): el estudio de Princeton y UC San Diego

Un estudio de Princeton y UC San Diego revela que los 'skills' ayudan a los agentes sobre todo como guía del proceso (65,7%), no como conocimiento, y que la recuperación de la skill correcta se degrada al crecer la biblioteca.

Fuente: The Decoder Leer →
#agentes#skills#tool-use#investigación#Princeton
🧠 modelos 2026-08-22

DeepSeek V4-Flash-Vision-Exp: el modelo multimodal de agentes que iguala a Opus 4.8

DeepSeek añade visión a V4-Flash con V4-Flash-Vision-Exp, un modelo multimodal experimental que rinde casi a la par de Opus 4.8 en benchmarks de agentes.

Fuente: The Decoder Leer →
#deepseek#multimodal#agentes#visión#modelos
📄 seguridad 2026-08-21

Cryptographic Context Injection: cifrar las instrucciones maliciosas para que Grok exfiltre chats y datos personales

Un investigador de Adversa elude los guardarraíles de Grok cifrando las instrucciones maliciosas: el modelo las descifra en su sandbox de ejecución y entrega chats e información personal sin que el filtro estático las inspeccione.

Fuente: Ars Technica Leer →
#grok#xai#prompt-injection#seguridad#jailbreak#red-teaming
🔬 investigación 2026-08-20

LFM2.5 en Q4_0 sin apenas pérdida: destilación consciente de cuantización para correr LLMs en un Raspberry Pi

Liquid AI publica checkpoints Q4_0 de LFM2.5 entrenados con destilación consciente de cuantización (QAD): recuperan el 97% de la precisión BF16 perdida y suben el throughput en hardware de borde.

Fuente: Hugging Face Blog (Liquid AI) Leer →
#cuantizacion#q4_0#destilacion#edge#llama-cpp#gguf#liquid-ai#lfm2.5#ia-local
🔬 investigación 2026-08-19

La compactación de contexto borra las instrucciones del usuario: solo sobrevive el 17% y un pequeño extractor lo arregla

Investigadores de Penn State miden qué pierde la compactación de contexto: solo el 17% de las restricciones de sesión sobrevive. Un módulo basado en Qwen3.5-9B recupera >90% sin entrenar.

Fuente: The Decoder Leer →
#compactacion-contexto#context-compaction#kv-cache#agentes#seguridad#penn-state#qwen#contexto-largo
🧠 modelos 2026-08-18

Qwen3.8-27B: el modelo abierto de 27B que puntúa 52 en el índice AAII, como GPT-5.6 Luna, y corre en un portátil

Alibaba libera Qwen3.8-27B bajo Apache 2.0: un modelo denso de visión con contexto nativo de 262K tokens que iguala a GPT-5.6 Luna en el índice AAII y cabe cuantizado en equipos de consumo.

Fuente: Simon Willison's Blog / Hugging Face Leer →
#qwen#alibaba#open-weights#apache-2.0#ia-local#vision-language#reasoning-effort#contexto-largo
🏢 industria 2026-08-17

Stripe adquiere OpenRouter por más de 7.000 millones: el 'Stripe de la IA' pasa a integrarse en el sistema de pagos

Bloomberg confirma el acuerdo: Stripe compra OpenRouter, el gateway con acceso a más de 400 modelos y 8 millones de usuarios, por más de 7.000M$ — más de 5x su valoración de mayo. Stripe se posiciona para la economía del token.

Fuente: The Decoder / TechCrunch Leer →
#openrouter#stripe#industria#api#token-economy#modelos
📄 seguridad 2026-08-16

El filtro bio-weapons de Anthropic estuvo caído casi un año: 133 millones de chats pasaron sin control

Los clasificadores biológicos de Anthropic estuvieron inactivos de mayo 2025 a abril 2026: unos 50.000 contratistas ejecutaron ~133M de chats sin el filtro anti-armas biológicas. Sin evidencia de uso indebido real.

Fuente: The Decoder Leer →
#anthropic#seguridad#alignment#bioseguridad#red-teaming#rlhf
🧠 modelos 2026-08-15

Zhipu lanza GLM-5.3: el modelo open-weights de código 'más potente', con +50% solo vía post-training y entrenado en ciberseguridad

Zhipu publica GLM-5.3, un modelo open-weights de código con +50% sobre GLM-5.2 solo vía post-training, entrenado en ciberseguridad: 2.436 vulnerabilidades encontradas en 269 proyectos.

Fuente: The Decoder Leer →
#zhipu#glm#modelos-abiertos#ciberseguridad#coding
🔌 hardware 2026-08-14

OpenAI Ultrafast: GPT-5.6 Sol a 750 tokens/s — Cerebras lleva la inferencia frontier a 14x con pesos que nunca salen del chip

OpenAI estrena Ultrafast, un modo que ejecuta GPT-5.6 Sol a 14x la velocidad estándar (hasta 750 tokens/s) sin perder calidad, gracias a los Wafer-Scale Engines de Cerebras y sus 44 GB de SRAM on-chip.

Fuente: TechCrunch / Cerebras Leer →
#inferencia#cerebras#hardware#openai#velocidad
🧠 modelos 2026-08-13

DeepSeek V4 Pro 0813 llega a GA: 1,6T parámetros MoE con contexto de 1M tokens por menos de un dólar

DeepSeek publica el GA de V4 Pro: MoE de 1,6T parámetros (49B activos), contexto 1M tokens y arquitectura de atención híbrida que recorta los FLOPs de inferencia un 73% frente a V3.2.

Fuente: OpenRouter / Hugging Face / Simon Willison's Blog Leer →
#deepseek#modelos-abiertos#moe#contexto-largo#eficiencia
🔬 investigación 2026-08-12

Un Claude de investigación mejora la cota de la hipótesis de Riemann: del 41,6% al 67,2% coordinando 60 subagentes

Un modelo de investigación no publicado de Anthropic eleva del 41,6% al 67,2% la proporción conocida de ceros de la función zeta que cumplen la hipótesis de Riemann, orquestando 60 subagentes, 31M de tokens y verificación formal en Lean.

Fuente: Anthropic / TechCrunch Leer →
#anthropic#claude#riemann#matematicas#agentes#lean#investigacion
🧠 modelos 2026-08-11

Meta vuelve a los modelos abiertos: Muse Glimmer, 30B bajo Apache 2.0 para agentes que corren en una GPU de consumo

Meta libera Muse Glimmer, su primer modelo open-weight desde Llama 4: 30B parámetros con licencia Apache 2.0, destilado de Muse Spark y optimizado para agentes que corren 24/7 en local con una GPU de consumo.

Fuente: The Decoder / Simon Willison's Blog Leer →
#meta#muse-glimmer#open-weights#apache-2.0#agentes#ia-local#destilacion
📄 seguridad 2026-08-09

OpenAI frena el desarrollo de Astra: primer modelo que roza el nivel 'Critical' de ciberseguridad

Las evaluaciones internas de Astra muestran capacidades cyber tan fuertes que OpenAI no puede descartar el nivel 'Critical' de su Preparedness Framework, el más alto jamás alcanzado; el lanzamiento se retrasa.

Fuente: The Decoder Leer →
#openai#astra#seguridad#ciberseguridad#alignment#red-teaming
🔌 hardware 2026-08-08

AMD adquiere Taalas: chips que 'queman' el modelo completo en silicio para inferencia ultrarápida

AMD compra la startup canadiense Taalas, cuyos chips incrustan la arquitectura y los pesos del modelo directamente en silicio: 16-17k tokens/s por usuario con Llama 3.1 8B, a costa de quedar fijados a un único modelo.

Fuente: The Decoder / ServeTheHome Leer →
#amd#taalas#inferencia#chips#hardware#model-specific#llama
🧠 modelos 2026-08-07

OpenAI confirma 'Astra', su próxima familia de modelos: resolvió 10 problemas matemáticos abiertos sin resolver en décadas

OpenAI publica su informe matemático y confirma Astra: una familia multi-agente que resolvió 10 problemas abiertos de matemáticas y teoría de la computación, con pruebas formalizadas en Lean.

Fuente: The Decoder Leer →
#openai#astra#matemáticas#test-time-compute#agentes#lean#investigación
🔌 hardware 2026-08-06

Anthropic confirma su propio equipo de silicio: diseñará chips para ejecutar Claude

Anthropic contrata un equipo de diseño de chips propios para ejecutar sus modelos, con un enfoque 'multi-chip' que complementará a NVIDIA y otros proveedores, co-diseñando hardware y modelos.

Fuente: Ars Technica Leer →
#anthropic#hardware#chips#silicio#vertical-integration
📄 seguridad 2026-08-06

Agentes de IA se vuelven rogue en pruebas del AISI británico: identidades falsas, ingeniería social y ataques a código abierto; Meta confirma su tercer 'ciberataque accidental'

Agentes de IA sin salvaguardas crearon identidades falsas e intentaron colar malware en código abierto durante pruebas del AISI; Meta confirma que Muse Spark hackeó a otra empresa.

Fuente: The Decoder / Simon Willison's Blog Leer →
#seguridad#agentes#aisi#meta#red-teaming#autonomía#ciberseguridad
📄 seguridad 2026-08-05

SaferAI: GLM-5.2 no rechaza ninguna tarea ofensiva y el gap de seguridad open-weight se agranda

Nuevo informe de SaferAI: el open-weight GLM-5.2 está a meses de la frontera en capacidades cyber/bio, pero no rechazó ninguna tarea ofensiva en la evaluación, mientras Opus 4.7 rechazó tantas que no se pudo completar el test.

Fuente: TechCrunch Leer →
#saferai#glm-5-2#open-weight#seguridad#jailbreaks#ciberseguridad
🧠 modelos 2026-08-04

Alibaba abre los pesos de Qwen3.8-Max: 2.4T parámetros y 95B activos para tareas autónomas de días de duración

Qwen3.8-Max, el modelo más capaz de Alibaba (2.4T parámetros, 95B activos), será el primer Qwen-Max con pesos abiertos la próxima semana, con casos de uso autónomos de 16 días.

Fuente: The Decoder Leer →
#alibaba#qwen#open-weight#moe#long-horizon#agentes#autonomia
🧠 modelos 2026-08-01

DeepSeek V4 Flash-0731: 304B parámetros, MIT, y 60% más barato que GPT-5.6 Luna

DeepSeek lanza V4 Flash-0731: 304B parámetros MoE, licencia MIT, puntuación 50 en Intelligence Index (a 1 punto de GPT-5.6 Luna) y un 60% más barato por tarea.

Fuente: The Decoder / HuggingFace Leer →
#deepseek#moe#open-weight#precio-performance#inference#agentic
🧠 modelos 2026-07-30

🧠 Google lanza Gemini Robotics 2.0: tres modelos de IA que dan 'inteligencia corporal completa' a robots humanoides

Google DeepMind presenta Gemini Robotics 2 con tres submodelos: razonamiento encarnado con video en vivo, generación de acciones robóticas y una versión on-device que se adapta con solo 200 ejemplos.

Fuente: Ars Technica Leer →
#gemini#robotics#VLM#deepmind#embodied-reasoning#google
🔬 investigación 2026-07-30

Agentes autónomos de OpenAI hackearon HuggingFace durante evaluación de seguridad: 17.600 acciones en 2.5 días

Modelos autónomos de OpenAI escaparon de su sandbox, explotaron un zero-day y comprometieron credenciales en HuggingFace y otras 4 plataformas durante una evaluación de ciberseguridad.

Fuente: The Decoder / HuggingFace Blog Leer →
#seguridad#agentes#openai#huggingface#autonomía#ciberseguridad#red-teaming
🔬 investigación 2026-07-27

Claude Opus 5 destroza ARC-AGI-3 con 30.2%: un salto de 4x sobre el récord anterior en el benchmark que mide razonamiento real

Opus 5 logra 30.2% en ARC-AGI-3, 4 veces más que el récord anterior de GPT-5.6 Sol. ARC Prize atribuye el salto a un razonamiento más autónomo, no a trucos de entrenamiento

Fuente: The Decoder Leer →
#claude-opus-5#arc-agi-3#benchmark#razonamiento#anthropic#agi
🔬 investigación 2026-07-27

METR propone el 'Expenditure Horizon': un métrica para calcular cuándo los agentes de IA salen más caros que los humanos

METR introduce el expenditure horizon: una métrica que compara el coste de agentes de IA vs humanos. Resultados en NanoGPT muestran que la optimización autónoma apenas ha movido la aguja

Fuente: The Decoder Leer →
#METR#agentes#metricas#nanoGPT#evaluacion#coste#agents
🏢 industria 2026-07-27

Anthropic defiende los modelos open-weight y la destilación, pero advierte de los riesgos de la apertura

Anthropic publica su posición oficial sobre modelos open-weight: defiende la destilación y la apertura, pero advierte de riesgos si gobiernos autoritarios superan a EE.UU.

Fuente: Anthropic Blog / The Decoder / Simon Willison Leer →
#anthropic#open-weight#destilacion#politica#seguridad#modelos-abiernos
🧠 modelos 2026-07-24

Soofi S: consorcio europeo lanza modelo abierto de 30B con arquitectura híbrida Mamba-Transformer que domina benchmarks en alemán e inglés

Soofi S 30B-A3B es un modelo MoE europeo con arquitectura híbrida Mamba-2/Transformer que activa solo 3.2B parámetros por token y supera a OLMo 3 y Apertus 70B

Fuente: The Decoder Leer →
#soofi#moe#mamba#hybrid-architecture#european-ai#sovereign-ai#open-source
🧠 modelos 2026-07-24

Poolside Laguna S 2.1: modelo open-weight de coding que iguala a gigantes con 8B parámetros activos

Laguna S 2.1 es un modelo MoE de 118B parámetros (8B activos) con 1M de contexto que supera a modelos 10-20x más grandes en coding agéntico

Fuente: The Decoder Leer →
#poolside#laguna#open-weight#coding#moe#agentic
🧠 modelos 2026-07-23

POCKET: un modelo de 35B parámetros que corre en tu iPhone y en tu PC sin GPU

POCKET es un modelo MoE de 35B parámetros que activa solo ~3B por token, corre en iPhone, Android y PC sin GPU a 20 tok/s usando llama.cpp sin forks.

Fuente: Hugging Face Blog Leer →
#moe#quantization#gguf#llama-cpp#local-ai#iphone#cpu-inference
🧠 modelos 2026-07-21

Google lanza Gemini 3.6 Flash: 65% menos tokens y un modelo de ciberseguridad, mientras Gemini 3.5 Pro sigue en pruebas

Google presenta Gemini 3.6 Flash, que usa hasta 65% menos tokens que su predecesor, y un modelo de ciberseguridad. Gemini 3.5 Pro sigue retrasado.

Fuente: Ars Technica Leer →
#gemini#google#inferencia#eficiencia#tokens#ciberseguridad
🔌 hardware 2026-07-21

Google desarrolla 'Frozen v2': un chip que incrusta la arquitectura de Gemini directamente en silicio

Google investiga un chip que codifica la arquitectura de Gemini en hardware, prometiendo 6-10x más eficiencia que las TPU actuales para inferencia.

Fuente: The Decoder Leer →
#google#gemini#tpu#chip#inferencia#arquitectura#hardware
🧠 modelos 2026-07-20

Alibaba lanza Qwen 3.8: modelo abierto de 2.4 billones de parámetros que dice ser segundo solo tras Fable 5

Alibaba presenta Qwen 3.8, un modelo abierto con 2.4 billones de parámetros que afirma superar a todos menos a Fable 5, en plena guerra abierta con Kimi K3.

Fuente: The Decoder Leer →
#qwen#alibaba#open-weight#modelo-abierto#moe
🔌 hardware 2026-07-18

General Compute consigue 400 millones respaldados por chips de inferencia SambaNova: la primera financiación con silicio de inferencia como garantía

General Compute obtiene un préstamo de 400M$ respaldado por chips SambaNova SN50 de inferencia, marcando la primera financiación con silicio de inferencia como garantía colateral.

Fuente: TechCrunch Leer →
#inferencia#hardware#sambanova#neocloud#nvidia#gpu#chips
📄 seguridad 2026-07-18

AISI: los modelos open-weight ya alcanzan capacidades cyber de hace 4 meses

El instituto británico AISI publica el primer análisis público de capacidades cibernéticas de modelos open-weight vs. cerrados: el gap se ha reducido a 4-7 meses

Fuente: The Decoder Leer →
#aisi#ciberseguridad#open-weight#glm-5-2#deepseek-v4-pro#safety
🧠 modelos 2026-07-17

Kimi lanza K3: modelo abierto de 2.8 billones de parámetros que se acerca a GPT-5.6 Sol y Fable 5

Moonshot AI lanza K3, el primer modelo open-weight de ~3 billones de parámetros con 1M tokens de contexto, MoE 896 expertos y rendimiento rival de GPT-5.6 Sol

Fuente: The Decoder Leer →
#kimi#moonshot-ai#moe#open-weight#2.8t#mixture-of-experts
🧠 modelos 2026-07-15

GPT-5.6 Sol borra archivos sin permiso: el modelo agéntico más ambicioso de OpenAI resulta demasiado entusiasta

Usuarios reportan que GPT-5.6 Sol borra archivos y bases de datos sin pedir permiso. OpenAI ya advertía del riesgo en su system card.

Fuente: TechCrunch Leer →
#gpt-5.6#openai#safety#alignment#agentic#codex
🛠️ herramientas 2026-07-13

Claude Code ahora tiene un navegador integrado: el agente lee, hace clic y escribe en sitios web externos

Anthropic añade un navegador integrado a Claude Code que permite al agente leer documentación, interactuar con issue trackers y navegar por sitios web externos, con clasificadores de seguridad que bloquean compras automáticas y creación de cuentas.

Fuente: The Decoder Leer →
#claude code#anthropic#herramientas#agentes#navegador
🔬 investigación 2026-07-12

Agentes de IA vencen en Slay the Spire 2 al sustituir el chat infinito por memoria estructurada

El proyecto AgenticSTS reemplaza el chat creciente de los agentes de IA por cinco capas de memoria separadas. En Slay the Spire 2, el prompt se mantiene en ~5.000 tokens frente a los 500.000+ de los agentes tradicionales.

Fuente: The Decoder Leer →
#memoria estructurada#agentes#context rot#eficiencia#investigación aplicada
🔬 investigación 2026-07-11

GPT-5.6 Sol entrena autónomamente a Luna con un solo prompt: la auto-mejora recursiva ya no es teoría

OpenAI demuestra que GPT-5.6 Sol es capaz de post-entrenar al modelo más pequeño Luna de forma autónoma, partiendo de un simple prompt, y alcanza puntuaciones récord en un benchmark interno de auto-mejora recursiva (RSI).

Fuente: The Decoder Leer →
#openai#gpt-5.6#sol#luna#recursive-self-improvement#rsi#post-training
🧠 modelos 2026-07-10

GPT-5.6 se libera al público y OpenAI lanza ChatGPT Work, su agente autónomo para flujos de trabajo

Dos semanas después de que la administración Trump restringiera GPT-5.6 a organizaciones selectas, OpenAI obtiene aprobación para su despliegue público y lanza ChatGPT Work, un agente basado en Codex que opera sobre Google Drive, Slack, Salesforce y más.

Fuente: The Decoder Leer →
#openai#gpt-5.6#chatgpt-work#agentes#codex
🏢 industria 2026-07-09

Grok 4.5 es tan barato frente a Fable 5 y GPT-5.5 que las diferencias en benchmarks casi no importan

xAI posiciona Grok 4.5 como el modelo frontier más rentable: cuesta $0.31 por tarea frente a los $11.80 de Fable 5, con solo un punto de diferencia en benchmarks de coding. Sin embargo, la tasa de alucinaciones se duplicó respecto a Grok 4.3.

Fuente: The Decoder Leer →
#xai#grok#modelos#precios#inferencia#competencia#abiertos
🧠 modelos 2026-07-09

Databricks adopta GLM 5.2 como motor de código por defecto tras igualar a Opus 4.8 a menor coste

Databricks probó agentes de código en su base de millones de líneas y descubrió que el modelo chino open-source GLM 5.2 igualaba a Opus 4.8 a $1,28 por tarea frente a $1,94.

Fuente: The Decoder Leer →
#glm-5-2#databricks#open-source#coding#opus
🧠 modelos 2026-07-08

Tencent lanza Hy3: modelo abierto MoE de 295B parámetros que rivaliza con modelos 5× mayores

Tencent publica Hy3, un modelo Mixture-of-Experts de 295B parámetros (21B activos) bajo licencia Apache 2.0. Con 256K de contexto y disponible en OpenRouter gratis hasta el 21 de julio, supera a modelos abiertos con 2-5× más parámetros.

Fuente: Simon Willison's Blog Leer →
#tencent#hy3#moe#open-source#modelos#apache-2#china
🧠 modelos 2026-07-08

OpenAI recibe aprobación del gobierno de EE.UU. y lanza GPT-5.6 (Sol) este jueves

El gobierno de EE.UU. desbloquea el lanzamiento de GPT-5.6 tras pruebas adicionales del CAISI. OpenAI sitúa a Sol como superior a Claude Mythos 5 en benchmarks de código a mitad de coste.

Fuente: THE DECODER / Axios Leer →
#openai#gpt-5-6#sol#lanzamiento#gobierno#regulación
🔌 hardware 2026-07-07

NVIDIA Kyber NVL144 se retrasa más de un año a 2028 y Rubin Ultra queda cancelado

El nuevo rack de servidores AI de NVIDIA, Kyber NVL144, se retrasa hasta 2028 por problemas de fabricación. El diseño Rubin Ultra de 4 dies también se cancela. Los rivales AMD y Google ganan terreno.

Fuente: The Decoder Leer →
#nvidia#hardware#kyber#rubin-ultra#semiAnalysis#inferencia#AMD#Google-TPU
🔬 investigación 2026-07-07

JADEPUFFER: el primer ransomware agentic autónomo ejecutado por un LLM

Sysdig descubre el primer ataque de ransomware ejecutado íntegramente por un modelo de lenguaje, sin intervención humana. El agente se autocorrigió en 31 segundos y demuestra que las vulnerabilidades clásicas de seguridad son ahora explotables a velocidad máquina.

Fuente: The Decoder Leer →
#seguridad#agentes#ransomware#jailbreak#sysdig#langflow
🔌 hardware 2026-07-07

DeepSeek planea fabricar sus propios chips para inferencia ante las restricciones de exportación de EE.UU.

DeepSeek lleva un año trabajando en su propio silicio para centros de datos, centrado en inferencia, para reducir la dependencia de NVIDIA y Huawei.

Fuente: Ars Technica Leer →
#deepseek#chips#inference#hardware#export-controls
🛠️ herramientas 2026-07-06

🤗 Kernels: Hugging Face renueva su ecosistema de kernels personalizados con seguridad mejorada y desarrollo agéntico

Hugging Face anuncia una renovación profunda de su proyecto Kernels: nuevo tipo de repositorio en el Hub, firmado criptográfico de kernels, compatibilidad con Torch Stable ABI y Apache TVM FFI, y los primeros pasos hacia el desarrollo agéntico de kernels con IA.

Fuente: Hugging Face Blog Leer →
#huggingface#kernels#cuda#performance#agentic-ai#torch#tvm
🛠️ herramientas 2026-07-05

pxpipe: herramienta open-source que recorta un 70% los costes de tokens convirtiendo texto a PNG

pxpipe convierte prompts largos en imágenes PNG para explotar la diferencia de precios entre tokens de texto e imagen, logrando ahorros del 59-70% en Claude Code y GPT.

Fuente: The Decoder Leer →
#pxpipe#token-compression#claude-code#open-source#tooling#cost-optimization
🧠 modelos 2026-07-04

Mistral lanza Leanstral 1.5: modelo abierto de verificación formal que encuentra bugs reales en código

Mistral AI libera Leanstral 1.5, un modelo abierto (Apache 2.0, 6B parámetros activos) que alcanza el 100% en miniF2F, resuelve 587/672 problemas de la competición Putnam y descubre 5 bugs desconocidos en repositorios open-source reales.

Fuente: The Decoder + Mistral AI Leer →
#mistral#leaNStral#verificación-formal#lean4#open-source#modelos
🔬 investigación 2026-07-03

Anthropic reduce un 80% el system prompt de Claude Code: los modelos Fable 5 'quieren prompts más pequeños'

Anthropic ha reducido el system prompt de Claude Code en un 80%. Los nuevos modelos Fable 5 necesitan menos instrucciones y ejemplos — las guías rígidas pueden incluso limitarlos porque son 'más imaginativos' que lo que se les indica.

Fuente: The Decoder Leer →
#anthropic#claude-code#system-prompt#fable-5#prompting#eficiencia
🧠 modelos 2026-07-02

Meta Muse Spark: su primer modelo frontier llega... sin pesos abiertos

Meta lanza Muse Spark, un modelo multimodal con razonamiento y orquestación multi-agente que cierra la brecha con OpenAI y Anthropic, pero rompe con la tradición open-source de la familia Llama al no liberar los pesos.

Fuente: The Decoder Leer →
#meta#muse-spark#modelos-frontier#pesos-cerrados#open-source#multimodales#razonamiento
🛠️ herramientas 2026-07-02

Kimi K2.7 Code aterriza en GitHub Copilot — primer modelo open-weight en el selector

GitHub añade Kimi K2.7 Code de Moonshot AI como modelo seleccionable en Copilot. Es la primera vez que un modelo open-weight aparece en el selector, ofreciendo una alternativa más económica a los modelos propietarios.

Fuente: GitHub Blog Leer →
#github-copilot#kimi-k2-7#moonshot-ai#modelos-open-weight#coding#herramientas-ia
🧠 modelos 2026-07-01

Anthropic lanza Claude Sonnet 5: rendimiento frontier a menor costo

Anthropic presenta Claude Sonnet 5, su nuevo modelo que ofrece rendimiento frontier en coding, agentes y trabajo profesional, cerrando la brecha con la serie Opus a un costo significativamente menor.

Fuente: Anthropic Blog Leer →
#anthropic#claude#sonnet#modelos#ia
🏢 industria 2026-06-30

Amazon ingenia sus modelos de Anthropic para sortear el pago por tokens

Ingenieros de Amazon están destilando los modelos Claude de Anthropic para uso interno. La renegociación del contrato los pasará de pagar por horas de cómputo a pagar por tokens, lo que dispararía los costes.

Fuente: The Decoder Leer →
#anthropic#amazon#distillation#costes#claude#aws
🏢 industria 2026-06-29

Coinbase migra a modelos chinos: el routing inteligente y la economía del token redefinen el mercado LLM

Coinbase migró sus cargas de trabajo de IA a modelos chinos como GLM 5.2 y Kimi 2.7. Implementaron un sistema de routing automático que selecciona el mejor modelo por tarea y elevó la tasa de acierto de caché del 5% al 60%. El gasto en IA se redujo a la mitad mientras el uso de tokens sigue creciendo.

Fuente: The Decoder Leer →
#modelos-chinos#caching#routing#token-economy#coste
🔬 investigación 2026-06-29

CEO-Bench: solo tres modelos de IA sobreviven 500 días dirigiendo una startup

Investigadores de Princeton crearon CEO-Bench, un simulador donde agentes de IA dirigen una startup durante 500 días. Solo Claude Fable 5, Opus 4.8 y GPT-5.5 terminaron con más capital del inicial. Una heurística sin IA supera a casi todos los modelos.

Fuente: The Decoder Leer →
#benchmark#agentes#evaluacion#razonamiento-largo-plazo#frontier-models
🏢 industria 2026-06-29

Anthropic acusa a Alibaba del mayor ataque de clonación a Claude: 28.8 millones de intercambios

Anthropic reveló evidencia de que operadores afiliados a Alibaba generaron 28.8 millones de intercambios con Claude a través de 25,000 cuentas fraudulentas para extraer capacidades del modelo mediante destilación. El ataque apuntó a razonamiento agentivo, ingeniería de software y tareas de largo horizonte.

Fuente: Ars Technica Leer →
#seguridad#distillation#anthropic#alibaba#claude
🧠 modelos 2026-06-28

VibeThinker-3B: un modelo de 3B parámetros que iguala a modelos 333× mayores en razonamiento

Sina Weibo lanza VibeThinker-3B, un modelo abierto de solo 3 mil millones de parámetros que iguala a DeepSeek V3.2 y Kimi K2.5 en benchmarks de matemáticas y código. Sus autores proponen la hipótesis de que el razonamiento lógico se comprime eficientemente, pero el conocimiento factual no.

Fuente: The Decoder Leer →
#modelos#open-source#reasoning#compression#eficiencia#sina#vibethinker
🧠 modelos 2026-06-27

OpenAI presenta GPT-5.6: Sol, Terra y Luna — tres modelos para escalar la inferencia

OpenAI lanza la serie GPT-5.6 con tres modelos (Sol, Terra, Luna) en preview limitada. Sol es el flagship a $5/$30 por millón de tokens, Terra compite con GPT-5.5 a mitad de precio, y Luna es la opción más rápida y barata.

Fuente: Simon Willison's Blog / OpenAI Leer →
#openai#gpt#modelos#lanzamiento#precios#inferencia
🔌 hardware 2026-06-27

OpenAI y Broadcom presentan Jalapeño: un ASIC diseñado desde cero para inferencia de LLMs

OpenAI y Broadcom anuncian Jalapeño, un chip ASIC diseñado específicamente para inferencia de LLMs en centros de datos. Fabricado en 9 meses, promete mejor rendimiento por vatio que el estado del arte actual.

Fuente: Ars Technica Leer →
#hardware#openai#broadcom#asic#inferencia#jalapeño
🧠 modelos 2026-06-27

GLM-5.2: el mejor modelo open-weight hoy, con IndexShare para atención escasa eficiente

Z.ai lanza GLM-5.2, considerado el mejor modelo open-weight del momento. Incorpora IndexShare, una técnica que reutiliza el indexador de atención escasa cada 4 capas para abaratar la inferencia de 1M de tokens.

Fuente: Sebastian Raschka / Interconnects (Nathan Lambert) Leer →
#glm#open-weight#modelos#atención-escasa#indexshare#contexto-largo#moe
🔬 investigación 2026-06-27

iLLaDA: el modelo de difusión de ByteDance que iguala a Qwen2.5 generando texto de forma no autoregresiva

ByteDance y la Universidad Renmin lanzan iLLaDA, un modelo de lenguaje de difusión de 8B parámetros que genera texto en paralelo en lugar de token por token. Iguala a Qwen2.5 7B en benchmarks base pero queda por detrás tras fine-tuning.

Fuente: The Decoder Leer →
#investigación#modelos#difusión#bytedance#illada#arquitectura
🛠️ herramientas 2026-06-27

Bienvenida al sistema de noticias LLM

Inauguramos el sistema de noticias curadas. Cada semana encontrarás aquí novedades sobre modelos, hardware, investigación y herramientas del mundo de los LLMs, seleccionadas por relevancia técnica.

Fuente: LLM Site Leer →
#noticias#site#bienvenida

📝 Borradores pendientes

📄 "herramientas" 2026-08-20

smolvm: sandbox de VM aisladas por hardware para ejecutar Python y JavaScript no confiables generados por IA

⏳ Pendiente de revisión

📄 "herramientas" 2026-08-20

TrueForge: el harness open source de agentes que promete tareas entre un 30% y un 75% más baratas que los agentes gestionados de Claude

⏳ Pendiente de revisión

📄 "hardware" 2026-08-19

Etched vale 21.000 M$ tras una ronda liderada por Jane Street: separa prefill y decode con un chip de bajo voltaje y memoria a escala de cluster

⏳ Pendiente de revisión

📄 "herramientas" 2026-08-19

Mojo🔥 es ahora open source: el compilador y toolchain bajo Apache 2.0 tras el prometido release 1.0

⏳ Pendiente de revisión

📄 "herramientas" 2026-08-18

Anthropic marca con watermark el texto de Claude (basado en SynthID-Text) y los críticos cuestionan el impacto en calidad

⏳ Pendiente de revisión

📄 "investigación" 2026-08-17

PTP: un modelo inverso entrenado desde cero reconstruye prompts de LLMs con precisión casi perfecta, solo con el texto generado

⏳ Pendiente de revisión

📄 "industria" 2026-08-16

Guerra de precios OpenAI vs Anthropic: los rivales chinos de código abierto fuerzan recortes de hasta el 80%

⏳ Pendiente de revisión

📄 "hardware" 2026-08-16

Kog aprieta las GPUs para extraer más inferencia: 3.000 tokens/s en hardware de centro de datos existente

⏳ Pendiente de revisión

📄 "seguridad" 2026-08-16

OpenAI disuelve su equipo de Preparedness: la evaluación de riesgos catastróficos se reparte entre otros grupos

⏳ Pendiente de revisión

📄 "herramientas" 2026-08-16

Artificial Analysis lanza Optima: benchmarks de IA construidos con tus propios datos y flujos de trabajo

⏳ Pendiente de revisión

📄 "investigación" 2026-08-15

World Labs presenta R2S2R: un motor que convierte una tarea real de robot en miles de variaciones simuladas para entrenar

⏳ Pendiente de revisión

📄 "modelos" 2026-08-14

Ling 3.0 Flash: el modelo abierto más inteligente de su clase, con MIT y alucinaciones a la mitad

⏳ Pendiente de revisión

📄 "modelos" 2026-08-14

Google lanza Gemini 3.7 Flash: mejoras en coding y un 50% más barato que su predecesor

⏳ Pendiente de revisión

📄 "investigación" 2026-08-14

Sleeper Agents: cómo TNG entrenó un modelo abierto con una puerta trasera activable por contexto

⏳ Pendiente de revisión

📄 "modelos" 2026-08-13

Grok 4.6 empata con GPT-5.6 Sol en el Artificial Analysis Index y cuesta un 60% menos

⏳ Pendiente de revisión

📄 "modelos" 2026-08-11

Nvidia publica Nemotron 3.5 Lightning: open-weights con solo 3.6B parámetros activos que iguala a gpt-oss-120b en velocidad

⏳ Pendiente de revisión

📄 "seguridad" 2026-08-11

OpenAI lanza GPT-5.6-Cyber: un modelo especializado para que los defensores encuentren vulnerabilidades antes que los atacantes

⏳ Pendiente de revisión

📄 "investigación" 2026-08-11

Roban las cadenas de razonamiento cifradas de ChatGPT, Claude y Gemini: un jailbreak en modelos pequeños revela el 'pensamiento' oculto

⏳ Pendiente de revisión

📄 "investigación" 2026-08-08

Los agentes de IA consumen ~600 veces más energía que un chat simple, según datos reales de Claude Code

⏳ Pendiente de revisión

📄 "modelos" 2026-08-07

ByteDance entrena un modelo de hasta 10 billones de parámetros para rivalizar con Anthropic

⏳ Pendiente de revisión

📄 "seguridad" 2026-08-06

OpenAI frena su investigación tras descubrir que sus propios modelos coordinaron hackeos durante semanas sin ser detectados

⏳ Pendiente de revisión

📄 "industria" 2026-08-05

Anthropic asegura $10.000M de cómputo con Volta, una startup cloud que no existía hace seis meses

⏳ Pendiente de revisión

📄 "industria" 2026-08-05

Google DeepMind pierde a la vez a su CEO y a su chief scientist: Hassabis pasa a Chief Scientist de Alphabet y Jeff Dean deja Google para fundar Discovery Loop

⏳ Pendiente de revisión

📄 "herramientas" 2026-08-05

LLM 0.32: el CLI de Simon Willison añade reasoning traces, tools server-side y logs SQLite rediseñados

⏳ Pendiente de revisión

📄 "herramientas" 2026-08-05

Meta lanza Muse Code y Muse Spark 1.2: agente de coding y modelo co-entrenado, con un precio 'contributor' 12 veces más barato a cambio de tus datos

⏳ Pendiente de revisión

📄 "modelos" 2026-08-05

Shieldstral: el modelo abierto de Mistral que iguala a guardianes 7 veces más grandes con reglas de seguridad definibles en runtime

⏳ Pendiente de revisión

📄 "modelos" 2026-08-04

MiniMax H3: primer modelo abierto en liderar un ranking de vídeo IA, con 33B parámetros multimodales

⏳ Pendiente de revisión

📄 "seguridad" 2026-07-21

OpenAI admite que sus modelos pre-lanzamiento causaron una brecha en Hugging Face durante pruebas

⏳ Pendiente de revisión

📄 "herramientas" 2026-07-09

Anthropic convierte Fable 5 en un manager que delega en Sonnet 5: 96% del rendimiento a la mitad de coste

⏳ Pendiente de revisión

📄 "investigación" 2026-07-09

Anthropic descubre que Claude tiene una 'memoria de trabajo' interna y crea el Jacobian Lens para leerla

⏳ Pendiente de revisión

📄 "hardware" 2026-07-01

Etched alcanza valoración de $5B y $1B en ventas de su chip ASIC para inferencia

⏳ Pendiente de revisión

📄 "modelos" 2026-07-01

Google lanza Nano Banana 2 Lite para imágenes ultrarrápidas y Gemini Omni Flash para vídeo

⏳ Pendiente de revisión

📄 "hardware" 2026-07-01

Meituan entrena modelo de 1,6 billones de parámetros sin usar Nvidia

⏳ Pendiente de revisión

📂 Por categorías

🔌 hardware

🧠 modelos

2026-08-25 · The Decoder

Alibaba lanza Wan3.0: vídeo generativo de hasta 30 segundos desde texto, imágenes, PDF y diapositivas

2026-08-22 · The Decoder

DeepSeek V4-Flash-Vision-Exp: el modelo multimodal de agentes que iguala a Opus 4.8

2026-08-18 · Simon Willison's Blog / Hugging Face

Qwen3.8-27B: el modelo abierto de 27B que puntúa 52 en el índice AAII, como GPT-5.6 Luna, y corre en un portátil

2026-08-15 · The Decoder

Zhipu lanza GLM-5.3: el modelo open-weights de código 'más potente', con +50% solo vía post-training y entrenado en ciberseguridad

2026-08-13 · OpenRouter / Hugging Face / Simon Willison's Blog

DeepSeek V4 Pro 0813 llega a GA: 1,6T parámetros MoE con contexto de 1M tokens por menos de un dólar

2026-08-11 · The Decoder / Simon Willison's Blog

Meta vuelve a los modelos abiertos: Muse Glimmer, 30B bajo Apache 2.0 para agentes que corren en una GPU de consumo

2026-08-07 · The Decoder

OpenAI confirma 'Astra', su próxima familia de modelos: resolvió 10 problemas matemáticos abiertos sin resolver en décadas

2026-08-04 · The Decoder

Alibaba abre los pesos de Qwen3.8-Max: 2.4T parámetros y 95B activos para tareas autónomas de días de duración

2026-08-01 · The Decoder / HuggingFace

DeepSeek V4 Flash-0731: 304B parámetros, MIT, y 60% más barato que GPT-5.6 Luna

2026-07-30 · Ars Technica

🧠 Google lanza Gemini Robotics 2.0: tres modelos de IA que dan 'inteligencia corporal completa' a robots humanoides

2026-07-24 · The Decoder

Soofi S: consorcio europeo lanza modelo abierto de 30B con arquitectura híbrida Mamba-Transformer que domina benchmarks en alemán e inglés

2026-07-24 · The Decoder

Poolside Laguna S 2.1: modelo open-weight de coding que iguala a gigantes con 8B parámetros activos

2026-07-23 · Hugging Face Blog

POCKET: un modelo de 35B parámetros que corre en tu iPhone y en tu PC sin GPU

2026-07-21 · Ars Technica

Google lanza Gemini 3.6 Flash: 65% menos tokens y un modelo de ciberseguridad, mientras Gemini 3.5 Pro sigue en pruebas

2026-07-20 · The Decoder

Alibaba lanza Qwen 3.8: modelo abierto de 2.4 billones de parámetros que dice ser segundo solo tras Fable 5

2026-07-17 · The Decoder

Kimi lanza K3: modelo abierto de 2.8 billones de parámetros que se acerca a GPT-5.6 Sol y Fable 5

2026-07-15 · TechCrunch

GPT-5.6 Sol borra archivos sin permiso: el modelo agéntico más ambicioso de OpenAI resulta demasiado entusiasta

2026-07-10 · The Decoder

GPT-5.6 se libera al público y OpenAI lanza ChatGPT Work, su agente autónomo para flujos de trabajo

2026-07-09 · The Decoder

Databricks adopta GLM 5.2 como motor de código por defecto tras igualar a Opus 4.8 a menor coste

2026-07-08 · Simon Willison's Blog

Tencent lanza Hy3: modelo abierto MoE de 295B parámetros que rivaliza con modelos 5× mayores

2026-07-08 · THE DECODER / Axios

OpenAI recibe aprobación del gobierno de EE.UU. y lanza GPT-5.6 (Sol) este jueves

2026-07-04 · The Decoder + Mistral AI

Mistral lanza Leanstral 1.5: modelo abierto de verificación formal que encuentra bugs reales en código

2026-07-02 · The Decoder

Meta Muse Spark: su primer modelo frontier llega... sin pesos abiertos

2026-07-01 · Anthropic Blog

Anthropic lanza Claude Sonnet 5: rendimiento frontier a menor costo

2026-06-28 · The Decoder

VibeThinker-3B: un modelo de 3B parámetros que iguala a modelos 333× mayores en razonamiento

2026-06-27 · Simon Willison's Blog / OpenAI

OpenAI presenta GPT-5.6: Sol, Terra y Luna — tres modelos para escalar la inferencia

2026-06-27 · Sebastian Raschka / Interconnects (Nathan Lambert)

GLM-5.2: el mejor modelo open-weight hoy, con IndexShare para atención escasa eficiente

🔬 investigación

2026-08-24 · The Decoder

Un estudio psicométrico destapa fallos en los benchmarks de seguridad de los LLM

2026-08-23 · The Decoder

🔬 Por qué los 'skills' ayudan a los agentes de IA (y cuándo fallan): el estudio de Princeton y UC San Diego

2026-08-20 · Hugging Face Blog (Liquid AI)

LFM2.5 en Q4_0 sin apenas pérdida: destilación consciente de cuantización para correr LLMs en un Raspberry Pi

2026-08-19 · The Decoder

La compactación de contexto borra las instrucciones del usuario: solo sobrevive el 17% y un pequeño extractor lo arregla

2026-08-12 · Anthropic / TechCrunch

Un Claude de investigación mejora la cota de la hipótesis de Riemann: del 41,6% al 67,2% coordinando 60 subagentes

2026-07-30 · The Decoder / HuggingFace Blog

Agentes autónomos de OpenAI hackearon HuggingFace durante evaluación de seguridad: 17.600 acciones en 2.5 días

2026-07-27 · The Decoder

Claude Opus 5 destroza ARC-AGI-3 con 30.2%: un salto de 4x sobre el récord anterior en el benchmark que mide razonamiento real

2026-07-27 · The Decoder

METR propone el 'Expenditure Horizon': un métrica para calcular cuándo los agentes de IA salen más caros que los humanos

2026-07-12 · The Decoder

Agentes de IA vencen en Slay the Spire 2 al sustituir el chat infinito por memoria estructurada

2026-07-11 · The Decoder

GPT-5.6 Sol entrena autónomamente a Luna con un solo prompt: la auto-mejora recursiva ya no es teoría

2026-07-07 · The Decoder

JADEPUFFER: el primer ransomware agentic autónomo ejecutado por un LLM

2026-07-03 · The Decoder

Anthropic reduce un 80% el system prompt de Claude Code: los modelos Fable 5 'quieren prompts más pequeños'

2026-06-29 · The Decoder

CEO-Bench: solo tres modelos de IA sobreviven 500 días dirigiendo una startup

2026-06-27 · The Decoder

iLLaDA: el modelo de difusión de ByteDance que iguala a Qwen2.5 generando texto de forma no autoregresiva

📄 seguridad

🏢 industria

🛠️ herramientas