DeepSeek V4 Pro 0813 disponible via API sur OpenRouter, pas de page d'annonce officielle
Publié le 13 août 2026
TL;DR
- DeepSeek V4 Pro 0813 disponible via API sur OpenRouter, pas de page d’annonce officielle [15]
- Cloudflare Computer donne un système de fichiers persistant et un shell à votre agent IA, stockage gratuit [4]
- VAKRA publie un benchmark de 8 000+ requêtes exécutables pour agents multi-hop API + retrieval [14]
Les 3 signaux
🖥️ Cloudflare Computer : un workspace persistant pour agents IA
Cloudflare Computer fournit un système de fichiers persistant et un shell à votre agent IA. Le stockage tient dans le plan gratuit, l’exécution est payante [4].
Pourquoi ça compte : vos agents peuvent conserver un environnement de travail stable entre les sessions, ce qui évite de reconstruire l’infrastructure à chaque exécution et réduit les coûts liés aux tâches répétitives.
🧠 DeepSeek V4 Pro 0813 : sortie discrète via OpenRouter
DeepSeek a publié son nouveau modèle Pro, accessible uniquement via API. Aucune page d’annonce officielle n’existe ; Simon Willison a dû linker OpenRouter pour le référencer [15]. L’incertitude demeure sur une éventuelle sortie des poids ouverts, bien que les poids soient disponibles pour les modèles précédents [15].
Pourquoi ça compte : si les poids ouverts suivent, c’est une alternative open-source viable aux API propriétaires, avec un impact direct sur vos coûts d’inférence et votre indépendance vis-à-vis des fournisseurs.
📊 Benchmarks agents : VAKRA et InSight-doc
VAKRA évalue le raisonnement multi-hop à travers les APIs et la récupération documentaire, avec plus de 8 000 requêtes exécutables [14]. InSight-doc traite la résolution visuelle comme une ressource de raisonnement adaptative pour la compréhension de longs documents, partant de basse résolution pour réduire les coûts d’inférence [10].
Pourquoi ça compte : VAKRA vous donne un cadre pour tester vos agents sur des scénarios enterprise réels (APIs + retrieval combinés), et InSight-doc propose une stratégie concrète pour réduire les coûts d’inférence sur documents longs.
À retenir
- 8 000+ requêtes exécutables dans VAKRA pour tester le multi-hop API + retrieval [14]
- 0 € coût de stockage dans le plan gratuit Cloudflare Computer, exécution payante séparément [4]
- 4e tentative de correction de bug par IA sans succès, cité par Florian Herrengt sur les limites des agents en debug [17]
🛠 Tuto du jour
Tuto / Outil : llama.cpp [2] + guide GPU passthrough macOS VMs [3] Ce qu’on installe : llama.cpp pour inférence LLM locale, avec accélération GPU sur VM Apple Silicon. Prérequis hardware & commande : Apple Silicon ; commande non spécifiée dans les éléments.
💻 Matos & Infra local
Sujet Matos/Infra : Apple Silicon et VMs macOS pour inférence llama.cpp [3] Constat technique : Le blog détaille le GPU passthrough sur macOS VMs pour accélérer l’inférence LLM avec llama.cpp, une alternative aux serveurs dédiés [3]. Recommandation dev : Évaluer cette config pour des tests locaux sur Mac M-series avant de dimensionner un rack [3].
🎯 Fine-Tuning & Quantiz
Technique / Outil : llama.cpp [2] Apport : Amélioration de l’inférence LLM sur Apple Silicon via VMs macOS, avec passage de GPU (GPU passthrough) [3]. Impact pratique : Permet d’exécuter des modèles localement sur matériel Apple avec une meilleure utilisation des ressources GPU.
🧠 RAG & Agents Locaux
Architecture / Outil : llama.cpp [2] ; accélération GPU sur macOS via passthrough [3] Cas d’usage : inférence LLM locale sur Apple Silicon, y compris en VM macOS [3] Clé de voûte : exécution CPU/GPU unifiée sans dépendance cloud, optimisée pour matériel grand public [2][3]
📊 Track Record
Ce qu’on disait le 2026-07-30 : “Turbo-Fieldfare open-source engine fait tourner Gemma 4 26B dans 2 Go RAM sur tout M-series Mac” [1] Verdict aujourd’hui : partiellement tenu. L’intérêt pour l’inférence locale sur Apple Silicon persiste, avec llama.cpp toujours actif [2] et un guide dédié au GPU passthrough pour macOS VMs [3]. Aucune confirmation directe de Turbo-Fieldfare n’apparaît dans les éléments du jour.
🔗 Sources (18) — vérifiées le 13/08/2026 05:00 UTC
- Stealing Reasoning Traces from Proprietary LLM APIs — Hacker News · 2026-08-11
- llama.cpp — Hacker News · 2026-08-12
- Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp — Hacker News · 2026-08-11
- Cloudflare Computer - Un ordinateur dans le cloud pour votre agent IA — Korben · 2026-08-12
- France to ban unsolicited telemarketing calls — Hacker News · 2026-08-11
- OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution — HF Papers
- Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives — HF Papers
- MBA: Multimodal Benchmark and Agents for Real-World Business Ideation — HF Papers
- AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research — HF Papers
- InSight-doc: Agentic Visual Perception for Long-Document Understanding — HF Papers
- 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents — HF Papers
- WorldClaw Agentic 3D open-world generation at scale — Hacker News · 2026-08-11
- AVA-Encoder: Towards Agent-Native Video Representation Learning — arXiv · 2026-08-12
- VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies — arXiv · 2026-08-12
- DeepSeek V4 Pro 0813 (on OpenRouter) — Simon Willison · 2026-08-12
- alchemy-utils 0.1a0 — Simon Willison · 2026-08-12
- Quoting Florian Herrengt — Simon Willison · 2026-08-12
- There are no lossless transformations of natural-language text — Simon Willison · 2026-08-11
V3ille — Sources : arXiv, GitHub Trending, Hugging Face Daily Papers, OpenAI, DeepMind, Google AI, IEEE Spectrum, The Robot Report.