{"result":{"sources":{"https://livebench.ai":{"overall_top_10":[{"rank":1,"model":"Claude Fable 5 Max Effort","score":"83.0","provider":"Anthropic"},{"rank":2,"model":"GPT-5.6 Sol Max Effort","score":"81.0","provider":"OpenAI"},{"rank":3,"model":"GPT-5.5 Thinking xHigh Effort","score":"80.2","provider":"OpenAI"},{"rank":4,"model":"Claude 5 Opus Thinking Max Effort","score":"80.1","provider":"Anthropic"},{"rank":5,"model":"Kimi K3","score":"79.2","provider":"Moonshot AI"},{"rank":6,"model":"Qwen 3.8 Max","score":"78.5","provider":"Alibaba"},{"rank":7,"model":"GPT-5.4 Thinking xHigh Effort","score":"78.0","provider":"OpenAI"},{"rank":8,"model":"Muse Spark 1.2 xHigh Effort","score":"78.0","provider":"Meta"},{"rank":9,"model":"GPT-5.6 Terra Max Effort","score":"77.9","provider":"OpenAI"},{"rank":10,"model":"Gemini 3.1 Pro Preview High","score":"77.0","provider":"Google"}],"price_performance_section":[{"rank":1,"model":"Grok Build 0.1","metric":"$0.024 per task"},{"rank":2,"model":"DeepSeek V4 Flash 0731","metric":"$0.060 per task"},{"rank":3,"model":"GPT-5.4 Nano xHigh","metric":"$0.091 per task"}]},"https://llm-stats.com":{"overall_top_10":[{"rank":1,"model":"GPT-5.6 Sol","score":"57.2","provider":"OpenAI"},{"rank":2,"model":"Claude Opus 5","score":"56.5","provider":"Anthropic"},{"rank":3,"model":"Claude Fable 5","score":"56.3","provider":"Anthropic"},{"rank":4,"model":"Claude Mythos Preview","score":"56.0","provider":"Anthropic"},{"rank":5,"model":"Kimi K3","score":"55.4","provider":"Moonshot AI"},{"rank":6,"model":"GPT-5.6 Terra","score":"52.7","provider":"OpenAI"},{"rank":7,"model":"Qwen3.8 Max","score":"52.5","provider":"Alibaba Cloud / Qwen Team"},{"rank":8,"model":"Claude Opus 4.8","score":"52.3","provider":"Anthropic"},{"rank":9,"model":"Muse Spark 1.1","score":"51.6","provider":"Meta"},{"rank":10,"model":"Claude Sonnet 5","score":"50.1","provider":"Anthropic"}],"price_performance_section":[{"rank":1,"model":"Grok 4.5","metric":"$2.00/M tok"},{"rank":2,"model":"GPT-5.6 Terra","metric":"$3.11/M tok"},{"rank":3,"model":"Kimi K3","metric":"$4.33/M tok"}]},"https://beta.lmarena.ai/leaderboard":{"overall_top_10":[],"price_performance_section":[]},"https://aider.chat/docs/leaderboards":{"overall_top_10":[{"rank":1,"model":"gpt-5 (high)","score":"88.0%","provider":"OpenAI"},{"rank":2,"model":"gpt-5 (medium)","score":"86.7%","provider":"OpenAI"},{"rank":3,"model":"o3-pro (high)","score":"84.9%","provider":"OpenAI"},{"rank":4,"model":"gemini-2.5-pro-preview-06-05 (32k think)","score":"83.1%","provider":"Google"},{"rank":5,"model":"gpt-5 (low)","score":"81.3%","provider":"OpenAI"},{"rank":6,"model":"o3 (high)","score":"81.3%","provider":"OpenAI"},{"rank":7,"model":"grok-4 (high)","score":"79.6%","provider":"xAI"},{"rank":8,"model":"gemini-2.5-pro-preview-06-05 (default think)","score":"79.1%","provider":"Google"},{"rank":9,"model":"o3 (high) + gpt-4.1","score":"78.2%","provider":"OpenAI"},{"rank":10,"model":"o3","score":"76.9%","provider":"OpenAI"}],"price_performance_section":[{"rank":1,"model":"gpt-5 (low)","metric":"$10.37 total cost"},{"rank":2,"model":"gpt-5 (medium)","metric":"$17.69 total cost"},{"rank":3,"model":"gpt-5 (high)","metric":"$29.08 total cost"}]},"https://artificialanalysis.ai/leaderboards/models":{"overall_top_10":[{"rank":1,"model":"Claude Opus 5 (max)","score":"63","provider":"Anthropic"},{"rank":2,"model":"Claude Opus 5 (xhigh)","score":"63","provider":"Anthropic"},{"rank":3,"model":"Claude Fable 5 (with fallback)","score":"62","provider":"Anthropic"},{"rank":4,"model":"Claude Opus 5 (high)","score":"61","provider":"Anthropic"},{"rank":5,"model":"GPT-5.6 Sol (max)","score":"61","provider":"OpenAI"},{"rank":6,"model":"Kimi K3 (max)","score":"60","provider":"Kimi"},{"rank":7,"model":"GPT-5.6 Sol (xhigh)","score":"59","provider":"OpenAI"},{"rank":8,"model":"Claude Opus 5 (medium)","score":"59","provider":"Anthropic"},{"rank":9,"model":"Qwen3.8 Max","score":"58","provider":"Alibaba"},{"rank":10,"model":"GPT-5.6 Sol (high)","score":"57","provider":"OpenAI"}],"price_performance_section":[{"rank":1,"model":"GPT-5.6 Luna (low)","metric":"$0.01 per task"},{"rank":2,"model":"MiMo-V2.5","metric":"$0.01 per task"},{"rank":3,"model":"Llama 4 Scout","metric":"$0.01 per task"}]}},"_metadata":{"strategy":"scraped","has_errors":false,"model_name":"o4-mini","scraped_urls":["https://livebench.ai","https://llm-stats.com","https://aider.chat/docs/leaderboards","https://beta.lmarena.ai/leaderboard","https://artificialanalysis.ai/leaderboards/models"],"success_rate":1,"timeout_used":90000,"model_provider":"openai","urls_requested":5,"scraping_errors":{},"urls_successful":5,"strategy_version":"1.2.0","collected_formats":{"html":0,"text":0,"links":0,"markdown":5,"metadata":0},"page_options_used":{},"requested_formats":["markdown"],"process_started_at":"2026-08-09T18:02:16.771Z","multi_format_analysis_enabled":true},"_strategy":"scraped","best-llms":{"price-performance":{"provider":"DeepSeek","arguments":{"de":["Extrem niedrige Kosten $0.060 pro Aufgabe","Stabile Leistung mit 74.2 Gesamtpunktzahl","Open-source, selbst-hostbar und günstig"],"en":["Extremely low cost at $0.060 per task","Solid overall performance of 74.2","Open-source and self-hostable for maximum control"]},"rationale":{"de":"DeepSeek V4 Flash 0731 liefert sehr gute Gesamtleistung zu minimalen Kosten.","en":"DeepSeek V4 Flash 0731 offers strong overall performance at extremely low cost."},"model_name":"DeepSeek-V4-Flash-0731","supporting_evidence":{"https://livebench.ai":"$0.060 per successful task at overall 74.2","https://llm-stats.com":"Open-source model, 48.3 LLM Stats Score at only $0.10/M tok"},"price_performance_score":9.2},"total-performance":{"provider":"Anthropic","arguments":{"de":["Führt LiveBench an mit 83.0 Gesamtpunktzahl","Erreicht Rang 3 auf LLM Stats Score mit 56.3","Stetig in den Top-3 über mehrere Leaderboards"],"en":["Tops LiveBench with overall 83.0 score","Ranks third on LLM Stats Score with 56.3","Consistently in the top 3 across multiple leaderboards"]},"rationale":{"de":"Claude Fable 5 dominiert LiveBench und ist in allen führenden Ranglisten konstant unter den Top-3.","en":"Claude Fable 5 leads LiveBench and consistently ranks among the top 3 across major leaderboards."},"model_name":"Claude Fable 5","total_score":9.5,"supporting_evidence":{"https://livebench.ai":"#1 overall with score 83.0","https://llm-stats.com":"Rank 3 with LLM Stats Score 56.3"}}}},"updatedAt":"2026-08-09T18:02:17.109871+00:00","error":null}