{
  "schemaVersion": 1,
  "benchmark": {
    "id": "vals-finance-agent-v2",
    "name": "Finance Agent (v2) · Vals AI",
    "version": "2 · private test set",
    "category": "work",
    "question": "Can an agent do a financial analyst's work?",
    "summary": "Multi-step analyst tasks covering modeling, comparables, earnings, and disclosure reading.",
    "source": {
      "name": "Vals AI",
      "url": "https://www.vals.ai/benchmarks/fabv2",
      "methodologyUrl": "https://www.vals.ai/about"
    },
    "measure": "Severity-weighted partial credit across ten task families in the FAB v2 harness, averaged over repeated runs.",
    "comparisonRule": "Compare within Finance Agent v2. The v1 board used a different task set and is not a continuation of this one.",
    "limitations": [
      "The test set is private, so no independent party can reproduce these scores.",
      "Task-family scores in the inspector are components of the headline number, not separate rankings.",
      "Model names are the identifiers Vals publishes, not aicharts canonical names."
    ],
    "coverage": "charted",
    "tags": [
      "finance",
      "analyst",
      "agentic",
      "financial modeling",
      "earnings",
      "professional work",
      "Vals AI",
      "independent evaluator"
    ]
  },
  "dataset": {
    "benchmarkId": "vals-finance-agent-v2",
    "version": "2 · private test set",
    "score": {
      "label": "Accuracy",
      "unit": "%",
      "direction": "higher",
      "minimum": 0,
      "maximum": 100
    },
    "source": {
      "name": "Vals AI · Finance Agent (v2)",
      "url": "https://www.vals.ai/benchmarks/fabv2",
      "retrievedAt": "2026-09-28T18:16:23.422Z",
      "revision": "finance_agent v2"
    },
    "observedAt": "2026-09-27T00:00:00.000Z",
    "evidenceLabel": "Independent evaluator · private test set",
    "configurationLabel": "Model at the effort Vals selected",
    "comparabilityNote": "Private evaluation run by Vals. Dollar values are the publisher's average cost per test under its own harness. Model names are the identifiers Vals publishes, not aicharts canonical names.",
    "costLabel": "Average cost per test (USD)",
    "points": [
      {
        "id": "alibaba-qwen3-6-plus",
        "label": "alibaba/qwen3.6-plus",
        "model": "alibaba/qwen3.6-plus",
        "provider": "Alibaba",
        "harness": null,
        "effort": null,
        "score": 40.846,
        "costUsd": 0.814379,
        "uncertainty": {
          "lower": 40.714999999999996,
          "upper": 40.977,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "alibaba/qwen3.6-plus"
          },
          {
            "label": "Standard error",
            "value": "±0.13 points"
          },
          {
            "label": "Mean latency",
            "value": "612 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "29.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "51.9%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "58.2%"
          },
          {
            "label": "Market Analysis",
            "value": "47.3%"
          },
          {
            "label": "Comparables",
            "value": "43.7%"
          },
          {
            "label": "Precedents",
            "value": "17.1%"
          },
          {
            "label": "Adjustments",
            "value": "35.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "52.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "44.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "16.7%"
          }
        ]
      },
      {
        "id": "alibaba-qwen3-7-max",
        "label": "alibaba/qwen3.7-max",
        "model": "alibaba/qwen3.7-max",
        "provider": "Alibaba",
        "harness": null,
        "effort": null,
        "score": 47.776,
        "costUsd": 0.553214,
        "uncertainty": {
          "lower": 47.04900000000001,
          "upper": 48.503,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "alibaba/qwen3.7-max"
          },
          {
            "label": "Standard error",
            "value": "±0.73 points"
          },
          {
            "label": "Mean latency",
            "value": "635 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "34.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "63.5%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "67.1%"
          },
          {
            "label": "Market Analysis",
            "value": "59.5%"
          },
          {
            "label": "Comparables",
            "value": "42.3%"
          },
          {
            "label": "Precedents",
            "value": "20.0%"
          },
          {
            "label": "Adjustments",
            "value": "41.2%"
          },
          {
            "label": "Earnings Analysis",
            "value": "60.2%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "59.2%"
          },
          {
            "label": "Financial Modeling",
            "value": "17.0%"
          }
        ]
      },
      {
        "id": "alibaba-qwen3-7-plus",
        "label": "alibaba/qwen3.7-plus",
        "model": "alibaba/qwen3.7-plus",
        "provider": "Alibaba",
        "harness": null,
        "effort": null,
        "score": 38.22,
        "costUsd": 0.357661,
        "uncertainty": {
          "lower": 37.18,
          "upper": 39.26,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "alibaba/qwen3.7-plus"
          },
          {
            "label": "Standard error",
            "value": "±1.04 points"
          },
          {
            "label": "Mean latency",
            "value": "542 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "25.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "46.0%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "52.2%"
          },
          {
            "label": "Market Analysis",
            "value": "48.5%"
          },
          {
            "label": "Comparables",
            "value": "38.8%"
          },
          {
            "label": "Precedents",
            "value": "18.1%"
          },
          {
            "label": "Adjustments",
            "value": "35.5%"
          },
          {
            "label": "Earnings Analysis",
            "value": "50.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "44.4%"
          },
          {
            "label": "Financial Modeling",
            "value": "10.1%"
          }
        ]
      },
      {
        "id": "alibaba-qwen3-8-27b",
        "label": "alibaba/qwen3.8-27b",
        "model": "alibaba/qwen3.8-27b",
        "provider": "Alibaba",
        "harness": null,
        "effort": "xhigh",
        "score": 48.553,
        "costUsd": 0.748532,
        "uncertainty": {
          "lower": 46.456999999999994,
          "upper": 50.649,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "alibaba/qwen3.8-27b"
          },
          {
            "label": "Standard error",
            "value": "±2.10 points"
          },
          {
            "label": "Mean latency",
            "value": "622 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "36.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "62.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "66.9%"
          },
          {
            "label": "Market Analysis",
            "value": "49.6%"
          },
          {
            "label": "Comparables",
            "value": "38.9%"
          },
          {
            "label": "Precedents",
            "value": "21.6%"
          },
          {
            "label": "Adjustments",
            "value": "47.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "70.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "60.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "19.3%"
          }
        ]
      },
      {
        "id": "alibaba-qwen3-8-max",
        "label": "alibaba/qwen3.8-max",
        "model": "alibaba/qwen3.8-max",
        "provider": "Alibaba",
        "harness": null,
        "effort": null,
        "score": 50.593,
        "costUsd": 1.236977,
        "uncertainty": {
          "lower": 50.015,
          "upper": 51.17100000000001,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "alibaba/qwen3.8-max"
          },
          {
            "label": "Standard error",
            "value": "±0.58 points"
          },
          {
            "label": "Mean latency",
            "value": "1,175 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "38.2%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "63.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "67.4%"
          },
          {
            "label": "Market Analysis",
            "value": "63.7%"
          },
          {
            "label": "Comparables",
            "value": "44.3%"
          },
          {
            "label": "Precedents",
            "value": "19.5%"
          },
          {
            "label": "Adjustments",
            "value": "48.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "67.7%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "60.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "20.4%"
          }
        ]
      },
      {
        "id": "ant-ling-3-0-flash-2607",
        "label": "ant/ling-3.0-flash-2607",
        "model": "ant/ling-3.0-flash-2607",
        "provider": "Ant",
        "harness": null,
        "effort": null,
        "score": 30.314,
        "costUsd": 0.05047,
        "uncertainty": {
          "lower": 30.039,
          "upper": 30.589,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "ant/ling-3.0-flash-2607"
          },
          {
            "label": "Standard error",
            "value": "±0.28 points"
          },
          {
            "label": "Mean latency",
            "value": "157 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "19.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "43.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "42.2%"
          },
          {
            "label": "Market Analysis",
            "value": "37.3%"
          },
          {
            "label": "Comparables",
            "value": "27.4%"
          },
          {
            "label": "Precedents",
            "value": "14.7%"
          },
          {
            "label": "Adjustments",
            "value": "23.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "37.0%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "41.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "5.3%"
          }
        ]
      },
      {
        "id": "ant-ling-3-0-flash-af-rc3",
        "label": "ant/ling-3.0-flash-af-rc3",
        "model": "ant/ling-3.0-flash-af-rc3",
        "provider": "Ant",
        "harness": null,
        "effort": null,
        "score": 54.927,
        "costUsd": 0.044792,
        "uncertainty": {
          "lower": 54.248,
          "upper": 55.606,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "ant/ling-3.0-flash-af-rc3"
          },
          {
            "label": "Standard error",
            "value": "±0.68 points"
          },
          {
            "label": "Mean latency",
            "value": "375 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "43.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "67.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "77.2%"
          },
          {
            "label": "Market Analysis",
            "value": "62.3%"
          },
          {
            "label": "Comparables",
            "value": "47.8%"
          },
          {
            "label": "Precedents",
            "value": "29.0%"
          },
          {
            "label": "Adjustments",
            "value": "51.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "74.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "67.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "16.3%"
          }
        ]
      },
      {
        "id": "anthropic-claude-fable-5",
        "label": "anthropic/claude-fable-5",
        "model": "anthropic/claude-fable-5",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 56.314,
        "costUsd": 8.061563,
        "uncertainty": {
          "lower": 55.474,
          "upper": 57.154,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-fable-5"
          },
          {
            "label": "Standard error",
            "value": "±0.84 points"
          },
          {
            "label": "Mean latency",
            "value": "611 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "45.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "70.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "80.8%"
          },
          {
            "label": "Market Analysis",
            "value": "68.9%"
          },
          {
            "label": "Comparables",
            "value": "44.0%"
          },
          {
            "label": "Precedents",
            "value": "28.1%"
          },
          {
            "label": "Adjustments",
            "value": "51.1%"
          },
          {
            "label": "Earnings Analysis",
            "value": "77.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "68.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "17.6%"
          }
        ]
      },
      {
        "id": "anthropic-claude-fable-5-1",
        "label": "anthropic/claude-fable-5-1",
        "model": "anthropic/claude-fable-5-1",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 58.877,
        "costUsd": 8.346696,
        "uncertainty": {
          "lower": 56.819,
          "upper": 60.935,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-fable-5-1"
          },
          {
            "label": "Standard error",
            "value": "±2.06 points"
          },
          {
            "label": "Mean latency",
            "value": "1,094 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "47.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "77.0%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "79.7%"
          },
          {
            "label": "Market Analysis",
            "value": "69.5%"
          },
          {
            "label": "Comparables",
            "value": "46.0%"
          },
          {
            "label": "Precedents",
            "value": "32.2%"
          },
          {
            "label": "Adjustments",
            "value": "54.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "75.5%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "70.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "25.3%"
          }
        ]
      },
      {
        "id": "anthropic-claude-haiku-4-5-20251001-thinking",
        "label": "anthropic/claude-haiku-4-5-20251001-thinking",
        "model": "anthropic/claude-haiku-4-5-20251001-thinking",
        "provider": "Anthropic",
        "harness": null,
        "effort": null,
        "score": 31.01,
        "costUsd": 0.602129,
        "uncertainty": {
          "lower": 30.446,
          "upper": 31.574,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-haiku-4-5-20251001-thinking"
          },
          {
            "label": "Standard error",
            "value": "±0.56 points"
          },
          {
            "label": "Mean latency",
            "value": "177 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "19.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "45.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "46.0%"
          },
          {
            "label": "Market Analysis",
            "value": "40.7%"
          },
          {
            "label": "Comparables",
            "value": "31.5%"
          },
          {
            "label": "Precedents",
            "value": "11.0%"
          },
          {
            "label": "Adjustments",
            "value": "30.5%"
          },
          {
            "label": "Earnings Analysis",
            "value": "26.7%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "42.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "5.1%"
          }
        ]
      },
      {
        "id": "anthropic-claude-opus-4-7",
        "label": "anthropic/claude-opus-4-7",
        "model": "anthropic/claude-opus-4-7",
        "provider": "Anthropic",
        "harness": null,
        "effort": "high",
        "score": 51.509,
        "costUsd": 4.032269,
        "uncertainty": {
          "lower": 51.019,
          "upper": 51.999,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-opus-4-7"
          },
          {
            "label": "Standard error",
            "value": "±0.49 points"
          },
          {
            "label": "Mean latency",
            "value": "360 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "38.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "65.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "70.1%"
          },
          {
            "label": "Market Analysis",
            "value": "62.7%"
          },
          {
            "label": "Comparables",
            "value": "45.6%"
          },
          {
            "label": "Precedents",
            "value": "21.5%"
          },
          {
            "label": "Adjustments",
            "value": "45.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "71.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "61.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "20.1%"
          }
        ]
      },
      {
        "id": "anthropic-claude-opus-4-8",
        "label": "anthropic/claude-opus-4-8",
        "model": "anthropic/claude-opus-4-8",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 53.918,
        "costUsd": 4.218538,
        "uncertainty": {
          "lower": 53.759,
          "upper": 54.077,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-opus-4-8"
          },
          {
            "label": "Standard error",
            "value": "±0.16 points"
          },
          {
            "label": "Mean latency",
            "value": "547 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "43.5%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "66.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "71.6%"
          },
          {
            "label": "Market Analysis",
            "value": "67.2%"
          },
          {
            "label": "Comparables",
            "value": "44.9%"
          },
          {
            "label": "Precedents",
            "value": "25.6%"
          },
          {
            "label": "Adjustments",
            "value": "48.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "72.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "65.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "23.3%"
          }
        ]
      },
      {
        "id": "anthropic-claude-opus-5",
        "label": "anthropic/claude-opus-5",
        "model": "anthropic/claude-opus-5",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 58.633,
        "costUsd": 5.124473,
        "uncertainty": {
          "lower": 58.556000000000004,
          "upper": 58.71,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-opus-5"
          },
          {
            "label": "Standard error",
            "value": "±0.08 points"
          },
          {
            "label": "Mean latency",
            "value": "598 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "47.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "75.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "78.5%"
          },
          {
            "label": "Market Analysis",
            "value": "74.2%"
          },
          {
            "label": "Comparables",
            "value": "47.4%"
          },
          {
            "label": "Precedents",
            "value": "25.9%"
          },
          {
            "label": "Adjustments",
            "value": "54.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "73.8%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "71.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "26.6%"
          }
        ]
      },
      {
        "id": "anthropic-claude-opus-5-5",
        "label": "anthropic/claude-opus-5-5",
        "model": "anthropic/claude-opus-5-5",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 58.587,
        "costUsd": 9.215734,
        "uncertainty": {
          "lower": 58.417,
          "upper": 58.757000000000005,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-opus-5-5"
          },
          {
            "label": "Standard error",
            "value": "±0.17 points"
          },
          {
            "label": "Mean latency",
            "value": "1,988 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "48.1%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "67.8%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "79.3%"
          },
          {
            "label": "Market Analysis",
            "value": "69.4%"
          },
          {
            "label": "Comparables",
            "value": "45.8%"
          },
          {
            "label": "Precedents",
            "value": "34.6%"
          },
          {
            "label": "Adjustments",
            "value": "54.5%"
          },
          {
            "label": "Earnings Analysis",
            "value": "78.0%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "71.0%"
          },
          {
            "label": "Financial Modeling",
            "value": "26.9%"
          }
        ]
      },
      {
        "id": "anthropic-claude-sonnet-4-6",
        "label": "anthropic/claude-sonnet-4-6",
        "model": "anthropic/claude-sonnet-4-6",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 51.035,
        "costUsd": 2.409559,
        "uncertainty": {
          "lower": 50.705999999999996,
          "upper": 51.364,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-sonnet-4-6"
          },
          {
            "label": "Standard error",
            "value": "±0.33 points"
          },
          {
            "label": "Mean latency",
            "value": "696 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "38.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "71.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "72.0%"
          },
          {
            "label": "Market Analysis",
            "value": "58.5%"
          },
          {
            "label": "Comparables",
            "value": "41.0%"
          },
          {
            "label": "Precedents",
            "value": "18.9%"
          },
          {
            "label": "Adjustments",
            "value": "48.9%"
          },
          {
            "label": "Earnings Analysis",
            "value": "65.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "65.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "17.6%"
          }
        ]
      },
      {
        "id": "anthropic-claude-sonnet-5",
        "label": "anthropic/claude-sonnet-5",
        "model": "anthropic/claude-sonnet-5",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 53.909,
        "costUsd": 0.750759,
        "uncertainty": {
          "lower": 53.391,
          "upper": 54.427,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-sonnet-5"
          },
          {
            "label": "Standard error",
            "value": "±0.52 points"
          },
          {
            "label": "Mean latency",
            "value": "792 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "42.1%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "64.7%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "74.3%"
          },
          {
            "label": "Market Analysis",
            "value": "64.1%"
          },
          {
            "label": "Comparables",
            "value": "45.8%"
          },
          {
            "label": "Precedents",
            "value": "28.8%"
          },
          {
            "label": "Adjustments",
            "value": "48.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "72.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "62.1%"
          },
          {
            "label": "Financial Modeling",
            "value": "24.2%"
          }
        ]
      },
      {
        "id": "anthropic-claude-sonnet-5-5",
        "label": "anthropic/claude-sonnet-5-5",
        "model": "anthropic/claude-sonnet-5-5",
        "provider": "Anthropic",
        "harness": null,
        "effort": "max",
        "score": 58.103,
        "costUsd": 6.552431,
        "uncertainty": {
          "lower": 57.43,
          "upper": 58.776,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "anthropic/claude-sonnet-5-5"
          },
          {
            "label": "Standard error",
            "value": "±0.67 points"
          },
          {
            "label": "Mean latency",
            "value": "1,903 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "47.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "67.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "79.4%"
          },
          {
            "label": "Market Analysis",
            "value": "71.4%"
          },
          {
            "label": "Comparables",
            "value": "47.1%"
          },
          {
            "label": "Precedents",
            "value": "31.7%"
          },
          {
            "label": "Adjustments",
            "value": "52.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "76.5%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "71.4%"
          },
          {
            "label": "Financial Modeling",
            "value": "25.5%"
          }
        ]
      },
      {
        "id": "cohere-command-a-plus-05-2026",
        "label": "cohere/command-a-plus-05-2026",
        "model": "cohere/command-a-plus-05-2026",
        "provider": "Cohere",
        "harness": null,
        "effort": null,
        "score": 9.044,
        "costUsd": 1.63003,
        "uncertainty": {
          "lower": 8.635,
          "upper": 9.453000000000001,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "cohere/command-a-plus-05-2026"
          },
          {
            "label": "Standard error",
            "value": "±0.41 points"
          },
          {
            "label": "Mean latency",
            "value": "567 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "2.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "22.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "8.9%"
          },
          {
            "label": "Market Analysis",
            "value": "12.0%"
          },
          {
            "label": "Comparables",
            "value": "16.5%"
          },
          {
            "label": "Precedents",
            "value": "2.4%"
          },
          {
            "label": "Adjustments",
            "value": "3.1%"
          },
          {
            "label": "Earnings Analysis",
            "value": "8.0%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "7.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "0.8%"
          }
        ]
      },
      {
        "id": "deepseek-deepseek-v4-1-flash",
        "label": "deepseek/deepseek-v4.1-flash",
        "model": "deepseek/deepseek-v4.1-flash",
        "provider": "DeepSeek",
        "harness": null,
        "effort": "high",
        "score": 53.481,
        "costUsd": 0.207465,
        "uncertainty": {
          "lower": 53.091,
          "upper": 53.871,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "deepseek/deepseek-v4.1-flash"
          },
          {
            "label": "Standard error",
            "value": "±0.39 points"
          },
          {
            "label": "Mean latency",
            "value": "364 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "41.1%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "67.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "69.8%"
          },
          {
            "label": "Market Analysis",
            "value": "63.4%"
          },
          {
            "label": "Comparables",
            "value": "46.1%"
          },
          {
            "label": "Precedents",
            "value": "28.2%"
          },
          {
            "label": "Adjustments",
            "value": "49.2%"
          },
          {
            "label": "Earnings Analysis",
            "value": "72.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "61.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "23.1%"
          }
        ]
      },
      {
        "id": "deepseek-deepseek-v4-flash-0731",
        "label": "deepseek/deepseek-v4-flash-0731",
        "model": "deepseek/deepseek-v4-flash-0731",
        "provider": "DeepSeek",
        "harness": null,
        "effort": "high",
        "score": 49.517,
        "costUsd": 0.276154,
        "uncertainty": {
          "lower": 49.052,
          "upper": 49.982000000000006,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "deepseek/deepseek-v4-flash-0731"
          },
          {
            "label": "Standard error",
            "value": "±0.47 points"
          },
          {
            "label": "Mean latency",
            "value": "490 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "36.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "60.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "64.0%"
          },
          {
            "label": "Market Analysis",
            "value": "55.1%"
          },
          {
            "label": "Comparables",
            "value": "41.2%"
          },
          {
            "label": "Precedents",
            "value": "24.1%"
          },
          {
            "label": "Adjustments",
            "value": "47.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "69.8%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "63.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "19.8%"
          }
        ]
      },
      {
        "id": "deepseek-deepseek-v4-pro",
        "label": "deepseek/deepseek-v4-pro",
        "model": "deepseek/deepseek-v4-pro",
        "provider": "DeepSeek",
        "harness": null,
        "effort": "max",
        "score": 44.083,
        "costUsd": 0.879086,
        "uncertainty": {
          "lower": 43.43,
          "upper": 44.736,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "deepseek/deepseek-v4-pro"
          },
          {
            "label": "Standard error",
            "value": "±0.65 points"
          },
          {
            "label": "Mean latency",
            "value": "1,526 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "31.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "60.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "65.8%"
          },
          {
            "label": "Market Analysis",
            "value": "50.8%"
          },
          {
            "label": "Comparables",
            "value": "39.6%"
          },
          {
            "label": "Precedents",
            "value": "15.6%"
          },
          {
            "label": "Adjustments",
            "value": "41.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "59.8%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "52.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "10.5%"
          }
        ]
      },
      {
        "id": "deepseek-deepseek-v4-pro-0813",
        "label": "deepseek/deepseek-v4-pro-0813",
        "model": "deepseek/deepseek-v4-pro-0813",
        "provider": "DeepSeek",
        "harness": null,
        "effort": "max",
        "score": 50.393,
        "costUsd": 0.880465,
        "uncertainty": {
          "lower": 50.144,
          "upper": 50.642,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "deepseek/deepseek-v4-pro-0813"
          },
          {
            "label": "Standard error",
            "value": "±0.25 points"
          },
          {
            "label": "Mean latency",
            "value": "975 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "38.5%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "67.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "66.9%"
          },
          {
            "label": "Market Analysis",
            "value": "60.3%"
          },
          {
            "label": "Comparables",
            "value": "46.2%"
          },
          {
            "label": "Precedents",
            "value": "20.9%"
          },
          {
            "label": "Adjustments",
            "value": "48.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "66.5%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "59.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "16.8%"
          }
        ]
      },
      {
        "id": "fireworks-nemotron-lightning-3p5-30b-a3b",
        "label": "fireworks/nemotron-lightning-3p5-30b-a3b",
        "model": "fireworks/nemotron-lightning-3p5-30b-a3b",
        "provider": "Fireworks AI",
        "harness": null,
        "effort": null,
        "score": 18.5,
        "costUsd": 0.028554,
        "uncertainty": {
          "lower": 17.618,
          "upper": 19.382,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "fireworks/nemotron-lightning-3p5-30b-a3b"
          },
          {
            "label": "Standard error",
            "value": "±0.88 points"
          },
          {
            "label": "Mean latency",
            "value": "540 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "10.3%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "33.0%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "28.5%"
          },
          {
            "label": "Market Analysis",
            "value": "21.4%"
          },
          {
            "label": "Comparables",
            "value": "24.3%"
          },
          {
            "label": "Precedents",
            "value": "4.5%"
          },
          {
            "label": "Adjustments",
            "value": "14.0%"
          },
          {
            "label": "Earnings Analysis",
            "value": "15.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "20.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "4.6%"
          }
        ]
      },
      {
        "id": "google-gemini-3-1-flash-lite-preview",
        "label": "google/gemini-3.1-flash-lite-preview",
        "model": "google/gemini-3.1-flash-lite-preview",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 29.988,
        "costUsd": 0.142482,
        "uncertainty": {
          "lower": 29.345,
          "upper": 30.631,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.1-flash-lite-preview"
          },
          {
            "label": "Standard error",
            "value": "±0.64 points"
          },
          {
            "label": "Mean latency",
            "value": "55 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "19.3%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "36.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "49.9%"
          },
          {
            "label": "Market Analysis",
            "value": "34.2%"
          },
          {
            "label": "Comparables",
            "value": "34.1%"
          },
          {
            "label": "Precedents",
            "value": "11.8%"
          },
          {
            "label": "Adjustments",
            "value": "31.0%"
          },
          {
            "label": "Earnings Analysis",
            "value": "31.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "37.4%"
          },
          {
            "label": "Financial Modeling",
            "value": "4.1%"
          }
        ]
      },
      {
        "id": "google-gemini-3-1-pro-preview",
        "label": "google/gemini-3.1-pro-preview",
        "model": "google/gemini-3.1-pro-preview",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 42.982,
        "costUsd": 1.591906,
        "uncertainty": {
          "lower": 41.775999999999996,
          "upper": 44.188,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.1-pro-preview"
          },
          {
            "label": "Standard error",
            "value": "±1.21 points"
          },
          {
            "label": "Mean latency",
            "value": "208 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "30.9%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "45.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "67.0%"
          },
          {
            "label": "Market Analysis",
            "value": "52.8%"
          },
          {
            "label": "Comparables",
            "value": "36.7%"
          },
          {
            "label": "Precedents",
            "value": "20.8%"
          },
          {
            "label": "Adjustments",
            "value": "38.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "64.7%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "46.2%"
          },
          {
            "label": "Financial Modeling",
            "value": "15.1%"
          }
        ]
      },
      {
        "id": "google-gemini-3-5-flash",
        "label": "google/gemini-3.5-flash",
        "model": "google/gemini-3.5-flash",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 57.861,
        "costUsd": 2.505488,
        "uncertainty": {
          "lower": 57.629999999999995,
          "upper": 58.092,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.5-flash"
          },
          {
            "label": "Standard error",
            "value": "±0.23 points"
          },
          {
            "label": "Mean latency",
            "value": "322 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "45.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "56.8%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "77.6%"
          },
          {
            "label": "Market Analysis",
            "value": "74.0%"
          },
          {
            "label": "Comparables",
            "value": "48.8%"
          },
          {
            "label": "Precedents",
            "value": "36.4%"
          },
          {
            "label": "Adjustments",
            "value": "54.9%"
          },
          {
            "label": "Earnings Analysis",
            "value": "79.0%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "63.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "29.4%"
          }
        ]
      },
      {
        "id": "google-gemini-3-5-flash-lite",
        "label": "google/gemini-3.5-flash-lite",
        "model": "google/gemini-3.5-flash-lite",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 47.442,
        "costUsd": 0.389575,
        "uncertainty": {
          "lower": 46.929,
          "upper": 47.955,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.5-flash-lite"
          },
          {
            "label": "Standard error",
            "value": "±0.51 points"
          },
          {
            "label": "Mean latency",
            "value": "143 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "35.3%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "51.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "66.1%"
          },
          {
            "label": "Market Analysis",
            "value": "57.0%"
          },
          {
            "label": "Comparables",
            "value": "45.2%"
          },
          {
            "label": "Precedents",
            "value": "26.0%"
          },
          {
            "label": "Adjustments",
            "value": "41.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "64.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "56.1%"
          },
          {
            "label": "Financial Modeling",
            "value": "19.3%"
          }
        ]
      },
      {
        "id": "google-gemini-3-6-flash",
        "label": "google/gemini-3.6-flash",
        "model": "google/gemini-3.6-flash",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 56.296,
        "costUsd": 1.402901,
        "uncertainty": {
          "lower": 56.113,
          "upper": 56.479,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.6-flash"
          },
          {
            "label": "Standard error",
            "value": "±0.18 points"
          },
          {
            "label": "Mean latency",
            "value": "225 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "44.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "60.5%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "81.8%"
          },
          {
            "label": "Market Analysis",
            "value": "69.8%"
          },
          {
            "label": "Comparables",
            "value": "47.8%"
          },
          {
            "label": "Precedents",
            "value": "30.8%"
          },
          {
            "label": "Adjustments",
            "value": "53.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "75.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "62.0%"
          },
          {
            "label": "Financial Modeling",
            "value": "25.1%"
          }
        ]
      },
      {
        "id": "google-gemini-3-7-flash",
        "label": "google/gemini-3.7-flash",
        "model": "google/gemini-3.7-flash",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 59.042,
        "costUsd": 1.477884,
        "uncertainty": {
          "lower": 58.77,
          "upper": 59.314,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.7-flash"
          },
          {
            "label": "Standard error",
            "value": "±0.27 points"
          },
          {
            "label": "Mean latency",
            "value": "181 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "47.5%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "65.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "81.8%"
          },
          {
            "label": "Market Analysis",
            "value": "74.5%"
          },
          {
            "label": "Comparables",
            "value": "50.3%"
          },
          {
            "label": "Precedents",
            "value": "33.8%"
          },
          {
            "label": "Adjustments",
            "value": "54.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "79.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "67.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "24.2%"
          }
        ]
      },
      {
        "id": "google-gemini-3-8-flash",
        "label": "google/gemini-3.8-flash",
        "model": "google/gemini-3.8-flash",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 61.435,
        "costUsd": 2.000457,
        "uncertainty": {
          "lower": 61.307,
          "upper": 61.563,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3.8-flash"
          },
          {
            "label": "Standard error",
            "value": "±0.13 points"
          },
          {
            "label": "Mean latency",
            "value": "201 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "49.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "68.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "80.9%"
          },
          {
            "label": "Market Analysis",
            "value": "78.5%"
          },
          {
            "label": "Comparables",
            "value": "52.0%"
          },
          {
            "label": "Precedents",
            "value": "36.1%"
          },
          {
            "label": "Adjustments",
            "value": "54.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "81.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "68.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "32.6%"
          }
        ]
      },
      {
        "id": "google-gemini-3-flash-preview",
        "label": "google/gemini-3-flash-preview",
        "model": "google/gemini-3-flash-preview",
        "provider": "Google",
        "harness": null,
        "effort": "high",
        "score": 42.551,
        "costUsd": 0.570657,
        "uncertainty": {
          "lower": 42.117000000000004,
          "upper": 42.985,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "google/gemini-3-flash-preview"
          },
          {
            "label": "Standard error",
            "value": "±0.43 points"
          },
          {
            "label": "Mean latency",
            "value": "247 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "30.2%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "44.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "64.5%"
          },
          {
            "label": "Market Analysis",
            "value": "59.0%"
          },
          {
            "label": "Comparables",
            "value": "38.6%"
          },
          {
            "label": "Precedents",
            "value": "18.1%"
          },
          {
            "label": "Adjustments",
            "value": "35.9%"
          },
          {
            "label": "Earnings Analysis",
            "value": "62.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "45.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "14.4%"
          }
        ]
      },
      {
        "id": "grok-grok-4-20-0309-reasoning",
        "label": "grok/grok-4.20-0309-reasoning",
        "model": "grok/grok-4.20-0309-reasoning",
        "provider": "SpaceXAI",
        "harness": null,
        "effort": null,
        "score": 28.492,
        "costUsd": 0.791809,
        "uncertainty": {
          "lower": 28.177,
          "upper": 28.807000000000002,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "grok/grok-4.20-0309-reasoning"
          },
          {
            "label": "Standard error",
            "value": "±0.32 points"
          },
          {
            "label": "Mean latency",
            "value": "351 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "17.5%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "45.9%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "37.2%"
          },
          {
            "label": "Market Analysis",
            "value": "33.3%"
          },
          {
            "label": "Comparables",
            "value": "30.2%"
          },
          {
            "label": "Precedents",
            "value": "15.5%"
          },
          {
            "label": "Adjustments",
            "value": "17.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "34.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "40.0%"
          },
          {
            "label": "Financial Modeling",
            "value": "2.4%"
          }
        ]
      },
      {
        "id": "grok-grok-4-3",
        "label": "grok/grok-4.3",
        "model": "grok/grok-4.3",
        "provider": "SpaceXAI",
        "harness": null,
        "effort": "high",
        "score": 37.728,
        "costUsd": 0.848345,
        "uncertainty": {
          "lower": 37.355000000000004,
          "upper": 38.101,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "grok/grok-4.3"
          },
          {
            "label": "Standard error",
            "value": "±0.37 points"
          },
          {
            "label": "Mean latency",
            "value": "615 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "26.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "53.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "51.8%"
          },
          {
            "label": "Market Analysis",
            "value": "50.2%"
          },
          {
            "label": "Comparables",
            "value": "35.9%"
          },
          {
            "label": "Precedents",
            "value": "15.3%"
          },
          {
            "label": "Adjustments",
            "value": "31.9%"
          },
          {
            "label": "Earnings Analysis",
            "value": "47.7%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "47.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "5.9%"
          }
        ]
      },
      {
        "id": "grok-grok-4-5",
        "label": "grok/grok-4.5",
        "model": "grok/grok-4.5",
        "provider": "SpaceXAI",
        "harness": null,
        "effort": "high",
        "score": 48.349,
        "costUsd": 1.156495,
        "uncertainty": {
          "lower": 47.891,
          "upper": 48.806999999999995,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "grok/grok-4.5"
          },
          {
            "label": "Standard error",
            "value": "±0.46 points"
          },
          {
            "label": "Mean latency",
            "value": "289 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "36.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "71.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "63.6%"
          },
          {
            "label": "Market Analysis",
            "value": "57.8%"
          },
          {
            "label": "Comparables",
            "value": "41.8%"
          },
          {
            "label": "Precedents",
            "value": "19.4%"
          },
          {
            "label": "Adjustments",
            "value": "38.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "70.8%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "56.4%"
          },
          {
            "label": "Financial Modeling",
            "value": "15.6%"
          }
        ]
      },
      {
        "id": "grok-grok-4-6",
        "label": "grok/grok-4.6",
        "model": "grok/grok-4.6",
        "provider": "SpaceXAI",
        "harness": null,
        "effort": "high",
        "score": 53.682,
        "costUsd": 1.657732,
        "uncertainty": {
          "lower": 53.012,
          "upper": 54.352000000000004,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "grok/grok-4.6"
          },
          {
            "label": "Standard error",
            "value": "±0.67 points"
          },
          {
            "label": "Mean latency",
            "value": "1,001 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "42.9%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "77.8%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "73.2%"
          },
          {
            "label": "Market Analysis",
            "value": "62.2%"
          },
          {
            "label": "Comparables",
            "value": "41.2%"
          },
          {
            "label": "Precedents",
            "value": "21.9%"
          },
          {
            "label": "Adjustments",
            "value": "49.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "73.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "64.4%"
          },
          {
            "label": "Financial Modeling",
            "value": "18.9%"
          }
        ]
      },
      {
        "id": "grok-grok-4-7",
        "label": "grok/grok-4.7",
        "model": "grok/grok-4.7",
        "provider": "SpaceXAI",
        "harness": null,
        "effort": "xhigh",
        "score": 52.251,
        "costUsd": 2.719136,
        "uncertainty": {
          "lower": 51.896,
          "upper": 52.605999999999995,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "grok/grok-4.7"
          },
          {
            "label": "Standard error",
            "value": "±0.35 points"
          },
          {
            "label": "Mean latency",
            "value": "933 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "42.1%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "68.7%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "68.6%"
          },
          {
            "label": "Market Analysis",
            "value": "61.8%"
          },
          {
            "label": "Comparables",
            "value": "42.2%"
          },
          {
            "label": "Precedents",
            "value": "25.9%"
          },
          {
            "label": "Adjustments",
            "value": "46.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "74.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "64.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "17.7%"
          }
        ]
      },
      {
        "id": "inception-mercury-2-5",
        "label": "inception/mercury-2.5",
        "model": "inception/mercury-2.5",
        "provider": "Inception",
        "harness": null,
        "effort": "high",
        "score": 18.556,
        "costUsd": 0.106441,
        "uncertainty": {
          "lower": 18.301000000000002,
          "upper": 18.811,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "inception/mercury-2.5"
          },
          {
            "label": "Standard error",
            "value": "±0.26 points"
          },
          {
            "label": "Mean latency",
            "value": "95 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "9.1%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "29.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "29.5%"
          },
          {
            "label": "Market Analysis",
            "value": "27.1%"
          },
          {
            "label": "Comparables",
            "value": "24.9%"
          },
          {
            "label": "Precedents",
            "value": "7.5%"
          },
          {
            "label": "Adjustments",
            "value": "12.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "15.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "18.0%"
          },
          {
            "label": "Financial Modeling",
            "value": "2.8%"
          }
        ]
      },
      {
        "id": "kimi-kimi-k2-5-thinking",
        "label": "kimi/kimi-k2.5-thinking",
        "model": "kimi/kimi-k2.5-thinking",
        "provider": "Moonshot AI",
        "harness": null,
        "effort": null,
        "score": 35.792,
        "costUsd": 0.294389,
        "uncertainty": {
          "lower": 33.803000000000004,
          "upper": 37.781,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "kimi/kimi-k2.5-thinking"
          },
          {
            "label": "Standard error",
            "value": "±1.99 points"
          },
          {
            "label": "Mean latency",
            "value": "752 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "23.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "53.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "54.4%"
          },
          {
            "label": "Market Analysis",
            "value": "42.9%"
          },
          {
            "label": "Comparables",
            "value": "32.1%"
          },
          {
            "label": "Precedents",
            "value": "14.6%"
          },
          {
            "label": "Adjustments",
            "value": "33.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "37.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "47.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "6.6%"
          }
        ]
      },
      {
        "id": "kimi-kimi-k2-6",
        "label": "kimi/kimi-k2.6",
        "model": "kimi/kimi-k2.6",
        "provider": "Moonshot AI",
        "harness": null,
        "effort": null,
        "score": 44.899,
        "costUsd": 1.141587,
        "uncertainty": {
          "lower": 44.166000000000004,
          "upper": 45.632,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "kimi/kimi-k2.6"
          },
          {
            "label": "Standard error",
            "value": "±0.73 points"
          },
          {
            "label": "Mean latency",
            "value": "1,630 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "32.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "57.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "65.1%"
          },
          {
            "label": "Market Analysis",
            "value": "53.1%"
          },
          {
            "label": "Comparables",
            "value": "41.1%"
          },
          {
            "label": "Precedents",
            "value": "19.5%"
          },
          {
            "label": "Adjustments",
            "value": "37.9%"
          },
          {
            "label": "Earnings Analysis",
            "value": "63.8%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "52.1%"
          },
          {
            "label": "Financial Modeling",
            "value": "14.2%"
          }
        ]
      },
      {
        "id": "kimi-kimi-k3",
        "label": "kimi/kimi-k3",
        "model": "kimi/kimi-k3",
        "provider": "Moonshot AI",
        "harness": null,
        "effort": null,
        "score": 54.36,
        "costUsd": 1.066994,
        "uncertainty": {
          "lower": 53.829,
          "upper": 54.891,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "kimi/kimi-k3"
          },
          {
            "label": "Standard error",
            "value": "±0.53 points"
          },
          {
            "label": "Mean latency",
            "value": "877 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "41.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "65.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "74.4%"
          },
          {
            "label": "Market Analysis",
            "value": "66.6%"
          },
          {
            "label": "Comparables",
            "value": "46.7%"
          },
          {
            "label": "Precedents",
            "value": "23.1%"
          },
          {
            "label": "Adjustments",
            "value": "51.5%"
          },
          {
            "label": "Earnings Analysis",
            "value": "73.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "65.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "23.0%"
          }
        ]
      },
      {
        "id": "meta-muse-spark-1-1",
        "label": "meta/muse_spark_1_1",
        "model": "meta/muse_spark_1_1",
        "provider": "Meta",
        "harness": null,
        "effort": "xhigh",
        "score": 57.207,
        "costUsd": 0.723391,
        "uncertainty": {
          "lower": 56.418,
          "upper": 57.996,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "meta/muse_spark_1_1"
          },
          {
            "label": "Standard error",
            "value": "±0.79 points"
          },
          {
            "label": "Mean latency",
            "value": "415 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "44.9%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "66.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "76.8%"
          },
          {
            "label": "Market Analysis",
            "value": "67.2%"
          },
          {
            "label": "Comparables",
            "value": "47.2%"
          },
          {
            "label": "Precedents",
            "value": "33.8%"
          },
          {
            "label": "Adjustments",
            "value": "49.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "76.2%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "63.4%"
          },
          {
            "label": "Financial Modeling",
            "value": "34.1%"
          }
        ]
      },
      {
        "id": "meta-muse-spark-1-2",
        "label": "meta/muse_spark_1_2",
        "model": "meta/muse_spark_1_2",
        "provider": "Meta",
        "harness": null,
        "effort": "xhigh",
        "score": 60.599,
        "costUsd": 0.76972,
        "uncertainty": {
          "lower": 60.31999999999999,
          "upper": 60.878,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "meta/muse_spark_1_2"
          },
          {
            "label": "Standard error",
            "value": "±0.28 points"
          },
          {
            "label": "Mean latency",
            "value": "304 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "50.9%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "77.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "78.4%"
          },
          {
            "label": "Market Analysis",
            "value": "66.2%"
          },
          {
            "label": "Comparables",
            "value": "50.2%"
          },
          {
            "label": "Precedents",
            "value": "35.4%"
          },
          {
            "label": "Adjustments",
            "value": "56.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "77.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "69.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "34.5%"
          }
        ]
      },
      {
        "id": "meta-muse-spark-1-3",
        "label": "meta/muse_spark_1_3",
        "model": "meta/muse_spark_1_3",
        "provider": "Meta",
        "harness": null,
        "effort": "xhigh",
        "score": 58.901,
        "costUsd": 0.741132,
        "uncertainty": {
          "lower": 58.457,
          "upper": 59.345000000000006,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "meta/muse_spark_1_3"
          },
          {
            "label": "Standard error",
            "value": "±0.44 points"
          },
          {
            "label": "Mean latency",
            "value": "342 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "48.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "77.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "76.8%"
          },
          {
            "label": "Market Analysis",
            "value": "65.4%"
          },
          {
            "label": "Comparables",
            "value": "47.2%"
          },
          {
            "label": "Precedents",
            "value": "33.1%"
          },
          {
            "label": "Adjustments",
            "value": "52.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "77.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "66.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "33.5%"
          }
        ]
      },
      {
        "id": "meta-muse-spark-1-3-max",
        "label": "meta/muse_spark_1_3_max",
        "model": "meta/muse_spark_1_3_max",
        "provider": "Meta",
        "harness": null,
        "effort": "max",
        "score": 59.958,
        "costUsd": 0.756512,
        "uncertainty": {
          "lower": 57.897999999999996,
          "upper": 62.018,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "meta/muse_spark_1_3_max"
          },
          {
            "label": "Standard error",
            "value": "±2.06 points"
          },
          {
            "label": "Mean latency",
            "value": "199 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "49.5%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "83.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "78.0%"
          },
          {
            "label": "Market Analysis",
            "value": "69.9%"
          },
          {
            "label": "Comparables",
            "value": "44.5%"
          },
          {
            "label": "Precedents",
            "value": "35.2%"
          },
          {
            "label": "Adjustments",
            "value": "52.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "77.2%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "70.1%"
          },
          {
            "label": "Financial Modeling",
            "value": "28.7%"
          }
        ]
      },
      {
        "id": "minimax-minimax-m2-7",
        "label": "minimax/MiniMax-M2.7",
        "model": "minimax/MiniMax-M2.7",
        "provider": "MiniMax",
        "harness": null,
        "effort": null,
        "score": 27.887,
        "costUsd": 0.18348,
        "uncertainty": {
          "lower": 27.379,
          "upper": 28.395,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "minimax/MiniMax-M2.7"
          },
          {
            "label": "Standard error",
            "value": "±0.51 points"
          },
          {
            "label": "Mean latency",
            "value": "804 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "17.1%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "42.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "43.0%"
          },
          {
            "label": "Market Analysis",
            "value": "33.4%"
          },
          {
            "label": "Comparables",
            "value": "28.4%"
          },
          {
            "label": "Precedents",
            "value": "11.9%"
          },
          {
            "label": "Adjustments",
            "value": "21.0%"
          },
          {
            "label": "Earnings Analysis",
            "value": "31.8%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "35.0%"
          },
          {
            "label": "Financial Modeling",
            "value": "4.1%"
          }
        ]
      },
      {
        "id": "minimax-minimax-m3",
        "label": "minimax/MiniMax-M3",
        "model": "minimax/MiniMax-M3",
        "provider": "MiniMax",
        "harness": null,
        "effort": null,
        "score": 48.269,
        "costUsd": 0.32345,
        "uncertainty": {
          "lower": 47.832,
          "upper": 48.705999999999996,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "minimax/MiniMax-M3"
          },
          {
            "label": "Standard error",
            "value": "±0.44 points"
          },
          {
            "label": "Mean latency",
            "value": "497 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "36.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "61.7%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "66.5%"
          },
          {
            "label": "Market Analysis",
            "value": "59.0%"
          },
          {
            "label": "Comparables",
            "value": "41.7%"
          },
          {
            "label": "Precedents",
            "value": "23.2%"
          },
          {
            "label": "Adjustments",
            "value": "42.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "66.2%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "59.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "14.0%"
          }
        ]
      },
      {
        "id": "mistralai-mistral-medium-3-5",
        "label": "mistralai/mistral-medium-3.5",
        "model": "mistralai/mistral-medium-3.5",
        "provider": "Mistral AI",
        "harness": null,
        "effort": "high",
        "score": 32.103,
        "costUsd": 1.908513,
        "uncertainty": {
          "lower": 31.136000000000003,
          "upper": 33.07,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "mistralai/mistral-medium-3.5"
          },
          {
            "label": "Standard error",
            "value": "±0.97 points"
          },
          {
            "label": "Mean latency",
            "value": "768 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "21.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "47.9%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "44.8%"
          },
          {
            "label": "Market Analysis",
            "value": "37.0%"
          },
          {
            "label": "Comparables",
            "value": "31.5%"
          },
          {
            "label": "Precedents",
            "value": "12.9%"
          },
          {
            "label": "Adjustments",
            "value": "27.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "42.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "40.2%"
          },
          {
            "label": "Financial Modeling",
            "value": "5.1%"
          }
        ]
      },
      {
        "id": "nvidia-nemotron-3-ultra-550b-a55b",
        "label": "nvidia/nemotron-3-ultra-550b-a55b",
        "model": "nvidia/nemotron-3-ultra-550b-a55b",
        "provider": "Nvidia",
        "harness": null,
        "effort": null,
        "score": 37.667,
        "costUsd": null,
        "uncertainty": {
          "lower": 37.518,
          "upper": 37.816,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "nvidia/nemotron-3-ultra-550b-a55b"
          },
          {
            "label": "Standard error",
            "value": "±0.15 points"
          },
          {
            "label": "Mean latency",
            "value": "254 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "24.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "58.5%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "55.8%"
          },
          {
            "label": "Market Analysis",
            "value": "41.3%"
          },
          {
            "label": "Comparables",
            "value": "37.2%"
          },
          {
            "label": "Precedents",
            "value": "12.8%"
          },
          {
            "label": "Adjustments",
            "value": "34.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "40.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "51.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "7.1%"
          }
        ]
      },
      {
        "id": "openai-gpt-5-4-mini-2026-03-17",
        "label": "openai/gpt-5.4-mini-2026-03-17",
        "model": "openai/gpt-5.4-mini-2026-03-17",
        "provider": "OpenAI",
        "harness": null,
        "effort": "xhigh",
        "score": 45.36,
        "costUsd": 1.201815,
        "uncertainty": {
          "lower": 44.913,
          "upper": 45.807,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-5.4-mini-2026-03-17"
          },
          {
            "label": "Standard error",
            "value": "±0.45 points"
          },
          {
            "label": "Mean latency",
            "value": "2,154 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "32.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "46.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "64.0%"
          },
          {
            "label": "Market Analysis",
            "value": "56.9%"
          },
          {
            "label": "Comparables",
            "value": "40.3%"
          },
          {
            "label": "Precedents",
            "value": "22.1%"
          },
          {
            "label": "Adjustments",
            "value": "45.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "65.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "48.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "19.6%"
          }
        ]
      },
      {
        "id": "openai-gpt-5-4-nano-2026-03-17",
        "label": "openai/gpt-5.4-nano-2026-03-17",
        "model": "openai/gpt-5.4-nano-2026-03-17",
        "provider": "OpenAI",
        "harness": null,
        "effort": "high",
        "score": 38.217,
        "costUsd": 0.15925,
        "uncertainty": {
          "lower": 37.032,
          "upper": 39.402,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-5.4-nano-2026-03-17"
          },
          {
            "label": "Standard error",
            "value": "±1.19 points"
          },
          {
            "label": "Mean latency",
            "value": "335 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "26.0%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "46.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "58.3%"
          },
          {
            "label": "Market Analysis",
            "value": "46.5%"
          },
          {
            "label": "Comparables",
            "value": "37.2%"
          },
          {
            "label": "Precedents",
            "value": "20.8%"
          },
          {
            "label": "Adjustments",
            "value": "33.0%"
          },
          {
            "label": "Earnings Analysis",
            "value": "45.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "42.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "13.5%"
          }
        ]
      },
      {
        "id": "openai-gpt-5-5",
        "label": "openai/gpt-5.5",
        "model": "openai/gpt-5.5",
        "provider": "OpenAI",
        "harness": null,
        "effort": "xhigh",
        "score": 51.76,
        "costUsd": 4.149702,
        "uncertainty": {
          "lower": 51.21,
          "upper": 52.309999999999995,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-5.5"
          },
          {
            "label": "Standard error",
            "value": "±0.55 points"
          },
          {
            "label": "Mean latency",
            "value": "662 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "39.6%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "65.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "73.7%"
          },
          {
            "label": "Market Analysis",
            "value": "60.3%"
          },
          {
            "label": "Comparables",
            "value": "43.7%"
          },
          {
            "label": "Precedents",
            "value": "21.9%"
          },
          {
            "label": "Adjustments",
            "value": "45.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "73.2%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "58.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "22.9%"
          }
        ]
      },
      {
        "id": "openai-gpt-5-6-luna",
        "label": "openai/gpt-5.6-luna",
        "model": "openai/gpt-5.6-luna",
        "provider": "OpenAI",
        "harness": null,
        "effort": "max",
        "score": 55.044,
        "costUsd": 0.279224,
        "uncertainty": {
          "lower": 54.735,
          "upper": 55.352999999999994,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-5.6-luna"
          },
          {
            "label": "Standard error",
            "value": "±0.31 points"
          },
          {
            "label": "Mean latency",
            "value": "772 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "43.3%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "66.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "75.2%"
          },
          {
            "label": "Market Analysis",
            "value": "64.9%"
          },
          {
            "label": "Comparables",
            "value": "48.3%"
          },
          {
            "label": "Precedents",
            "value": "29.1%"
          },
          {
            "label": "Adjustments",
            "value": "52.0%"
          },
          {
            "label": "Earnings Analysis",
            "value": "74.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "62.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "21.6%"
          }
        ]
      },
      {
        "id": "openai-gpt-5-6-sol",
        "label": "openai/gpt-5.6-sol",
        "model": "openai/gpt-5.6-sol",
        "provider": "OpenAI",
        "harness": null,
        "effort": "max",
        "score": 53.756,
        "costUsd": 1.253419,
        "uncertainty": {
          "lower": 52.910000000000004,
          "upper": 54.602,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-5.6-sol"
          },
          {
            "label": "Standard error",
            "value": "±0.85 points"
          },
          {
            "label": "Mean latency",
            "value": "1,165 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "41.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "64.9%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "75.6%"
          },
          {
            "label": "Market Analysis",
            "value": "64.2%"
          },
          {
            "label": "Comparables",
            "value": "45.3%"
          },
          {
            "label": "Precedents",
            "value": "26.2%"
          },
          {
            "label": "Adjustments",
            "value": "49.2%"
          },
          {
            "label": "Earnings Analysis",
            "value": "74.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "63.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "20.7%"
          }
        ]
      },
      {
        "id": "openai-gpt-5-6-terra",
        "label": "openai/gpt-5.6-terra",
        "model": "openai/gpt-5.6-terra",
        "provider": "OpenAI",
        "harness": null,
        "effort": "max",
        "score": 54.436,
        "costUsd": 3.629197,
        "uncertainty": {
          "lower": 52.365,
          "upper": 56.507,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-5.6-terra"
          },
          {
            "label": "Standard error",
            "value": "±2.07 points"
          },
          {
            "label": "Mean latency",
            "value": "1,450 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "42.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "67.8%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "72.7%"
          },
          {
            "label": "Market Analysis",
            "value": "60.6%"
          },
          {
            "label": "Comparables",
            "value": "47.0%"
          },
          {
            "label": "Precedents",
            "value": "24.8%"
          },
          {
            "label": "Adjustments",
            "value": "49.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "77.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "66.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "23.0%"
          }
        ]
      },
      {
        "id": "openai-gpt-6-astra",
        "label": "openai/gpt-6-astra",
        "model": "openai/gpt-6-astra",
        "provider": "OpenAI",
        "harness": null,
        "effort": "max",
        "score": 53.54,
        "costUsd": 6.81746,
        "uncertainty": {
          "lower": 51.461999999999996,
          "upper": 55.618,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-6-astra"
          },
          {
            "label": "Standard error",
            "value": "±2.08 points"
          },
          {
            "label": "Mean latency",
            "value": "693 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "40.3%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "68.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "78.8%"
          },
          {
            "label": "Market Analysis",
            "value": "65.5%"
          },
          {
            "label": "Comparables",
            "value": "37.8%"
          },
          {
            "label": "Precedents",
            "value": "30.3%"
          },
          {
            "label": "Adjustments",
            "value": "48.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "69.5%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "61.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "21.6%"
          }
        ]
      },
      {
        "id": "openai-gpt-6-luna",
        "label": "openai/gpt-6-luna",
        "model": "openai/gpt-6-luna",
        "provider": "OpenAI",
        "harness": null,
        "effort": "max",
        "score": 49.873,
        "costUsd": 0.124338,
        "uncertainty": {
          "lower": 49.641,
          "upper": 50.105,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-6-luna"
          },
          {
            "label": "Standard error",
            "value": "±0.23 points"
          },
          {
            "label": "Mean latency",
            "value": "898 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "38.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "54.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "70.1%"
          },
          {
            "label": "Market Analysis",
            "value": "53.3%"
          },
          {
            "label": "Comparables",
            "value": "39.8%"
          },
          {
            "label": "Precedents",
            "value": "27.4%"
          },
          {
            "label": "Adjustments",
            "value": "49.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "74.2%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "57.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "22.5%"
          }
        ]
      },
      {
        "id": "openai-gpt-6-sol",
        "label": "openai/gpt-6-sol",
        "model": "openai/gpt-6-sol",
        "provider": "OpenAI",
        "harness": null,
        "effort": "max",
        "score": 49.05,
        "costUsd": 2.122121,
        "uncertainty": {
          "lower": 48.47,
          "upper": 49.629999999999995,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "openai/gpt-6-sol"
          },
          {
            "label": "Standard error",
            "value": "±0.58 points"
          },
          {
            "label": "Mean latency",
            "value": "540 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "36.0%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "53.6%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "70.0%"
          },
          {
            "label": "Market Analysis",
            "value": "58.0%"
          },
          {
            "label": "Comparables",
            "value": "40.8%"
          },
          {
            "label": "Precedents",
            "value": "28.5%"
          },
          {
            "label": "Adjustments",
            "value": "43.2%"
          },
          {
            "label": "Earnings Analysis",
            "value": "72.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "55.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "19.3%"
          }
        ]
      },
      {
        "id": "poolside-laguna-m-1",
        "label": "poolside/laguna-m.1",
        "model": "poolside/laguna-m.1",
        "provider": "Poolside",
        "harness": null,
        "effort": null,
        "score": 25.026,
        "costUsd": 0.818192,
        "uncertainty": {
          "lower": 23.749,
          "upper": 26.303,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "poolside/laguna-m.1"
          },
          {
            "label": "Standard error",
            "value": "±1.28 points"
          },
          {
            "label": "Mean latency",
            "value": "1,223 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "14.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "36.5%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "39.3%"
          },
          {
            "label": "Market Analysis",
            "value": "35.6%"
          },
          {
            "label": "Comparables",
            "value": "28.0%"
          },
          {
            "label": "Precedents",
            "value": "11.1%"
          },
          {
            "label": "Adjustments",
            "value": "15.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "25.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "30.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "2.6%"
          }
        ]
      },
      {
        "id": "poolside-laguna-xs-2",
        "label": "poolside/laguna-xs.2",
        "model": "poolside/laguna-xs.2",
        "provider": "Poolside",
        "harness": null,
        "effort": null,
        "score": 15.601,
        "costUsd": 0.19216,
        "uncertainty": {
          "lower": 15.275,
          "upper": 15.927000000000001,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "poolside/laguna-xs.2"
          },
          {
            "label": "Standard error",
            "value": "±0.33 points"
          },
          {
            "label": "Mean latency",
            "value": "527 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "6.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "28.9%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "22.7%"
          },
          {
            "label": "Market Analysis",
            "value": "20.4%"
          },
          {
            "label": "Comparables",
            "value": "16.4%"
          },
          {
            "label": "Precedents",
            "value": "5.8%"
          },
          {
            "label": "Adjustments",
            "value": "9.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "15.3%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "18.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "2.6%"
          }
        ]
      },
      {
        "id": "tencent-hy4-preview",
        "label": "tencent/hy4-preview",
        "model": "tencent/hy4-preview",
        "provider": "Tencent",
        "harness": null,
        "effort": null,
        "score": 55.063,
        "costUsd": 0.5903,
        "uncertainty": {
          "lower": 54.755,
          "upper": 55.371,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "tencent/hy4-preview"
          },
          {
            "label": "Standard error",
            "value": "±0.31 points"
          },
          {
            "label": "Mean latency",
            "value": "1,425 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "44.0%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "69.4%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "75.5%"
          },
          {
            "label": "Market Analysis",
            "value": "62.1%"
          },
          {
            "label": "Comparables",
            "value": "44.4%"
          },
          {
            "label": "Precedents",
            "value": "30.6%"
          },
          {
            "label": "Adjustments",
            "value": "48.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "75.1%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "68.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "20.9%"
          }
        ]
      },
      {
        "id": "thinkingmachines-inkling",
        "label": "thinkingmachines/inkling",
        "model": "thinkingmachines/inkling",
        "provider": "Thinkingmachines",
        "harness": null,
        "effort": "0.99",
        "score": 46.597,
        "costUsd": 0.996264,
        "uncertainty": {
          "lower": 45.672000000000004,
          "upper": 47.522,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "thinkingmachines/inkling"
          },
          {
            "label": "Standard error",
            "value": "±0.93 points"
          },
          {
            "label": "Mean latency",
            "value": "1,082 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "33.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "62.9%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "64.2%"
          },
          {
            "label": "Market Analysis",
            "value": "56.6%"
          },
          {
            "label": "Comparables",
            "value": "42.8%"
          },
          {
            "label": "Precedents",
            "value": "24.8%"
          },
          {
            "label": "Adjustments",
            "value": "37.8%"
          },
          {
            "label": "Earnings Analysis",
            "value": "60.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "53.2%"
          },
          {
            "label": "Financial Modeling",
            "value": "16.7%"
          }
        ]
      },
      {
        "id": "thinkingmachines-inkling-small",
        "label": "thinkingmachines/inkling-small",
        "model": "thinkingmachines/inkling-small",
        "provider": "Thinkingmachines",
        "harness": null,
        "effort": "0.99",
        "score": 41.257,
        "costUsd": 0.230271,
        "uncertainty": {
          "lower": 40.425,
          "upper": 42.089,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "thinkingmachines/inkling-small"
          },
          {
            "label": "Standard error",
            "value": "±0.83 points"
          },
          {
            "label": "Mean latency",
            "value": "994 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "29.2%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "56.3%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "56.2%"
          },
          {
            "label": "Market Analysis",
            "value": "49.3%"
          },
          {
            "label": "Comparables",
            "value": "38.8%"
          },
          {
            "label": "Precedents",
            "value": "20.2%"
          },
          {
            "label": "Adjustments",
            "value": "34.0%"
          },
          {
            "label": "Earnings Analysis",
            "value": "55.4%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "50.8%"
          },
          {
            "label": "Financial Modeling",
            "value": "10.3%"
          }
        ]
      },
      {
        "id": "xiaomi-mimo-v2-5",
        "label": "xiaomi/mimo-v2.5",
        "model": "xiaomi/mimo-v2.5",
        "provider": "Xiaomi",
        "harness": null,
        "effort": null,
        "score": 36.728,
        "costUsd": 0.08693,
        "uncertainty": {
          "lower": 36.619,
          "upper": 36.837,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "xiaomi/mimo-v2.5"
          },
          {
            "label": "Standard error",
            "value": "±0.11 points"
          },
          {
            "label": "Mean latency",
            "value": "339 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "23.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "48.0%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "55.7%"
          },
          {
            "label": "Market Analysis",
            "value": "48.6%"
          },
          {
            "label": "Comparables",
            "value": "31.7%"
          },
          {
            "label": "Precedents",
            "value": "17.2%"
          },
          {
            "label": "Adjustments",
            "value": "31.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "45.0%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "47.3%"
          },
          {
            "label": "Financial Modeling",
            "value": "5.3%"
          }
        ]
      },
      {
        "id": "xiaomi-mimo-v2-5-pro",
        "label": "xiaomi/mimo-v2.5-pro",
        "model": "xiaomi/mimo-v2.5-pro",
        "provider": "Xiaomi",
        "harness": null,
        "effort": null,
        "score": 41.502,
        "costUsd": 0.206445,
        "uncertainty": {
          "lower": 40.309000000000005,
          "upper": 42.695,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "xiaomi/mimo-v2.5-pro"
          },
          {
            "label": "Standard error",
            "value": "±1.19 points"
          },
          {
            "label": "Mean latency",
            "value": "497 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "28.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "50.8%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "61.0%"
          },
          {
            "label": "Market Analysis",
            "value": "49.0%"
          },
          {
            "label": "Comparables",
            "value": "40.1%"
          },
          {
            "label": "Precedents",
            "value": "20.6%"
          },
          {
            "label": "Adjustments",
            "value": "34.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "54.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "53.1%"
          },
          {
            "label": "Financial Modeling",
            "value": "9.9%"
          }
        ]
      },
      {
        "id": "xiaomi-mimo-v2-6-flash",
        "label": "xiaomi/mimo-v2.6-flash",
        "model": "xiaomi/mimo-v2.6-flash",
        "provider": "Xiaomi",
        "harness": null,
        "effort": null,
        "score": 56.277,
        "costUsd": 0.071536,
        "uncertainty": {
          "lower": 55.815,
          "upper": 56.739000000000004,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "xiaomi/mimo-v2.6-flash"
          },
          {
            "label": "Standard error",
            "value": "±0.46 points"
          },
          {
            "label": "Mean latency",
            "value": "422 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "44.4%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "72.5%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "70.3%"
          },
          {
            "label": "Market Analysis",
            "value": "63.4%"
          },
          {
            "label": "Comparables",
            "value": "49.0%"
          },
          {
            "label": "Precedents",
            "value": "30.3%"
          },
          {
            "label": "Adjustments",
            "value": "51.4%"
          },
          {
            "label": "Earnings Analysis",
            "value": "74.5%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "70.9%"
          },
          {
            "label": "Financial Modeling",
            "value": "24.2%"
          }
        ]
      },
      {
        "id": "xiaomi-mimo-v2-6-pro",
        "label": "xiaomi/mimo-v2.6-pro",
        "model": "xiaomi/mimo-v2.6-pro",
        "provider": "Xiaomi",
        "harness": null,
        "effort": null,
        "score": 57.339,
        "costUsd": 0.198909,
        "uncertainty": {
          "lower": 56.765,
          "upper": 57.913,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "xiaomi/mimo-v2.6-pro"
          },
          {
            "label": "Standard error",
            "value": "±0.57 points"
          },
          {
            "label": "Mean latency",
            "value": "648 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "45.8%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "75.1%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "79.8%"
          },
          {
            "label": "Market Analysis",
            "value": "63.5%"
          },
          {
            "label": "Comparables",
            "value": "46.0%"
          },
          {
            "label": "Precedents",
            "value": "30.9%"
          },
          {
            "label": "Adjustments",
            "value": "51.6%"
          },
          {
            "label": "Earnings Analysis",
            "value": "77.7%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "66.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "24.8%"
          }
        ]
      },
      {
        "id": "zai-glm-5-1",
        "label": "zai/glm-5.1",
        "model": "zai/glm-5.1",
        "provider": "Zhipu AI",
        "harness": null,
        "effort": null,
        "score": 44.792,
        "costUsd": 0.618185,
        "uncertainty": {
          "lower": 44.186,
          "upper": 45.398,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "zai/glm-5.1"
          },
          {
            "label": "Standard error",
            "value": "±0.61 points"
          },
          {
            "label": "Mean latency",
            "value": "924 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "32.7%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "63.7%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "61.9%"
          },
          {
            "label": "Market Analysis",
            "value": "51.9%"
          },
          {
            "label": "Comparables",
            "value": "41.6%"
          },
          {
            "label": "Precedents",
            "value": "17.8%"
          },
          {
            "label": "Adjustments",
            "value": "43.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "57.0%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "52.7%"
          },
          {
            "label": "Financial Modeling",
            "value": "13.5%"
          }
        ]
      },
      {
        "id": "zai-glm-5-2",
        "label": "zai/glm-5.2",
        "model": "zai/glm-5.2",
        "provider": "Zhipu AI",
        "harness": null,
        "effort": null,
        "score": 49.699,
        "costUsd": 0.713981,
        "uncertainty": {
          "lower": 48.821,
          "upper": 50.577,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "zai/glm-5.2"
          },
          {
            "label": "Standard error",
            "value": "±0.88 points"
          },
          {
            "label": "Mean latency",
            "value": "473 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "38.0%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "68.7%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "65.5%"
          },
          {
            "label": "Market Analysis",
            "value": "61.5%"
          },
          {
            "label": "Comparables",
            "value": "44.8%"
          },
          {
            "label": "Precedents",
            "value": "19.4%"
          },
          {
            "label": "Adjustments",
            "value": "46.3%"
          },
          {
            "label": "Earnings Analysis",
            "value": "66.6%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "61.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "12.9%"
          }
        ]
      },
      {
        "id": "zai-glm-5-3",
        "label": "zai/glm-5.3",
        "model": "zai/glm-5.3",
        "provider": "Fireworks AI",
        "harness": null,
        "effort": "max",
        "score": 55.84,
        "costUsd": 1.072768,
        "uncertainty": {
          "lower": 53.774,
          "upper": 57.906000000000006,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "zai/glm-5.3"
          },
          {
            "label": "Standard error",
            "value": "±2.07 points"
          },
          {
            "label": "Mean latency",
            "value": "950 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "44.9%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "70.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "71.1%"
          },
          {
            "label": "Market Analysis",
            "value": "67.4%"
          },
          {
            "label": "Comparables",
            "value": "45.7%"
          },
          {
            "label": "Precedents",
            "value": "25.1%"
          },
          {
            "label": "Adjustments",
            "value": "52.7%"
          },
          {
            "label": "Earnings Analysis",
            "value": "78.7%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "69.6%"
          },
          {
            "label": "Financial Modeling",
            "value": "22.1%"
          }
        ]
      },
      {
        "id": "zai-glm-5-3-flash",
        "label": "zai/glm-5.3-flash",
        "model": "zai/glm-5.3-flash",
        "provider": "Fireworks AI",
        "harness": null,
        "effort": "max",
        "score": 57.85,
        "costUsd": 0.047625,
        "uncertainty": {
          "lower": 55.789,
          "upper": 59.911,
          "label": "±1 standard error"
        },
        "sourceUrl": "https://www.vals.ai/benchmarks/fabv2",
        "details": [
          {
            "label": "Publisher model id",
            "value": "zai/glm-5.3-flash"
          },
          {
            "label": "Standard error",
            "value": "±2.06 points"
          },
          {
            "label": "Mean latency",
            "value": "891 seconds per test"
          },
          {
            "label": "Evaluation mode",
            "value": "Agentic · many steps allowed"
          },
          {
            "label": "All-Pass",
            "value": "46.3%"
          },
          {
            "label": "General Qualitative Analysis",
            "value": "76.2%"
          },
          {
            "label": "General Quantitative Analysis",
            "value": "76.4%"
          },
          {
            "label": "Market Analysis",
            "value": "70.4%"
          },
          {
            "label": "Comparables",
            "value": "45.9%"
          },
          {
            "label": "Precedents",
            "value": "28.6%"
          },
          {
            "label": "Adjustments",
            "value": "53.2%"
          },
          {
            "label": "Earnings Analysis",
            "value": "72.9%"
          },
          {
            "label": "Disclosure Analysis",
            "value": "71.5%"
          },
          {
            "label": "Financial Modeling",
            "value": "25.4%"
          }
        ]
      }
    ]
  }
}
