Research & Papers

DaDaDa dataset: 16K data products benchmark pricing for marketplaces

Researchers release first standardized pricing dataset from 9 major data marketplaces

Deep Dive

Researchers from multiple institutions introduce DaDaDa, the first dataset specifically designed for data product pricing in data marketplaces. Traditional pricing approaches—cost, income, and sales comparison—fall short for data: cost fails because replication has near-zero marginal cost, income fails due to unpredictable revenue. Only sales comparison remains viable, but lacks standardized benchmarks. DaDaDa fills this gap by aggregating metadata for 16,147 data products from nine major marketplaces worldwide, including AWS Marketplace, Databricks, and Datarade.

The dataset enables training of machine learning models for pricing, classification, and retrieval of data products. Experiments demonstrate its effectiveness in establishing price benchmarks, and a retrieval prototype shows practical utility. By providing a standardized reference, DaDaDa helps marketplace operators, data sellers, and buyers arrive at fairer, more transparent pricing. The dataset and associated code are publicly available, encouraging further research and industry adoption. This work directly addresses a critical bottleneck in the growing data economy.

Key Points
  • First dataset for data product pricing: 16,147 products from 9 marketplaces (AWS Marketplace, Databricks, Datarade)
  • Addresses fundamental pricing challenges: zero marginal cost and unpredictable revenue make traditional methods invalid
  • Enables multiple tasks: pricing model training, product classification, and retrieval for real-world data marketplaces

Why It Matters

Standardizes data valuation, enabling fairer transactions and accelerating the $300B+ data marketplace industry

📬 Get the top 10 AI stories daily