Breast Cancer Wisconsin · Ace Data Cloud

Wisconsin Breast Cancer Diagnostic Dataset:
Medical AI's Classic Benchmark

UCI classic medical dataset, containing 569 samples and 30 real-valued features extracted from fine needle aspiration (FNA) images for the classification of malignant and benign breast tumors—standard starting point for medical artificial intelligence research.

Wisconsin Breast Cancer Diagnostic Dataset
ZIP format · 50 KB CC BY 4.0 License UCI Machine Learning Classic Dataset
📊
569
Number of Samples
📐
30
Number of Features
🔬
2
Number of Classes (Malignant/Benign)
📦
50KB
Data Size

Dataset Highlights

The Wisconsin Breast Cancer Diagnostic Dataset is one of the most popular benchmark datasets in the field of medical AI.

🏥

Medical Diagnosis

Real clinical data on breast tumor diagnoses, sourced from fine needle aspiration biopsy cases at the University of Wisconsin Hospital, with genuine medical research value.

📈

High-Dimensional Features

30 precise features extracted from FNA images, covering the mean, standard deviation, and maximum values of 10 metrics including the radius, texture, perimeter, and area of the cell nucleus.

🎯

Binary Classification

Classification task of malignant (Malignant) versus benign (Benign), with a clear objective, making it an ideal dataset for evaluating binary classification algorithms.

🏆

UCI Classic

One of the most influential classic datasets in the field of machine learning, widely cited and used in countless papers, tutorials, and courses around the world.

✨

No Missing Values

The data is complete and clean, requiring no complex preprocessing or missing value imputation, suitable for quick experiments and algorithm comparisons.

🔍

Interpretability

The meaning of features is clear, with each feature having a distinct physical significance, making it very suitable for research on interpretability in medical AI and feature importance analysis.

Applicable Scenarios

From disease diagnosis to model interpretation - common uses of the Wisconsin breast cancer dataset

🩺

Disease Diagnosis Classification

Train models such as SVM, random forests, and logistic regression to achieve automatic classification of breast tumors as malignant/benign

🔎

Feature Selection

Utilize 30-dimensional features for feature importance ranking, dimensionality reduction analysis, and redundant feature selection research

💡

Model Interpretability

Use methods like SHAP and LIME to explain model predictions, promoting the trustworthy application of medical AI

🎓

Medical AI Education

As a standard teaching dataset for medical artificial intelligence courses, helping students understand clinical data modeling

Data Preview

Sample examples from the Wisconsin breast cancer diagnostic dataset

CSV
id,diagnosis,radius_mean,texture_mean,perimeter_mean,area_mean,smoothness_mean
842302,M,17.99,10.38,122.80,1001.0,0.11840
842517,M,20.57,17.77,132.90,1326.0,0.08474
84300903,M,19.69,21.25,130.00,1203.0,0.10960
84348301,M,11.42,20.38,77.58,386.1,0.14250
84358402,M,20.29,14.34,135.10,1297.0,0.10030
id Sample ID diagnosis Diagnosis Result radius_mean Mean Radius texture_mean Mean Texture perimeter_mean Mean Perimeter area_mean Mean Area smoothness_mean Mean Smoothness

3 Steps to Get Started Quickly

From browsing to usage, just a few minutes

01

Browse the Dataset

View detailed descriptions, field definitions, and data previews of the Wisconsin Breast Cancer dataset on the Ace Data Cloud platform.

02

Download ZIP File

One-click download of a 50 KB ZIP file to your local machine, no registration, no payment, get it immediately.

03

Load and Use

Load the data with Python and scikit-learn, start training classification models or performing interpretability analysis.

Python
import pandas as pd
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
from sklearn.svm import SVC
from sklearn.metrics import classification_report
# Load data
df = pd.read_csv("breast-cancer-wisconsin.csv")
# Features and labels
X = df.drop(columns=["id", "diagnosis"])
y = df["diagnosis"]
# Standardize features
scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)
# Split into training and testing sets
X_train, X_test, y_train, y_test = train_test_split(
    X_scaled, y, test_size=0.3, random_state=42
)
# Train SVM classifier
clf = SVC(kernel="rbf", random_state=42)
clf.fit(X_train, y_train)
# Evaluate model
y_pred = clf.predict(X_test)
print(classification_report(y_test, y_pred, target_names=["Benign (B)", "Malignant (M)"]))

Support Medical AI Research

The Wisconsin Breast Cancer Diagnostic Dataset is a classic benchmark for medical AI research. Download for free and start exploring immediately.