Rubric10-Semantic Evaluation Report

36.0/50.0
72.0% Overall Score

Element Scores

Element None: None
4/5 (0%)
Persistent Identifier (DOI, RRID, or URI) 1/1
Fields:
Rationale: id: https://doi.org/10.18130/V3/DXWOS5
Dataset Title and Description Completeness 1/1
Fields:
Rationale: title: Cell Maps for Artificial Intelligence (CM4AI); description: 23-line comprehensive description including mission, data types, methods, and outputs
Keywords or Tags for Searchability 1/1
Fields:
Rationale: keywords: 25 keywords including Cell Maps, AI-Ready Data, Bridge2AI, specific cell lines, techniques (AP-MS, SEC-MS), and standards (FAIR, RO-Crate)
Landing Page and Resources (page, hierarchical resources) 1/1
Fields:
Rationale: page: https://www.cm4ai.org
Hierarchical Structure (parent datasets, relationships) 0/1
Fields:
Rationale: No parent_datasets or related_datasets fields present
Element None: None
3/5 (0%)
Access Policy and IP Restrictions Defined 1/1
Fields:
Rationale: license_and_use_terms: Comprehensive CC BY-NC-SA 4.0 description with attribution requirements, commercial use restrictions, Data Access Committee oversight
Regulatory Compliance and Confidentiality Classification 0/1
Fields:
Rationale: No regulatory_restrictions, confidentiality_level, hipaa_compliant, other_compliance, or governance_committee_contact fields present
Download URL or Platform Link Available 0/1
Fields:
Rationale: No download_url field present; only DOI and page URL
Distribution Formats and File Types Specified 1/1
Fields:
Rationale: distribution_formats: 5 formats listed (RO-Crate with provenance, MassIVE, NCBI SRA, NDEx, Dataverse) with descriptions and access_urls
Related Datasets and External Resources Linked 1/1
Fields:
Rationale: external_resources: 12 resources including project website, NIH RePORTER, Dataverse DOIs, bioRxiv publication, FAIRSCAPE, IMP, NDEx, repositories
Element None: None
2/5 (0%)
License Terms Allow Reuse 1/1
Fields:
Rationale: license_and_use_terms: CC BY-NC-SA 4.0 with clear reuse terms (non-commercial, attribution, share-alike)
Data Formats Are Standardized (encoding, format) 0/1
Fields:
Rationale: No format or encoding fields present
Schema or Ontology Conformance Stated 0/1
Fields:
Rationale: No conforms_to or conforms_to_schema fields present
Variable Metadata with Identifiers Defined 0/1
Fields:
Rationale: No variables field present
Use Guidance Provided (intended, prohibited uses) 1/1
Fields:
Rationale: intended_uses: 6 uses including AI/ML training, VNN development, genotype-phenotype mapping; discouraged_uses: 3 uses including clinical decision-making without validation
Element None: None
3/5 (0%)
IRB or Ethics Review and Data Protection Impact 1/1
Fields:
Rationale: human_subject_research: Ethics Module (Vardit Ravitsky, Jean-Christophe Bélisle-Pipon), Data Access Committee (Jillian Parker), Bridge2AI Ethics Working Group participation
Deidentification Method Described 1/1
Fields:
Rationale: human_subject_research: 'de-identified as they cannot be matched, with current knowledge, to a human subject'; sensitive_elements: 'De-identified commercial cell lines'
Privacy Protections and Re-identification Risk Assessment 0/1
Fields:
Rationale: No participant_privacy or reidentification_risk fields present
Informed Consent Obtained from Participants 0/1
Fields:
Rationale: No informed_consent field present
Vulnerable Populations and Compensation Documented 1/1
Fields:
Rationale: human_subject_research.special_populations: MDA-MB-468 derived from 51-year-old black female (de-identified); KOLF2.1J from healthy male Northern European donor (de-identified)
Element None: None
4/5 (0%)
Cohort or Subpopulations Characteristics Described 1/1
Fields:
Rationale: subpopulations: 7 subpopulations including MDA-MB-468 (untreated, paclitaxel, vorinostat), KOLF2.1J (undifferentiated, neurons, NPCs, cardiomyocytes)
Number of Instances or Samples Reported 1/1
Fields:
Rationale: instances: 4 instances (MDA-MB-468 cell line, KOLF2.1J iPSCs, 100 chromatin regulators, 100 metabolic enzymes) with detailed descriptions
Variable-Level Metadata, Tabular Flag, and Data Splits 0/1
Fields:
Rationale: No variables, is_tabular, is_data_split, or is_subpopulation fields present
Data Topics or Conditions Represented 1/1
Fields:
Rationale: instances and keywords describe cancer (triple negative breast cancer), neuropsychiatric disorders, cardiac disorders
Data Quality, Anomalies, and Missing Data Documented 1/1
Fields:
Rationale: sampling_strategies: Disease-relevant cell line selection with rationale; preprocessing includes QC for imaging and mass spec data
Element None: None
4/5 (0%)
Dataset Version Number Provided 0/1
Fields:
Rationale: No version field present
Version Access Methods Documented 1/1
Fields:
Rationale: Updates section describes multiple DOIs for different versions: doi:10.18130/V3/B35XWX (V1.4), doi:10.18130/V3/F3TD5R (V2.1)
Change Descriptions and Errata Provided 1/1
Fields:
Rationale: updates: Comprehensive update plan with quarterly releases, specific content additions per version (perturb-seq, SEC-MS, IF images, RGB corrections, metadata fixes)
Update Schedule or Frequency Indicated 1/1
Fields:
Rationale: updates.frequency: 'Quarterly updates through November 2026; long-term preservation thereafter'
Provenance, Source Derivation, and Raw Data Sources 1/1
Fields:
Rationale: Comprehensive provenance: FAIRSCAPE RO-Crate with provenance graphs, source cell lines from ATCC/HipSci, processing via MuSIC pipeline, data deposited to repositories
Element None: None
5/5 (0%)
Motivation or Purpose for Dataset Creation 1/1
Fields:
Rationale: purposes: 3 purposes including AI-ready cell maps, interpretable genotype-phenotype learning, AI-readiness standards
Primary Research Objectives or Tasks 1/1
Fields:
Rationale: tasks: 4 tasks including MuSIC pipeline integration, VNN development, disease-relevant characterization, ethical AI framework
Funding Sources and Mechanisms Listed 1/1
Fields:
Rationale: funders: NIH Common Fund Bridge2AI Program with grant details, additional Frederick Thomas Fund
Grant IDs or Award Numbers Present 1/1
Fields:
Rationale: funders: Grant numbers 1OT2OD032742-01, 5U54HG012513-02; Opportunity Number OTA-21-008; FY 2025 funding amounts
Creators and Acknowledgements Documented 1/1
Fields:
Rationale: creators: 15 creators including Trey Ideker (Contact PI), co-investigators with affiliations and roles
Element None: None
5/5 (0%)
Collection Mechanisms and Settings Described 1/1
Fields:
Rationale: collection_mechanisms: 4 mechanisms (IF imaging, AP-MS, SEC-MS, CRISPR screens) with detailed protocols and instruments
Data Acquisition Methods Listed 1/1
Fields:
Rationale: acquisition_methods: 4 methods (confocal microscopy, mass spectrometry, single-cell RNA-seq, MuSIC pipeline) with processing details
Preprocessing, Cleaning, Labeling, and Annotation Quality 1/1
Fields:
Rationale: preprocessing_strategies: 5 strategies (deep learning embedding, hierarchical community detection, cell map annotation, QC for imaging, QC for mass spec); cleaning_strategies: 3 strategies (FAIRSCAPE packaging, data standard mapping, integrative modeling)
Software and Tools Documented 1/1
Fields:
Rationale: Tools mentioned: MuSIC pipeline, node2vec, Human Protein Atlas model, Cytoscape, FAIRSCAPE-CLI, contrastive deep learning; no software_and_tools field
External Standards, Resources, and Imputation Protocols 1/1
Fields:
Rationale: external_resources: 12 resources; cleaning_strategies mention GO, Reactome, PDB, AlphaFold, Schema.org, EVI ontologies
Element None: None
3/5 (0%)
Known Limitations Documented 1/1
Fields:
Rationale: discouraged_uses describe limitations: interim/beta release, incomplete data, temporary pre-publication embargo, incomplete overlap of protein interrogation sets
Biases Categorized Using Standard Taxonomy (RAI-aligned) 0/1
Fields:
Rationale: No known_biases field present
Data Anomalies and Quality Issues Noted 0/1
Fields:
Rationale: No anomalies field present
Sensitive Content and Warnings Provided 1/1
Fields:
Rationale: sensitive_elements: Cell line origin metadata discussion, de-identification status, ethical sourcing; no content_warnings field
Ethical Review and Social Impact Analysis 1/1
Fields:
Rationale: human_subject_research includes ethics team and Data Access Committee; addressing_gaps describes transformative potential; no future_use_impacts field
Element None: None
3/5 (0%)
Dataset Published on a Recognized Platform 0/1
Fields:
Rationale: Multiple platforms mentioned (Dataverse, MassIVE, NCBI SRA, NDEx) but no publisher field
Citation and DOI for Cross-referencing 1/1
Fields:
Rationale: Primary DOI: 10.18130/V3/DXWOS5; Version DOIs: 10.18130/V3/B35XWX, 10.18130/V3/F3TD5R; bioRxiv DOI: 10.1101/2024.05.21.589311; no citation field
Community Standards or Schema Conformance 1/1
Fields:
Rationale: Conforms to FAIR principles, RO-Crate standard, Schema.org, EVI Evidence Graph Ontology, GO, Reactome; no conforms_to field
Outreach Materials and Documentation Links 1/1
Fields:
Rationale: external_resources: 12 resources including website, documentation (FAIRSCAPE tutorial), repositories, publications
Related Datasets with Typed Relationships 0/1
Fields:
Rationale: No related_datasets field present

Semantic Analysis

Recommendations

Recommendations

Add version field with current version number (e.g., '2.1')
Add publisher field identifying primary hosting platform (e.g., 'University of Virginia LibraData (Dataverse)')
Add citation field with formatted citation string following DataCite/BibTeX format
Add conforms_to field listing standards (FAIR, RO-Crate, Schema.org, EVI, GO, Reactome)
Add software_and_tools field listing MuSIC, node2vec, HPA model, Cytoscape, FAIRSCAPE-CLI
Add format and encoding fields for primary data formats
Add regulatory_restrictions, confidentiality_level, and governance_committee_contact fields
Add known_biases field with selection bias and population bias documentation
Add future_use_impacts field with social impact analysis
Add download_url for direct data access paths
Consider restructuring subsets as hierarchical resources with parent_datasets relationships
Add variables field for key measurements (protein abundances, image features, perturbation effects)
Add is_tabular flags for tabular data components
Document anomalies field if data quality issues identified during QC
Generated on 2026-01-13 16:57:40 using Bridge2AI Data Sheets Schema