Rubric10-Semantic Evaluation Report

42.0/50.0
84.0% Overall Score

Element Scores

Element None: None
4/5 (0%)
Persistent Identifier (DOI, RRID, or URI) 1/1
Fields:
Rationale: id: https://fairhub.io/datasets/2
Dataset Title and Description Completeness 1/1
Fields:
Rationale: title: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI); description: 500+ character comprehensive multi-paragraph description covering cohort size (4,000 individuals), multimodal data types, multi-site design, diabetes focus, sampling strategy, FAIR compliance
Keywords or Tags for Searchability 1/1
Fields:
Rationale: keywords: 22 entries including 'Type 2 Diabetes Mellitus', 'T2DM', 'AI-READI', 'Machine Learning', 'Artificial Intelligence', 'multimodal dataset', 'harmonized data', 'multi-site study', 'salutogenesis', 'FAIR principles', 'retinal imaging', 'continuous glucose monitoring', 'wearable devices', 'biorepository', 'biospecimens', 'triple-balanced sampling', 'health equity', 'Bridge2AI', 'cross-sectional study'
Landing Page and Resources (page, hierarchical resources) 1/1
Fields:
Rationale: page: https://fairhub.io/datasets/2; external_resources: 9 entries including project website, documentation, dataset repository, funding, publications
Hierarchical Structure (parent datasets, relationships) 0/1
Fields:
Rationale: No parent_datasets or related_datasets fields found
Element None: None
4/5 (0%)
Access Policy and IP Restrictions Defined 1/1
Fields:
Rationale: license_and_use_terms: Creative Commons Attribution Non-Commercial (CC BY-NC 4.0) with detailed description and license_terms list covering proper citation, non-commercial use, derivative works permitted with attribution, changes must be indicated, controlled access requires separate agreement; ip_restrictions field not present
Regulatory Restrictions and Confidentiality Level Specified 0/1
Fields:
Rationale: No regulatory_restrictions or confidentiality_level fields found; controlled access mentioned for sensitive data (genomic, 5-digit zip code, medical records) in subsets
Download URL or Platform Link Available 1/1
Fields:
Rationale: distribution_formats entries include access_urls: https://fairhub.io/datasets/2 for multiple formats; page field also points to same URL
Distribution Formats and File Types Specified 1/1
Fields:
Rationale: distribution_formats: 4 entries (DICOM for imaging, CSV for tabular/time-series, mHealth standard for wearable data, REDCap data dictionary)
Related Datasets and External Resources Linked 1/1
Fields:
Rationale: external_resources: 9 entries including project website (aireadi.org), documentation (docs.aireadi.org), FAIRhub dataset page, Bridge2AI program, NIH RePORTER, data sharing info, Zenodo archive, BMJ Open protocol publication, Nature Metabolism commentary; related_datasets field not present
Element None: None
4/5 (0%)
License Terms Allow Reuse 1/1
Fields:
Rationale: license_and_use_terms: CC BY-NC 4.0 explicitly permits distribution, remix, adaptation, building upon work non-commercially, derivative works on different terms with attribution
Data Formats Are Standardized (encoding, format) 1/1
Fields:
Rationale: distribution_formats specify DICOM (imaging), CSV (tabular), mHealth standard (wearable); preprocessing_strategies mention OMOP Common Data Model, DICOM, mHealth, RxNorm, ICD-10; format/encoding top-level fields not populated
Schema or Ontology Conformance Stated 1/1
Fields:
Rationale: preprocessing_strategies mention OMOP Common Data Model, DICOM format, mHealth standard, RxNorm codes, ICD-10 codes; conforms_to or conforms_to_schema fields not present
Variable Metadata with Identifiers Defined 0/1
Fields:
Rationale: No variables field (as schema list) populated; data dictionaries mentioned (REDCap data dictionary) in distribution_formats but not structured variable-level metadata
Use Guidance Provided (intended, prohibited uses) 1/1
Fields:
Rationale: intended_uses: 5 entries (AI/ML model development for T2DM, multi-modal T2DM research, health equity research, biomarker discovery, model dataset for AI-ready standards); discouraged_uses: 3 entries (uses during ongoing enrollment, clinical decision-making without validation, re-identification attempts); prohibited_uses field not present
Element None: None
5/5 (0%)
IRB or Ethics Review Documented 1/1
Fields:
Rationale: human_subject_research: University of Washington IRB approval number STUDY00016228 with reliance agreements from UAB and UCSD IRBs; written informed consent; bioethics guidance integrated; Community Advisory Board with 11 diverse members; ethical_reviews as list field not populated
Deidentification Method Described 1/1
Fields:
Rationale: subsets describe de-identified public access dataset vs controlled access with sensitive identifiers (5-digit zip code, race, ethnicity, sex, genetic data, medical records); is_deidentified field not populated
Privacy Protections Beyond Deidentification 1/1
Fields:
Rationale: Two-tier access (public vs controlled with DUA); biospecimen access policies under development; Data Access Committee established; finite biospecimen distribution; participant_privacy field not populated
Informed Consent Obtained from Participants 1/1
Fields:
Rationale: human_subject_research: 'Written informed consent provided by all participants'
Vulnerable Populations and Compensation Documented 1/1
Fields:
Rationale: human_subject_research mentions recruitment targeted to racial/ethnic minorities disproportionately affected by T2DM (Asian, Black, Hispanic populations); tribal consultation planned for Native American cohort; vulnerable_populations and participant_compensation fields not populated
Element None: None
5/5 (0%)
Cohort or Subpopulations Characteristics Described 1/1
Fields:
Rationale: subpopulations: 8 entries (4 race/ethnicity groups: Asian, Black, Hispanic, White; 4 diabetes severity groups: no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled) each with target ~1,000 participants (25% of sample)
Number of Instances or Samples Reported 1/1
Fields:
Rationale: instances: Target enrollment 4,000 individuals aged 40+ with and without T2DM, triple-balanced by race/ethnicity, diabetes severity, and biological sex; enrollment began July 18, 2023 and continues until November 30, 2026
Variable-Level Metadata and Tabular Flag 1/1
Fields:
Rationale: REDCap data dictionary mentioned in distribution_formats; multimodal data domains described (survey, clinical measurements, retinal imaging, visual function, lab tests, ECG, cognitive function, peripheral neuropathy, glucose monitoring, physical activity, environmental monitoring, biospecimens); variables and is_tabular fields not populated
Data Topics or Conditions Represented 1/1
Fields:
Rationale: instances and purposes describe T2DM focus with four diabetes severity levels (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled); salutogenesis pathway research; multi-domain data (survey, clinical, imaging, wearable, environmental, biospecimen)
Data Quality Issues and Anomalies Documented 1/1
Fields:
Rationale: sampling_strategies: triple-balanced recruitment with is_sample: true, is_random: false, is_representative: false; wave-based recruitment with monitoring and adjustment; anomalies field not populated
Element None: None
5/5 (0%)
Dataset Version Number Provided 1/1
Fields:
Rationale: updates mentions 'Pilot data released May 2024; all data through July 31, 2024 released November 2024' and 'v1.0.0 data through July 31, 2024 released November 2024', 'v2.0.0 and v3.0.0 released with additional participants'; version field not populated
Version Access Methods Documented 1/1
Fields:
Rationale: updates mentions 'Version-specific documentation maintained for each release' at https://docs.aireadi.org/; access via FAIRhub at https://fairhub.io/datasets/2; version_access field not populated
Change Descriptions and Errata Provided 1/1
Fields:
Rationale: updates.update_details: 'Periodic data releases as enrollment continues', 'Pilot data released May 2024', 'v1.0.0 data through July 31, 2024 released November 2024', 'v2.0.0 and v3.0.0 released with additional participants', 'Final dataset expected after completion of 4,000 participant enrollment by November 2026', 'Dataset versioning implemented', 'Version-specific documentation at https://docs.aireadi.org/'; errata field not populated
Update Schedule or Frequency Indicated 1/1
Fields:
Rationale: updates.frequency: 'Periodic releases with ongoing enrollment; final release planned for late 2026'
Provenance and Source Derivation Documented 1/1
Fields:
Rationale: D4D header comments: 'Source: data/preprocessed/concatenated/AI_READI_preprocessed.txt (245K, 13 source files)'; collection_mechanisms describe data sources (EHR screening, multi-site collection, wearable monitoring, biobanking); was_derived_from and release_notes fields not populated
Element None: None
5/5 (0%)
Motivation or Purpose for Dataset Creation 1/1
Fields:
Rationale: purposes: 3 detailed entries (Understanding T2DM salutogenesis with hypothesis-agnostic harmonized multi-domain dataset for AI/ML; Establishing AI/ML data standards and best practices with FAIR adherence and bioethics guidance; Addressing demographic inequities through triple-balanced recruitment)
Primary Research Objectives or Tasks 1/1
Fields:
Rationale: tasks: 3 entries (Enable multi-domain AI/ML analyses for T2DM across survey, clinical, imaging, wearable, environmental, biospecimen domains; Develop unbiased AI/ML models through balanced data collection; Study T2DM disease trajectories and salutogenesis pathways via pseudotime manifold analysis)
Funding Sources and Mechanisms Listed 1/1
Fields:
Rationale: funders: NIH Common Fund Bridge2AI Program with detailed description including administering agency (NIH Office of the Director) and additional support sources (P30DK035816, UL1TR003096, Research to Prevent Blindness)
Grant IDs or Award Numbers Present 1/1
Fields:
Rationale: funders description includes 'National Institutes of Health grant OT2OD032644', 'Total funding in 2022: $5,026,499', 'Opportunity Number: OTA-21-008', 'Project dates: September 1, 2022 to August 31, 2025', additional grants 'P30DK035816 (Nutrition and Obesity Research Center), UL1TR003096'
Creators and Acknowledgements Documented 1/1
Fields:
Rationale: creators: 20 entries including Contact PI/Project Leader (Aaron Lee, University of Washington), Principal Investigator (Cynthia Owsley, UAB), and 18 Co-Investigators with affiliations and departments
Element None: None
5/5 (0%)
Collection Mechanisms and Settings Described 1/1
Fields:
Rationale: collection_mechanisms: 5 entries (In-person data collection visits at 3 sites with 2.5-4 hour multi-domain protocol; EHR screening for source population with ICD-10 codes; Wave-based recruitment with balance monitoring; Home-based wearable monitoring for 10 days; Biospecimen collection and biobanking at UAB CCTS)
Data Acquisition Methods Listed 1/1
Fields:
Rationale: acquisition_methods: 12 entries covering survey/questionnaire data (REDCap with multiple instruments), physical measurements (anthropometry, vital signs), retinal imaging (multi-device protocol with 7 instruments), visual function testing (acuity, contrast sensitivity, autorefraction), clinical lab testing (CBC, plasma, serum, whole blood, urine at CLIA-certified and central labs), ECG (12-lead Philips), cognitive function (MoCA), peripheral neuropathy (monofilament), continuous glucose monitoring (Dexcom G6), physical activity monitoring (Garmin VivoSmart 5), environmental monitoring (custom sensor), biospecimen collection (blood, urine, processing, storage)
Preprocessing, Cleaning, and Labeling Strategies 1/1
Fields:
Rationale: preprocessing_strategies: 5 entries (Data standardization and harmonization across 3 sites with REDCap, SOPs, training; Image format conversion from proprietary to DICOM and .FIT to mHealth; Biospecimen processing with standardized and centralized protocols; Quality control with training certification, calibration, duplicate measurements, validation; Data mapping to OMOP CDM, DICOM, mHealth, RxNorm, ICD-10); cleaning_strategies: 1 entry (Multi-site harmonization with standardized protocols, equipment, training, REDCap, FAIR compliance); labeling_strategies field not populated
Software and Tools Documented 1/1
Fields:
Rationale: Acquisition methods mention specific instruments and software: REDCap (data management, surveys), M&S Technology Electronic Visual Acuity tester, Topcon KR 800 (autorefraction), Philips Pagewriter TC30, MoCA Duo Application (iPad), Dexcom G6, Garmin VivoSmart 5, custom environmental sensor; Imaging devices: Aurora IQ (Optomed), EIDON (iCare), Spectralis HRA OCT (Heidelberg), Maestro2 3D OCT-1 (Topcon), Triton DRI OCT (Topcon), Cirrus 5000 (Zeiss), FLIO (Heidelberg); software_and_tools field not populated
External Standards and Resources Referenced 1/1
Fields:
Rationale: external_resources: 9 entries (project website, documentation, FAIRhub, Bridge2AI, NIH RePORTER, data sharing, Zenodo, BMJ Open, Nature Metabolism); preprocessing mentions standards (OMOP CDM, DICOM, mHealth, RxNorm, ICD-10); FAIR principles in keywords and description; conforms_to field not populated
Element None: None
2/5 (0%)
Known Limitations Documented 0/1
Fields:
Rationale: No known_limitations field; discouraged_uses mentions 'ongoing enrollment may not have achieved balanced distribution' and 'pilot data releases and periodic updates limitation', but no systematic limitations documentation
Systematic Biases Identified and Described 0/1
Fields:
Rationale: No known_biases field; addressing_gaps mentions historical demographic inequities in T2DM research (lack of diversity) as gap being addressed, but no systematic bias documentation for this dataset
Data Anomalies and Quality Issues Noted 0/1
Fields:
Rationale: No anomalies field found; quality control measures documented in preprocessing_strategies but no anomaly reporting
Sensitive Content and Warnings Provided 1/1
Fields:
Rationale: sensitive_elements: 3 entries (Genetic and biospecimen data with genomic DNA, blood derivatives, urine, PBMCs, PAXgene RNA in controlled access; Geographic and demographic identifiers with 5-digit zip code, race, ethnicity, sex in controlled access; Medical history and records with past health records, medications, traffic/accident reports in controlled access); content_warnings field not populated
Ethical Review Details Including Conflicts 1/1
Fields:
Rationale: human_subject_research documents IRB approval (UW STUDY00016228, UAB and UCSD reliance agreements), written informed consent, bioethics integration, Community Advisory Board (11 diverse members), ethical and equitable practices; ethical_reviews as list field not populated
Element None: None
3/5 (0%)
Dataset Published on a Recognized Platform 1/1
Fields:
Rationale: FAIRhub distribution documented in id, page, distribution_formats, external_resources; description mentions FAIRhub and FAIR principles; maintainer_details mention data coordination at University of Washington; publisher field not populated
Citation and DOI for Cross-referencing 0/1
Fields:
Rationale: id: https://fairhub.io/datasets/2 (not a DOI); external_resources include DOI links for publications (10.1136/bmjopen-2024-097449, 10.1038/s42255-024-01165-x) and Zenodo (10.5281/zenodo.10642459) but no dataset DOI; citation field not populated
Community Standards or Schema Conformance 1/1
Fields:
Rationale: FAIR principles in keywords and description; preprocessing mentions OMOP CDM, DICOM, mHealth, RxNorm, ICD-10; description mentions 'AI-ready' and adherence to FAIR principles; conforms_to field not populated
Outreach Materials and Documentation Links 1/1
Fields:
Rationale: external_resources: 9 entries (AI-READI Project Website https://aireadi.org/, Documentation https://docs.aireadi.org/, FAIRhub Dataset Landing Page https://fairhub.io/datasets/2, Bridge2AI Program https://bridge2ai.org/, NIH RePORTER https://reporter.nih.gov/project-details/10471118, Data Sharing https://aireadi.org/goals/data-sharing, Zenodo https://doi.org/10.5281/zenodo.10642459, BMJ Open protocol, Nature Metabolism commentary); page field present
Related Datasets with Typed Relationships 0/1
Fields:
Rationale: No related_datasets field found; external_resources includes Bridge2AI parent program but no explicit links to sibling datasets (VOICE, CM4AI, CHORUS)

Semantic Analysis

Recommendations

Recommendations

Add known_limitations field documenting: (1) Sampling limitations: triple-balanced targeted recruitment (not random sampling), non-representative by design (sampling_strategies: is_representative: false), (2) Generalizability constraints: English-speaking only, age 40+ only, three US sites only (Birmingham AL, San Diego CA, Seattle WA), exclusion of pregnant individuals and type 1 diabetes, (3) Ongoing enrollment limitations: periodic data releases during enrollment may not have achieved balanced distribution across all groups (as noted in discouraged_uses), (4) Design limitations: cross-sectional study limits longitudinal disease progression analysis despite pseudotime manifold analysis goals
Register DOI for dataset to enable persistent cross-referencing independent of FAIRhub platform; update id and doi fields accordingly
Add known_biases field documenting potential biases: (1) Selection bias from targeted recruitment (not random), (2) Language bias (English-speaking only excludes non-English speakers in diverse populations), (3) Age bias (40+ only excludes younger onset T2DM), (4) Health system bias (recruitment from EHR at 3 academic medical centers may not represent those without regular healthcare access), (5) Participation bias (volunteers for 2.5-4 hour visit plus 10-day monitoring may differ from general population)
Populate version field with current version number (e.g., 'v3.0.0' based on updates narrative)
Add publisher field: 'FAIRhub / California Medical Innovations Institute'
Create formatted citation field for standard reference in publications including creators, title, version, year, FAIRhub, and identifier
Add conforms_to field listing standards URIs: FAIR principles, OMOP Common Data Model, DICOM standard, mHealth standard, RxNorm, ICD-10
Populate variables field with structured variable metadata (extract from REDCap data dictionary descriptions for major domains: demographics, diabetes history, retinal imaging, lab results, vital signs, cognitive assessment, etc.)
Add is_tabular field: true for survey/clinical data; false or mixed for overall multimodal dataset
Add format and encoding fields for top-level dataset characteristics (multimodal with DICOM/CSV/mHealth mix)
Create is_deidentified class instance documenting two-tier model: public dataset de-identified (identifiers removed), controlled access dataset with sensitive identifiers (5-digit zip, race/ethnicity details, sex, genomic data, medical records)
Add participant_privacy list with privacy protection measures: (1) Two-tier access model (public de-identified, controlled with DUA), (2) Data Access Committee oversight, (3) Biospecimen access policies under development, (4) NIH data sharing policy compliance
Add informed_consent list entry with consent type (written informed consent) and process details (IRB-approved forms, all participants consented for data collection and sharing)
Add vulnerable_populations entries: (1) Racial/ethnic minority populations (Asian, Black, Hispanic) disproportionately affected by T2DM with targeted recruitment, (2) Planned tribal consultation for Native American cohort participation
Document participant_compensation if applicable (stipends, reimbursement for visit time, wearable device retention, etc.)
Create ethical_reviews list entry with IRB details: University of Washington STUDY00016228 (lead IRB), reliance agreements from UAB and UCSD IRBs, approval dates, Community Advisory Board composition and role
Add related_datasets entries linking to other Bridge2AI flagship datasets (VOICE, CM4AI, CHORUS) with typed relationships (part_of Bridge2AI program, sibling_dataset)
Add software_and_tools list extracting from acquisition and preprocessing narratives: REDCap (data management), imaging device software (Heidelberg, Topcon, Zeiss, iCare, Optomed platforms), clinical instruments (Philips ECG, MoCA Duo, Dexcom G6, Garmin Connect), analysis tools for OMOP mapping and DICOM conversion
Populate regulatory_restrictions documenting controlled access requirements for genetic data, medical records, and identifiable information; reference HIPAA applicability
Add confidentiality_level enum value based on two-tier model: public data (low confidentiality), controlled access data (high confidentiality with genetic/medical records)
Add prohibited_uses field distinguishing from discouraged_uses: (1) Commercial use prohibited for public CC BY-NC dataset, (2) Re-identification attempts prohibited (already in discouraged_uses but could be elevated), (3) Use outside data use agreement terms for controlled access data
Create version_access class documenting versioning mechanism: FAIRhub platform with version-specific documentation at docs.aireadi.org, DOI-based access (once DOI registered), version history in release notes
Add RRID if available for additional identifier support (biorepository, clinical sites, instruments)
Add anomalies field if data quality issues encountered during collection/processing (e.g., equipment failures, protocol deviations, batch effects across sites)
Document errata as issues are discovered in released versions (corrections to variables, data quality issues, protocol deviations)
Add content_warnings if any: (1) Medical imaging may contain incidental findings, (2) Genetic data sensitivity, (3) Health condition disclosure implications
Populate download_url with direct FAIRhub download link or access request URL
Add labeling_strategies if supervised labels added (e.g., diabetic retinopathy grading, disease severity classifications beyond participant-reported)
Document was_derived_from for source datasets if applicable (EHR data sources, biospecimen sources)
Add release_notes for version-specific changes beyond what's in updates field
Generated on 2026-01-13 16:57:40 using Bridge2AI Data Sheets Schema