Cohort or Subpopulations Characteristics Described
1/1
Fields:
Rationale: subpopulations: 8 entries (4 race/ethnicity groups: Asian, Black, Hispanic, White; 4 diabetes severity groups: no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled) each with target ~1,000 participants (25% of sample)
Number of Instances or Samples Reported
1/1
Fields:
Rationale: instances: Target enrollment 4,000 individuals aged 40+ with and without T2DM, triple-balanced by race/ethnicity, diabetes severity, and biological sex; enrollment began July 18, 2023 and continues until November 30, 2026
Variable-Level Metadata and Tabular Flag
1/1
Fields:
Rationale: REDCap data dictionary mentioned in distribution_formats; multimodal data domains described (survey, clinical measurements, retinal imaging, visual function, lab tests, ECG, cognitive function, peripheral neuropathy, glucose monitoring, physical activity, environmental monitoring, biospecimens); variables and is_tabular fields not populated
Data Topics or Conditions Represented
1/1
Fields:
Rationale: instances and purposes describe T2DM focus with four diabetes severity levels (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled); salutogenesis pathway research; multi-domain data (survey, clinical, imaging, wearable, environmental, biospecimen)
Data Quality Issues and Anomalies Documented
1/1
Fields:
Rationale: sampling_strategies: triple-balanced recruitment with is_sample: true, is_random: false, is_representative: false; wave-based recruitment with monitoring and adjustment; anomalies field not populated
Collection Mechanisms and Settings Described
1/1
Fields:
Rationale: collection_mechanisms: 5 entries (In-person data collection visits at 3 sites with 2.5-4 hour multi-domain protocol; EHR screening for source population with ICD-10 codes; Wave-based recruitment with balance monitoring; Home-based wearable monitoring for 10 days; Biospecimen collection and biobanking at UAB CCTS)
Data Acquisition Methods Listed
1/1
Fields:
Rationale: acquisition_methods: 12 entries covering survey/questionnaire data (REDCap with multiple instruments), physical measurements (anthropometry, vital signs), retinal imaging (multi-device protocol with 7 instruments), visual function testing (acuity, contrast sensitivity, autorefraction), clinical lab testing (CBC, plasma, serum, whole blood, urine at CLIA-certified and central labs), ECG (12-lead Philips), cognitive function (MoCA), peripheral neuropathy (monofilament), continuous glucose monitoring (Dexcom G6), physical activity monitoring (Garmin VivoSmart 5), environmental monitoring (custom sensor), biospecimen collection (blood, urine, processing, storage)
Preprocessing, Cleaning, and Labeling Strategies
1/1
Fields:
Rationale: preprocessing_strategies: 5 entries (Data standardization and harmonization across 3 sites with REDCap, SOPs, training; Image format conversion from proprietary to DICOM and .FIT to mHealth; Biospecimen processing with standardized and centralized protocols; Quality control with training certification, calibration, duplicate measurements, validation; Data mapping to OMOP CDM, DICOM, mHealth, RxNorm, ICD-10); cleaning_strategies: 1 entry (Multi-site harmonization with standardized protocols, equipment, training, REDCap, FAIR compliance); labeling_strategies field not populated
Software and Tools Documented
1/1
Fields:
Rationale: Acquisition methods mention specific instruments and software: REDCap (data management, surveys), M&S Technology Electronic Visual Acuity tester, Topcon KR 800 (autorefraction), Philips Pagewriter TC30, MoCA Duo Application (iPad), Dexcom G6, Garmin VivoSmart 5, custom environmental sensor; Imaging devices: Aurora IQ (Optomed), EIDON (iCare), Spectralis HRA OCT (Heidelberg), Maestro2 3D OCT-1 (Topcon), Triton DRI OCT (Topcon), Cirrus 5000 (Zeiss), FLIO (Heidelberg); software_and_tools field not populated
External Standards and Resources Referenced
1/1
Fields:
Rationale: external_resources: 9 entries (project website, documentation, FAIRhub, Bridge2AI, NIH RePORTER, data sharing, Zenodo, BMJ Open, Nature Metabolism); preprocessing mentions standards (OMOP CDM, DICOM, mHealth, RxNorm, ICD-10); FAIR principles in keywords and description; conforms_to field not populated
Recommendations
Add known_limitations field documenting: (1) Sampling limitations: triple-balanced targeted recruitment (not random sampling), non-representative by design (sampling_strategies: is_representative: false), (2) Generalizability constraints: English-speaking only, age 40+ only, three US sites only (Birmingham AL, San Diego CA, Seattle WA), exclusion of pregnant individuals and type 1 diabetes, (3) Ongoing enrollment limitations: periodic data releases during enrollment may not have achieved balanced distribution across all groups (as noted in discouraged_uses), (4) Design limitations: cross-sectional study limits longitudinal disease progression analysis despite pseudotime manifold analysis goals
Register DOI for dataset to enable persistent cross-referencing independent of FAIRhub platform; update id and doi fields accordingly
Add known_biases field documenting potential biases: (1) Selection bias from targeted recruitment (not random), (2) Language bias (English-speaking only excludes non-English speakers in diverse populations), (3) Age bias (40+ only excludes younger onset T2DM), (4) Health system bias (recruitment from EHR at 3 academic medical centers may not represent those without regular healthcare access), (5) Participation bias (volunteers for 2.5-4 hour visit plus 10-day monitoring may differ from general population)
Populate version field with current version number (e.g., 'v3.0.0' based on updates narrative)
Add publisher field: 'FAIRhub / California Medical Innovations Institute'
Create formatted citation field for standard reference in publications including creators, title, version, year, FAIRhub, and identifier
Add conforms_to field listing standards URIs: FAIR principles, OMOP Common Data Model, DICOM standard, mHealth standard, RxNorm, ICD-10
Populate variables field with structured variable metadata (extract from REDCap data dictionary descriptions for major domains: demographics, diabetes history, retinal imaging, lab results, vital signs, cognitive assessment, etc.)
Add is_tabular field: true for survey/clinical data; false or mixed for overall multimodal dataset
Add format and encoding fields for top-level dataset characteristics (multimodal with DICOM/CSV/mHealth mix)
Create is_deidentified class instance documenting two-tier model: public dataset de-identified (identifiers removed), controlled access dataset with sensitive identifiers (5-digit zip, race/ethnicity details, sex, genomic data, medical records)
Add participant_privacy list with privacy protection measures: (1) Two-tier access model (public de-identified, controlled with DUA), (2) Data Access Committee oversight, (3) Biospecimen access policies under development, (4) NIH data sharing policy compliance
Add informed_consent list entry with consent type (written informed consent) and process details (IRB-approved forms, all participants consented for data collection and sharing)
Add vulnerable_populations entries: (1) Racial/ethnic minority populations (Asian, Black, Hispanic) disproportionately affected by T2DM with targeted recruitment, (2) Planned tribal consultation for Native American cohort participation
Document participant_compensation if applicable (stipends, reimbursement for visit time, wearable device retention, etc.)
Create ethical_reviews list entry with IRB details: University of Washington STUDY00016228 (lead IRB), reliance agreements from UAB and UCSD IRBs, approval dates, Community Advisory Board composition and role
Add related_datasets entries linking to other Bridge2AI flagship datasets (VOICE, CM4AI, CHORUS) with typed relationships (part_of Bridge2AI program, sibling_dataset)
Add software_and_tools list extracting from acquisition and preprocessing narratives: REDCap (data management), imaging device software (Heidelberg, Topcon, Zeiss, iCare, Optomed platforms), clinical instruments (Philips ECG, MoCA Duo, Dexcom G6, Garmin Connect), analysis tools for OMOP mapping and DICOM conversion
Populate regulatory_restrictions documenting controlled access requirements for genetic data, medical records, and identifiable information; reference HIPAA applicability
Add confidentiality_level enum value based on two-tier model: public data (low confidentiality), controlled access data (high confidentiality with genetic/medical records)
Add prohibited_uses field distinguishing from discouraged_uses: (1) Commercial use prohibited for public CC BY-NC dataset, (2) Re-identification attempts prohibited (already in discouraged_uses but could be elevated), (3) Use outside data use agreement terms for controlled access data
Create version_access class documenting versioning mechanism: FAIRhub platform with version-specific documentation at docs.aireadi.org, DOI-based access (once DOI registered), version history in release notes
Add RRID if available for additional identifier support (biorepository, clinical sites, instruments)
Add anomalies field if data quality issues encountered during collection/processing (e.g., equipment failures, protocol deviations, batch effects across sites)
Document errata as issues are discovered in released versions (corrections to variables, data quality issues, protocol deviations)
Add content_warnings if any: (1) Medical imaging may contain incidental findings, (2) Genetic data sensitivity, (3) Health condition disclosure implications
Populate download_url with direct FAIRhub download link or access request URL
Add labeling_strategies if supervised labels added (e.g., diabetic retinopathy grading, disease severity classifications beyond participant-reported)
Document was_derived_from for source datasets if applicable (EHR data sources, biospecimen sources)
Add release_notes for version-specific changes beyond what's in updates field
Generated on 2026-01-13 16:57:40 using Bridge2AI Data Sheets Schema