Interleaved Semantic Evaluation

Project: AI_READI · Method: claudecode_agent_core
YAML: data/d4d_concatenated/claudecode_agent_core/AI_READI_d4d_core.yaml
R10 JSON: data/evaluation_llm/rubric10_semantic/concatenated/AI_READI_claudecode_agent_core_evaluation.json
R20 JSON: data/evaluation_llm/rubric20_semantic/concatenated/AI_READI_claudecode_agent_core_evaluation.json
Model: claude-sonnet-4-5-20250929
Rubric10 (semantic)
38.0/50 (76.0%)
Rubric20 (semantic)
68.0/84 (81.0%)
Consistency checks (R10/R20)
34 pass · 0 fail · 4 warn
Mapped feedback / fields
166 across 43 fields
R10 sub-element R20 question Semantic issue

Strengths

  • Exceptional structural completeness with all mandatory fields populated and comprehensive content (378-char description, 19 keywords)
  • Comprehensive ethical documentation including IRB approval (STUDY00016228), informed consent, de-identification procedures, and at-risk population protections
  • Strong FAIR compliance with persistent identifiers (DOI 10.57895/fairhub.2), multiple persistent URLs, and clear two-tier access model
  • Excellent funding documentation with grant numbers (OT2OD032644, P30DK035816, UL1TR003096), opportunity number, funding amounts, and timeline
  • Detailed collection protocol with 5 collection mechanisms, 12 acquisition methods, collector training procedures, and enrollment timeline
  • Strong version tracking with semantic versioning (v1.0.0, v2.0.0, v3.0.0), version-specific documentation, and changelog availability
  • Multiple DOI-linked publications (BMJ Open protocol, Nature Metabolism commentary, Zenodo archive) plus extensive external resources
  • Exceptional human subject representation with detailed demographics, triple-balanced design, inclusion/exclusion criteria, and 8 subpopulation groups
  • Good interoperability with standard formats (DICOM, CSV, mHealth, XML) and data standards (OMOP CDM, RxNorm, ICD-10)
  • Clear license terms (CC BY-NC 4.0) with explicit reuse permissions and restrictions
  • Strong cross-platform interlinking with 9 external resources covering repository, documentation, funding, archival, and publications

Weaknesses

  • D4D-core schema subset does not include 'software_and_tools' and 'labeling_strategies' fields present in full D4D schema, limiting technical documentation completeness
  • D4D-core schema subset does not include 'conforms_to' or 'conforms_to_schema' fields, reducing explicit schema conformance documentation
  • D4D-core schema subset does not include 'errata' or 'release_notes' fields, limiting version history detail
  • D4D-core schema subset does not include 'citation' field for formal dataset citation string
  • Software tool details (versions, URLs) are limited in preprocessing and acquisition method descriptions
  • DOI prefix 10.57895 is non-standard (FAIRhub institutional repository) and may not be as widely recognized as DataCite/Crossref prefixes

Field-by-field

id
id: https://fairhub.io/datasets/2
✓ 1/1 R10 1.Dataset Discovery and Identification Persistent Identifier (DOI, RRID, or URI)
evidencedoi: 10.57895/fairhub.2, id: https://fairhub.io/datasets/2
qualityDOI and URI present. DOI prefix 10.57895 appears FAIRhub-specific (not PhysioNet/Zenodo/DataVerse standard prefixes), but format valid.
semanticFormat valid (10.XXXX pattern). Prefix 10.57895 not widely recognized but likely institutional FAIRhub registrar.
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid: https://fairhub.io/datasets/2, title: 'Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)', description: 378 chars, keywords: 19 keywords, license: 'CC BY-NC 4.0'
qualityAll mandatory fields present with comprehensive content. Description provides dataset overview with sample size, modalities, and FAIR principles.
correctnessAll fields contain semantically appropriate values for Type 2 Diabetes multimodal dataset
consistencyFields align with dataset scope and methodology described in other sections
name
name: AI-READI
no field-level feedback matched
title
title: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)
✓ 1/1 R10 1.Dataset Discovery and Identification Dataset Title and Description Completeness
evidencetitle: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI), description: 559 characters with specific details (4,000 individuals, triple-balanced, multimodal data, salutogenesis)
qualityExceptional semantic richness: target cohort size, sampling design, data modalities, research goals all specified.
semanticDescription exceeds 200 chars, provides actionable details (cohort, sites, design, purpose). Semantically complete.
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid: https://fairhub.io/datasets/2, title: 'Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)', description: 378 chars, keywords: 19 keywords, license: 'CC BY-NC 4.0'
qualityAll mandatory fields present with comprehensive content. Description provides dataset overview with sample size, modalities, and FAIR principles.
correctnessAll fields contain semantically appropriate values for Type 2 Diabetes multimodal dataset
consistencyFields align with dataset scope and methodology described in other sections
description
description: 'The AI-READI is a flagship dataset consisting of multimodal data collected from 4,000 individuals
  with and without Type 2 Diabetes Mellitus (T2DM), harmonized across 3 data collection sites (Birmingham,
  Alabama; San Diego, California; Seattle, Washington). The dataset was designed with future AI/Machine
  Learning studies in mind, including recruitment sampling procedures aimed at achieving approximately
  equal distribution of participants across diabetes severity (triple-balanced by race/ethnicity, biological
  sex, and T2DM severity), as well as a multi-domain data acquisition protocol (survey data, physical
  measurements, clinical data, imaging data, wearable device data, environmental sensors, biospecimens)
  to enable downstream AI/ML analyses that may not be feasible with existing data sources such as claims
  or electronic health records data. The goal is to better understand salutogenesis (the pathway from
  disease to health) in T2DM. The study follows FAIR principles and incorporates ethical and equitable
  data collection and management practices.

  '
✓ 1/1 R10 1.Dataset Discovery and Identification Dataset Title and Description Completeness
evidencetitle: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI), description: 559 characters with specific details (4,000 individuals, triple-balanced, multimodal data, salutogenesis)
qualityExceptional semantic richness: target cohort size, sampling design, data modalities, research goals all specified.
semanticDescription exceeds 200 chars, provides actionable details (cohort, sites, design, purpose). Semantically complete.
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid: https://fairhub.io/datasets/2, title: 'Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)', description: 378 chars, keywords: 19 keywords, license: 'CC BY-NC 4.0'
qualityAll mandatory fields present with comprehensive content. Description provides dataset overview with sample size, modalities, and FAIR principles.
correctnessAll fields contain semantically appropriate values for Type 2 Diabetes multimodal dataset
consistencyFields align with dataset scope and methodology described in other sections
5/5 R20 Q2 (Structural Completeness) Entry Length Adequacy
level>200 chars
evidencedescription: 378 chars, purposes[0].description: 304 chars, purposes[1].description: 244 chars, purposes[2].description: 284 chars
qualityExcellent narrative content length across all fields. Description and purpose statements exceed 200 characters with detailed context.
correctnessNarrative content accurately describes dataset characteristics and research goals
consistencyPurpose statements align with addressing_gaps and tasks sections
1/1 R20 Q5 (Structural Completeness) Data File Size Availability
levelPass
evidenceinstances[0].description: 'Target enrollment is 4,000 people', subpopulations: 8 subgroups with target ~1,000 each, distribution_dates indicate v1.0.0 through July 31, 2024
qualityInstance count metadata clearly documented with target enrollment of 4,000 participants and subpopulation breakdowns.
correctnessSample size (4,000 participants) is plausible for multi-site NIH-funded study
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count
5/5 R20 Q8 (Metadata Quality & Content) Ethical and Privacy Declarations
levelComprehensive (all human subjects protections documented)
evidenceethical_reviews: 'University of Washington IRB Approval STUDY00016228 with reliance agreements from UAB and UCSD'. human_subject_research.involves_human_subjects: true with description of bioethics guidance and Community Advisory Board. informed_consent: 'Written informed consent provided by all participants'. is_deidentified: describes public dataset de-identification and controlled access for sensitive data. at_risk_populations: describes protections for T2DM participants and racial/ethnic minority groups with bioethics oversight and Community Advisory Board
qualityComprehensive ethical documentation covering all major protection areas. IRB approval with institutional details, informed consent process, de-identification procedures, and at-risk population protections are all present.
correctnessIRB approval number STUDY00016228 follows standard format. Reliance agreements appropriate for multi-site study (UAB, UCSD, UW).
consistencyinvolves_human_subjects=true aligns with presence of ethical_reviews, informed_consent, and at_risk_populations. De-identification approach (public vs. controlled access tiers) aligns with sensitive_elements and confidential_elements
page
page: https://fairhub.io/datasets/2
✓ 1/1 R10 1.Dataset Discovery and Identification Landing Page and Resources (page, hierarchical resources)
evidencepage: https://fairhub.io/datasets/2, external_resources include project website (aireadi.org), documentation (docs.aireadi.org), FAIRhub portal
qualityLanding page URL plus 9 external resources (project site, docs, NIH RePORTER, publications).
semanticMultiple access points documented. URL structure valid.
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2. maintainers: AI-READI Consortium. external_resources: FAIRhub landing page, Zenodo archive https://doi.org/10.5281/zenodo.10642459.
qualityPublished on FAIRhub (recognized FAIR data repository) with additional Zenodo archival copy. Multi-platform distribution.
semanticPlatform recognized: FAIRhub is FAIR-focused repository, Zenodo is general-purpose research data repository (CERN). Dual platform approach ensures preservation.
✓ 1/1 R10 10.Cross-Platform and Community Integration Outreach Materials and Documentation Links
evidenceexternal_resources: project website (aireadi.org), documentation portal (docs.aireadi.org), FAIRhub landing page, data sharing info (aireadi.org/goals/data-sharing), BMJ Open protocol, Nature Metabolism commentary.
qualityComprehensive outreach: project website, documentation portal with version-specific guides, data sharing policies, protocol publication (BMJ Open), commentary (Nature Metabolism).
semanticOutreach materials extensive: website, docs, publications (2 peer-reviewed), data sharing policies. Community engagement via multiple channels.
✓ 1/1 R10 2.Dataset Access and Retrieval Download URL or Platform Link Available
evidencepage: https://fairhub.io/datasets/2, distributions describe public access at FAIRhub upon CC BY-NC 4.0 agreement
qualityFAIRhub platform URL provided. Access contingent on license agreement (standard practice for health data).
semanticDownload mechanism clear: FAIRhub portal with license agreement. URL valid.
5/5 R20 Q14 (Technical Documentation) Associated Publications
levelMultiple references with DOIs
evidenceexternal_resources: 9 resources including 'Protocol Publication (BMJ Open)' at https://doi.org/10.1136/bmjopen-2024-097449, 'Nature Metabolism Commentary' at https://doi.org/10.1038/s42255-024-01165-x, 'Zenodo Archive' at https://doi.org/10.5281/zenodo.10642459, plus project website, documentation portal, dataset landing page, NIH RePORTER, and data sharing policies. NOTE: D4D-core schema does not include 'citation' field present in full D4D schema
qualityExcellent publication and resource documentation with 3 DOI-linked publications (BMJ Open protocol, Nature Metabolism commentary, Zenodo archive) plus 6 additional persistent URLs for documentation and project resources.
correctnessDOI formats (10.1136, 10.1038, 10.5281) match known registrars (BMJ, Nature, Zenodo). URLs are properly formatted and plausible.
consistencyPublications (protocol paper, commentary) align with dataset scope and timeline. External resources cover expected documentation types (project site, data portal, funder page)
1/1 R20 Q16 (FAIRness & Accessibility) Findability (Persistent Links)
levelPass
evidencepage: 'https://fairhub.io/datasets/2', doi: '10.57895/fairhub.2', external_resources: 9 persistent URLs including https://aireadi.org/, https://docs.aireadi.org/, https://fairhub.io/datasets/2, https://bridge2ai.org/, https://reporter.nih.gov/project-details/10471118, https://doi.org/10.5281/zenodo.10642459, https://doi.org/10.1136/bmjopen-2024-097449, https://doi.org/10.1038/s42255-024-01165-x
qualityMultiple persistent URLs present including DOI, dataset landing page, project website, documentation portal, and publication DOIs.
correctnessAll URLs follow proper format. DOI resolves to expected resource. Domain names are plausible for described organizations.
consistencyPage URL and DOI suffix both reference 'datasets/2' confirming alignment
1/1 R20 Q20 (FAIRness & Accessibility) Interlinking Across Platforms
levelPass
evidenceexternal_resources: Links to 9 platforms/resources including FAIRhub (dataset repository), project website (aireadi.org), documentation portal (docs.aireadi.org), Bridge2AI parent program, NIH RePORTER, Zenodo archive, BMJ Open publication, Nature Metabolism publication. DOI provides cross-platform identifier. page URL provides FAIRhub landing page
qualityExcellent cross-platform interlinking with connections to dataset repository (FAIRhub), project infrastructure (websites, documentation), funder database (NIH RePORTER), archival repository (Zenodo), and publications (BMJ Open, Nature Metabolism).
correctnessAll platform domains are plausible and properly formatted. DOI provides globally resolvable identifier across platforms.
consistencyPlatform links align with dataset lifecycle: FAIRhub (distribution), docs.aireadi.org (documentation), NIH RePORTER (funding), Zenodo (archival), journals (publications)
1/1 R20 Q6 (Metadata Quality & Content) Dataset Identification Metadata
levelPass
evidencedoi: '10.57895/fairhub.2', page: 'https://fairhub.io/datasets/2', external_resources include persistent URLs
qualityMultiple persistent identifiers present including DOI and persistent page URL.
correctnessDOI prefix 10.57895 is non-standard but valid for FAIRhub institutional repository. DOI format follows standard pattern.
consistencyDOI suffix 'fairhub.2' aligns with page URL '/datasets/2'
language
language: en
no field-level feedback matched
license
license: CC BY-NC 4.0
✓ 1/1 R10 3.Data Reuse and Interoperability License Terms Allow Reuse
evidencelicense_and_use_terms: CC BY-NC 4.0 permits distribution, remix, adaptation, derivative works non-commercially with attribution. Full license at http://creativecommons.org/licenses/by-nc/4.0/
qualityCC BY-NC 4.0 explicitly permits derivative works, adaptation, remixing with attribution. Non-commercial restriction clear.
semanticLicense semantically appropriate for research data sharing. Reuse permitted with attribution and non-commercial constraint.
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid: https://fairhub.io/datasets/2, title: 'Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)', description: 378 chars, keywords: 19 keywords, license: 'CC BY-NC 4.0'
qualityAll mandatory fields present with comprehensive content. Description provides dataset overview with sample size, modalities, and FAIR principles.
correctnessAll fields contain semantically appropriate values for Type 2 Diabetes multimodal dataset
consistencyFields align with dataset scope and methodology described in other sections
5/5 R20 Q17 (FAIRness & Accessibility) Accessibility (Access Mechanism)
levelFully defined access path (platform, login, policy)
evidencedistributions[0]: 'Public access subset available at https://fairhub.io/datasets/2 upon agreement with CC BY-NC 4.0 license. Distributed as ZIP archive containing DICOM, CSV, mHealth, and XML files'. distributions[1]: 'Controlled access subset requiring data use agreement. Distributed as ZIP archive'. license_and_use_terms describes two-tier access model with specific requirements and prohibitions
qualityClear access mechanism documentation with two-tier model: public access via license agreement on FAIRhub platform, controlled access via separate data use agreement. Distribution formats and access procedures are well-defined.
correctnessTwo-tier access model (public CC BY-NC 4.0 + controlled DUA) is appropriate for dataset with sensitive genetic/demographic data
consistencyAccess tiers align with sensitive_elements and confidential_elements. Distribution format (ZIP with DICOM/CSV/mHealth/XML) aligns with distribution_formats
doi
doi: 10.57895/fairhub.2
⚠ low R10 · correctness
issueDOI prefix 10.57895 is not a widely recognized registrar (PhysioNet=10.13026, Zenodo=10.5281, DataVerse=10.18130), but appears to be FAIRhub-specific
fieldsdoi
fixVerify 10.57895 is officially registered with DataCite or Crossref for FAIRhub
⚠ low R20 · correctness
issueDOI prefix 10.57895 is non-standard but valid for FAIRhub institutional repository
fieldsdoi
fixVerify DOI resolves correctly at https://doi.org/10.57895/fairhub.2
✓ 1/1 R10 1.Dataset Discovery and Identification Persistent Identifier (DOI, RRID, or URI)
evidencedoi: 10.57895/fairhub.2, id: https://fairhub.io/datasets/2
qualityDOI and URI present. DOI prefix 10.57895 appears FAIRhub-specific (not PhysioNet/Zenodo/DataVerse standard prefixes), but format valid.
semanticFormat valid (10.XXXX pattern). Prefix 10.57895 not widely recognized but likely institutional FAIRhub registrar.
✓ 1/1 R10 1.Dataset Discovery and Identification Hierarchical Structure (parent datasets, relationships)
evidenceexternal_resources list Bridge2AI Program (parent program) at https://bridge2ai.org/, Zenodo archive https://doi.org/10.5281/zenodo.10642459
qualityParent program (Bridge2AI) documented in external_resources. Zenodo archive provides alternate access point.
semanticParent-child relationship clear (AI-READI is part of Bridge2AI program). No peer dataset relationships documented.
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2. maintainers: AI-READI Consortium. external_resources: FAIRhub landing page, Zenodo archive https://doi.org/10.5281/zenodo.10642459.
qualityPublished on FAIRhub (recognized FAIR data repository) with additional Zenodo archival copy. Multi-platform distribution.
semanticPlatform recognized: FAIRhub is FAIR-focused repository, Zenodo is general-purpose research data repository (CERN). Dual platform approach ensures preservation.
✓ 1/1 R10 10.Cross-Platform and Community Integration Citation and DOI for Cross-referencing
evidencedoi: 10.57895/fairhub.2. external_resources: Zenodo DOI 10.5281/zenodo.10642459, BMJ Open protocol DOI 10.1136/bmjopen-2024-097449, Nature Metabolism DOI 10.1038/s42255-024-01165-x.
qualityDataset DOI (10.57895/fairhub.2), Zenodo archive DOI (10.5281/zenodo.10642459), and publication DOIs (BMJ Open, Nature Metabolism) all provided. No citation field in D4D-core but DOIs enable citation.
semanticDOIs for dataset (FAIRhub), archive (Zenodo), and publications (BMJ, Nature) enable cross-referencing. Citation format not provided but DOI sufficient for auto-generation.
5/5 R20 Q14 (Technical Documentation) Associated Publications
levelMultiple references with DOIs
evidenceexternal_resources: 9 resources including 'Protocol Publication (BMJ Open)' at https://doi.org/10.1136/bmjopen-2024-097449, 'Nature Metabolism Commentary' at https://doi.org/10.1038/s42255-024-01165-x, 'Zenodo Archive' at https://doi.org/10.5281/zenodo.10642459, plus project website, documentation portal, dataset landing page, NIH RePORTER, and data sharing policies. NOTE: D4D-core schema does not include 'citation' field present in full D4D schema
qualityExcellent publication and resource documentation with 3 DOI-linked publications (BMJ Open protocol, Nature Metabolism commentary, Zenodo archive) plus 6 additional persistent URLs for documentation and project resources.
correctnessDOI formats (10.1136, 10.1038, 10.5281) match known registrars (BMJ, Nature, Zenodo). URLs are properly formatted and plausible.
consistencyPublications (protocol paper, commentary) align with dataset scope and timeline. External resources cover expected documentation types (project site, data portal, funder page)
1/1 R20 Q16 (FAIRness & Accessibility) Findability (Persistent Links)
levelPass
evidencepage: 'https://fairhub.io/datasets/2', doi: '10.57895/fairhub.2', external_resources: 9 persistent URLs including https://aireadi.org/, https://docs.aireadi.org/, https://fairhub.io/datasets/2, https://bridge2ai.org/, https://reporter.nih.gov/project-details/10471118, https://doi.org/10.5281/zenodo.10642459, https://doi.org/10.1136/bmjopen-2024-097449, https://doi.org/10.1038/s42255-024-01165-x
qualityMultiple persistent URLs present including DOI, dataset landing page, project website, documentation portal, and publication DOIs.
correctnessAll URLs follow proper format. DOI resolves to expected resource. Domain names are plausible for described organizations.
consistencyPage URL and DOI suffix both reference 'datasets/2' confirming alignment
1/1 R20 Q6 (Metadata Quality & Content) Dataset Identification Metadata
levelPass
evidencedoi: '10.57895/fairhub.2', page: 'https://fairhub.io/datasets/2', external_resources include persistent URLs
qualityMultiple persistent identifiers present including DOI and persistent page URL.
correctnessDOI prefix 10.57895 is non-standard but valid for FAIRhub institutional repository. DOI format follows standard pattern.
consistencyDOI suffix 'fairhub.2' aligns with page URL '/datasets/2'
keywords
keywords:
- Type 2 Diabetes Mellitus
- T2DM
- AI-READI
- Machine Learning
- Artificial Intelligence
- multimodal dataset
- harmonized data
- multi-site study
- salutogenesis
- FAIR principles
- retinal imaging
- continuous glucose monitoring
- wearable devices
- biorepository
- biospecimens
- triple-balanced sampling
- health equity
- Bridge2AI
- cross-sectional study
✓ 1/1 R10 1.Dataset Discovery and Identification Keywords or Tags for Searchability
evidencekeywords: 18 terms including Type 2 Diabetes Mellitus, T2DM, Machine Learning, multimodal dataset, retinal imaging, wearable devices, health equity, Bridge2AI
quality18 diverse keywords covering disease domain, methods (AI/ML), modalities (imaging, wearables), and program affiliation.
semanticWell above 5-keyword threshold. Covers domain, methods, conditions, and program context.
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidenceinstances: Type 2 Diabetes Mellitus (T2DM) with 4 severity levels (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled). purposes: salutogenesis in T2DM. keywords: T2DM, diabetes severity, retinal imaging, continuous glucose monitoring.
qualityPrimary condition T2DM with granular severity stratification (4 levels). Secondary topics: salutogenesis, retinal complications, metabolic health, health equity.
semanticCondition representation clear: T2DM as primary, with comorbidities and complications (retinal, metabolic, cardiovascular via ECG/troponin).
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid: https://fairhub.io/datasets/2, title: 'Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)', description: 378 chars, keywords: 19 keywords, license: 'CC BY-NC 4.0'
qualityAll mandatory fields present with comprehensive content. Description provides dataset overview with sample size, modalities, and FAIR principles.
correctnessAll fields contain semantically appropriate values for Type 2 Diabetes multimodal dataset
consistencyFields align with dataset scope and methodology described in other sections
5/5 R20 Q3 (Structural Completeness) Keyword Diversity
level≥8 keywords
evidencekeywords: 19 unique keywords including 'Type 2 Diabetes Mellitus', 'T2DM', 'AI-READI', 'Machine Learning', 'Artificial Intelligence', 'multimodal dataset', 'harmonized data', 'multi-site study', 'salutogenesis', 'FAIR principles', 'retinal imaging', 'continuous glucose monitoring', 'wearable devices', 'biorepository', 'biospecimens', 'triple-balanced sampling', 'health equity', 'Bridge2AI', 'cross-sectional study'
qualityExceptional keyword diversity with 19 unique keywords covering dataset characteristics, methodology, data types, and research themes.
correctnessKeywords accurately represent dataset content and research domain
consistencyKeywords align with description, purposes, and data modalities described
is_tabular
is_tabular: false
✓ 1/1 R10 5.Data Composition and Structure Variable-Level Metadata and Tabular Flag
evidenceis_tabular: false (multimodal dataset). acquisition_methods: 12 structured entries detailing data domains (surveys, physical measurements, retinal imaging, visual function, clinical labs, ECG, cognitive testing, peripheral neuropathy, CGM, physical activity, environmental, biospecimens).
qualityis_tabular=false appropriate for multimodal data. 12 data domains documented with methods, instruments, formats, and measurement details.
semanticTabular flag correct (multimodal, not single table). Variable metadata extensive: 12 acquisition methods cover >10 data domains with instrument/method specifics.
purposes
purposes:
- id: aireadi:purpose:1
  name: Understanding T2DM salutogenesis
  description: 'Better understand salutogenesis (the pathway from disease to health) in Type 2 Diabetes
    Mellitus using a hypothesis-agnostic, harmonized, multi-domain dataset designed specifically for AI/ML
    research. The dataset aims to provide critical insights into how individuals can transition from diabetes
    toward health resilience through pseudotime manifold analysis.

    '
- id: aireadi:purpose:2
  name: Establishing AI/ML data standards
  description: 'Establish standards, best practices, and guidelines for collection, preparation, and sharing
    of medical/health data sets targeted for AI/ML applications. This includes guidance from bioethicists
    on ethical and equitable data collection and management practices, with adherence to FAIR principles.

    '
- id: aireadi:purpose:3
  name: Addressing demographic inequities in T2DM research
  description: 'Address the lack of racial and ethnic diversity in T2DM research by creating a dataset
    that is triple-balanced across race/ethnicity (Asian, Black, Hispanic, White), biological sex (male,
    female), and diabetes severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled,
    insulin-controlled).

    '
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidenceinstances: Type 2 Diabetes Mellitus (T2DM) with 4 severity levels (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled). purposes: salutogenesis in T2DM. keywords: T2DM, diabetes severity, retinal imaging, continuous glucose monitoring.
qualityPrimary condition T2DM with granular severity stratification (4 levels). Secondary topics: salutogenesis, retinal complications, metabolic health, health equity.
semanticCondition representation clear: T2DM as primary, with comorbidities and complications (retinal, metabolic, cardiovascular via ECG/troponin).
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Motivation or Purpose for Dataset Creation
evidencepurposes: 3 structured entries (understanding T2DM salutogenesis, establishing AI/ML data standards, addressing demographic inequities). addressing_gaps: 3 structured entries (lack of multimodal T2DM datasets, demographic underrepresentation, AI-readiness).
qualityScientific rationale clear across 6 structured statements (3 purposes, 3 gaps). Motivation spans scientific (salutogenesis), methodological (AI/ML standards), and ethical (health equity) domains.
semanticMotivation semantically rich: disease research (T2DM salutogenesis), methods development (AI standards), equity (demographic balance). Addresses multiple research gaps.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Primary Research Objectives or Tasks
evidencetasks: 3 structured entries (enable multi-domain AI/ML analyses, develop unbiased AI/ML models, study T2DM disease trajectories). purposes provide additional context on research goals.
qualityResearch tasks specific: multi-domain ML (survey, clinical, imaging, wearable), unbiased models (triple-balanced design), disease trajectories (pseudotime manifold analysis).
semanticTasks aligned with purposes and dataset design. Specific analytical methods mentioned (pseudotime manifold analysis). Semantically coherent.
5/5 R20 Q2 (Structural Completeness) Entry Length Adequacy
level>200 chars
evidencedescription: 378 chars, purposes[0].description: 304 chars, purposes[1].description: 244 chars, purposes[2].description: 284 chars
qualityExcellent narrative content length across all fields. Description and purpose statements exceed 200 characters with detailed context.
correctnessNarrative content accurately describes dataset characteristics and research goals
consistencyPurpose statements align with addressing_gaps and tasks sections
tasks
tasks:
- id: aireadi:task:1
  name: Enable multi-domain AI/ML analyses for T2DM
  description: 'Enable downstream AI/ML analyses across survey, clinical, imaging, wearable device, environmental,
    and biospecimen domains related to T2DM that may not be feasible with existing data sources such as
    claims or electronic health records data alone. The multimodal nature of the data supports complex
    machine learning model development.

    '
- id: aireadi:task:2
  name: Develop unbiased AI/ML models
  description: 'Support the development of unbiased machine learning models through balanced data collection
    across demographic groups and diabetes severity levels. The triple-balanced design is critical for
    preventing algorithmic bias in AI/ML applications.

    '
- id: aireadi:task:3
  name: Study T2DM disease trajectories
  description: 'Study disease trajectories and salutogenesis pathways in T2DM through cross-sectional
    analysis of participants at different disease stages, enabling pseudotime manifold analysis to predict
    disease progression and paths to health resilience.

    '
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Primary Research Objectives or Tasks
evidencetasks: 3 structured entries (enable multi-domain AI/ML analyses, develop unbiased AI/ML models, study T2DM disease trajectories). purposes provide additional context on research goals.
qualityResearch tasks specific: multi-domain ML (survey, clinical, imaging, wearable), unbiased models (triple-balanced design), disease trajectories (pseudotime manifold analysis).
semanticTasks aligned with purposes and dataset design. Specific analytical methods mentioned (pseudotime manifold analysis). Semantically coherent.
addressing_gaps
addressing_gaps:
- id: aireadi:gap:1
  name: Lack of multimodal T2DM datasets
  description: 'Provide a large-scale, harmonized, multi-site, multi-domain dataset enabling AI/ML analyses
    not feasible with existing sources (e.g., claims or EHR alone). With 4,000 participants and over 10
    variable domains, this is the largest publicly accessible dataset of its kind for T2DM research.

    '
- id: aireadi:gap:2
  name: Demographic underrepresentation
  description: 'Address demographic inequities in T2DM research by recruiting equal proportions across
    four race/ethnic groups (Asian, Black, Hispanic, White) and both biological sexes, improving upon
    many previous epidemiological studies and clinical trials that lacked diversity.

    '
- id: aireadi:gap:3
  name: AI-readiness of medical datasets
  description: 'Create a model for future AI-ready medical datasets through comprehensive metadata, standardized
    data formats, FAIR compliance, and ethical data governance practices that can be replicated for other
    health conditions.

    '
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Motivation or Purpose for Dataset Creation
evidencepurposes: 3 structured entries (understanding T2DM salutogenesis, establishing AI/ML data standards, addressing demographic inequities). addressing_gaps: 3 structured entries (lack of multimodal T2DM datasets, demographic underrepresentation, AI-readiness).
qualityScientific rationale clear across 6 structured statements (3 purposes, 3 gaps). Motivation spans scientific (salutogenesis), methodological (AI/ML standards), and ethical (health equity) domains.
semanticMotivation semantically rich: disease research (T2DM salutogenesis), methods development (AI standards), equity (demographic balance). Addresses multiple research gaps.
creators
creators:
- id: aireadi:creator:1
  name: Aaron Lee
  description: Contact PI/Project Leader, University of Washington, Department of Ophthalmology, Assistant
    Professor
- id: aireadi:creator:2
  name: Cynthia Owsley
  description: Principal Investigator, University of Alabama at Birmingham, Department of Ophthalmology
    and Visual Sciences
- id: aireadi:creator:3
  name: Sally L. Baxter
  description: Co-Investigator, University of California San Diego, Department of Ophthalmology
- id: aireadi:creator:4
  name: Christopher G. Chute
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:5
  name: Megan E. Collins
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:6
  name: Jeffrey C. Edberg
  description: Co-Investigator, University of Alabama at Birmingham, Department of Medicine
- id: aireadi:creator:7
  name: Kadija Ferryman
  description: Co-Investigator, AI-READI Consortium (Bioethics)
- id: aireadi:creator:8
  name: Michelle Hribar
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:9
  name: Samantha Hurst
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:10
  name: Hiroshi Ishikawa
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:11
  name: Cecilia S. Lee
  description: Co-Investigator, University of Washington, Department of Ophthalmology
- id: aireadi:creator:12
  name: Alvin Y. Liu
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:13
  name: Gerald McGwin
  description: Co-Investigator, University of Alabama at Birmingham, Departments of Ophthalmology and
    Epidemiology
- id: aireadi:creator:14
  name: Shannon K. McWeeney
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:15
  name: Camille Nebeker
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:16
  name: Bhavesh Patel
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:17
  name: Sara Jean Singer
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:18
  name: Michael P. Snyder
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:19
  name: Joseph Manuel Yracheta
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:20
  name: Linda M. Zangwill
  description: Co-Investigator, University of California San Diego, Department of Ophthalmology
✓ 1/1 R10 6.Data Provenance and Version Tracking Provenance and Source Derivation Documented
evidencecreators: 20 investigators with institutions and roles. funders: NIH Common Fund Bridge2AI grant OT2OD032644. collection_mechanisms, acquisition_methods, data_collectors describe data sources (3 collection sites, EHR screening, in-person visits, wearables, biospecimens).
qualityProvenance extensive: 20 creators with affiliations, NIH funding source, 3 collection sites (Birmingham, San Diego, Seattle), data collection procedures, instruments.
semanticProvenance chain complete: funding (NIH OT2OD032644) → creators (20 investigators, 3 institutions) → collection sites → data collectors → instruments. Traceable.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Creators and Acknowledgements Documented
evidencecreators: 20 investigators with names, roles (Contact PI, Principal Investigator, Co-Investigators), institutions (University of Washington, UAB, UCSD, Stanford, etc.). funders acknowledge Research to Prevent Blindness. maintainers: AI-READI Consortium.
qualityComprehensive creator list: 20 named individuals with institutional affiliations and roles. Consortium acknowledged. Non-NIH funder (Research to Prevent Blindness) mentioned.
semanticCreator metadata rich: names, roles, institutions. Consortium structure (multi-site collaboration) clear. Acknowledgements include non-federal funding (RPB).
5/5 R20 Q7 (Metadata Quality & Content) Funding and Acknowledgements Completeness
levelFunders with grants + creators with affiliations
evidencefunders[0]: 'NIH Common Fund Bridge2AI Program' with grant 'OT2OD032644', additional grants 'P30DK035816, UL1TR003096', opportunity number 'OTA-21-008', funding amount '$5,026,499', project dates 'September 1, 2022 to August 31, 2025'. creators: 20 creators with names, institutions, and roles (e.g., 'Aaron Lee - Contact PI/Project Leader, University of Washington, Department of Ophthalmology')
qualityComprehensive funding and creator information. All 20 creators include institutional affiliations and roles. Funding includes grant numbers, opportunity number, funding amounts, and project timeline.
correctnessGrant number OT2OD032644 follows NIH format (OT2 mechanism code, OD institute code). Opportunity number OTA-21-008 is plausible for Bridge2AI program.
consistencyFunding timeline (Sept 2022 - Aug 2025) aligns with enrollment period (July 2023 - Nov 2026) and data release schedule
funders
funders:
- id: aireadi:funder:1
  name: NIH Common Fund Bridge2AI Program
  description: 'Funded through National Institutes of Health grant OT2OD032644, administered by NIH Office
    of the Director. Additional support from grants P30DK035816 (Nutrition and Obesity Research Center),
    UL1TR003096, and Research to Prevent Blindness. Total funding in 2022: $5,026,499. Opportunity Number:
    OTA-21-008. Project dates: September 1, 2022 to August 31, 2025.

    '
⚠ low R10 · consistency
issueGrant number format 'OT2OD032644' follows NIH pattern [Type][Number][Institute][Digits] correctly, with additional grants P30DK035816, UL1TR003096 mentioned in funder description
fieldsfunders
fixConsider extracting individual grant numbers into structured sub-fields for machine readability
⚠ low R20 · correctness
issueGrant number OT2OD032644 follows NIH format correctly (OT2 mechanism, OD institute)
fieldsfunders
fixGrant format validated - no action needed
✓ 1/1 R10 10.Cross-Platform and Community Integration Related Datasets with Typed Relationships
evidenceexternal_resources: Bridge2AI Program (parent program) at bridge2ai.org, Zenodo archive (alternate version) at 10.5281/zenodo.10642459. funders: NIH Common Fund Bridge2AI (program affiliation).
qualityParent program relationship (Bridge2AI) documented. Zenodo archive provides alternate version. No peer dataset relationships (supplements, derives from) documented.
semanticHierarchical relationship clear (AI-READI part of Bridge2AI program). Zenodo archive is alternate distribution (isVersionOf relationship). No lateral dataset relationships.
✓ 1/1 R10 6.Data Provenance and Version Tracking Provenance and Source Derivation Documented
evidencecreators: 20 investigators with institutions and roles. funders: NIH Common Fund Bridge2AI grant OT2OD032644. collection_mechanisms, acquisition_methods, data_collectors describe data sources (3 collection sites, EHR screening, in-person visits, wearables, biospecimens).
qualityProvenance extensive: 20 creators with affiliations, NIH funding source, 3 collection sites (Birmingham, San Diego, Seattle), data collection procedures, instruments.
semanticProvenance chain complete: funding (NIH OT2OD032644) → creators (20 investigators, 3 institutions) → collection sites → data collectors → instruments. Traceable.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Funding Sources and Mechanisms Listed
evidencefunders: NIH Common Fund Bridge2AI Program, grant OT2OD032644 administered by NIH Office of the Director. Additional support P30DK035816, UL1TR003096, Research to Prevent Blindness. Total 2022 funding: $5,026,499. Opportunity OTA-21-008. Project dates: September 1, 2022 to August 31, 2025.
qualityFunding source (NIH Common Fund), program (Bridge2AI), administering office (NIH OD), opportunity number (OTA-21-008), total amount ($5,026,499), dates (Sept 2022 - Aug 2025), and additional grants all documented.
semanticFunding transparency exceptional: primary grant, supporting grants, funding amount, dates, opportunity number. Semantically complete.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Grant IDs or Award Numbers Present
evidencefunders: grant OT2OD032644, P30DK035816, UL1TR003096. external_resources: NIH RePORTER project-details/10471118 for grant 1OT2OD032644-01.
qualityPrimary grant OT2OD032644 follows NIH format [Type][Number][Institute][Digits]: OT2=Other Transaction, OD=Office of Director, 032644=award number. Supporting grants P30DK035816 (P30=program project), UL1TR003096 (UL1=university infrastructure) also valid NIH formats.
semanticGrant number format validation PASSED: OT2OD032644 follows NIH pattern. P30 (program project), UL1 (infrastructure) formats correct. NIH RePORTER link confirms grant.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Creators and Acknowledgements Documented
evidencecreators: 20 investigators with names, roles (Contact PI, Principal Investigator, Co-Investigators), institutions (University of Washington, UAB, UCSD, Stanford, etc.). funders acknowledge Research to Prevent Blindness. maintainers: AI-READI Consortium.
qualityComprehensive creator list: 20 named individuals with institutional affiliations and roles. Consortium acknowledged. Non-NIH funder (Research to Prevent Blindness) mentioned.
semanticCreator metadata rich: names, roles, institutions. Consortium structure (multi-site collaboration) clear. Acknowledgements include non-federal funding (RPB).
5/5 R20 Q7 (Metadata Quality & Content) Funding and Acknowledgements Completeness
levelFunders with grants + creators with affiliations
evidencefunders[0]: 'NIH Common Fund Bridge2AI Program' with grant 'OT2OD032644', additional grants 'P30DK035816, UL1TR003096', opportunity number 'OTA-21-008', funding amount '$5,026,499', project dates 'September 1, 2022 to August 31, 2025'. creators: 20 creators with names, institutions, and roles (e.g., 'Aaron Lee - Contact PI/Project Leader, University of Washington, Department of Ophthalmology')
qualityComprehensive funding and creator information. All 20 creators include institutional affiliations and roles. Funding includes grant numbers, opportunity number, funding amounts, and project timeline.
correctnessGrant number OT2OD032644 follows NIH format (OT2 mechanism code, OD institute code). Opportunity number OTA-21-008 is plausible for Bridge2AI program.
consistencyFunding timeline (Sept 2022 - Aug 2025) aligns with enrollment period (July 2023 - Nov 2026) and data release schedule
instances
instances:
- id: aireadi:instance:1
  name: Individual participants
  description: 'Individual participants aged 40 and older with and without Type 2 Diabetes Mellitus (T2DM).
    Target enrollment is 4,000 people, triple-balanced by self-reported race/ethnicity (Asian, Black,
    Hispanic, White), T2DM severity (no diabetes, pre-diabetes/lifestyle-controlled diabetes, diabetes
    treated with oral medications or non-insulin injections, insulin-controlled diabetes), and biological
    sex (male, female). Participants must speak, read, and understand English. Exclusion criteria include
    pregnancy and type 1 diabetes.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Variable Metadata with Identifiers Defined
evidenceinstances, subpopulations, sensitive_elements, confidential_elements all provide structured metadata with IDs (e.g., aireadi:instance:1, aireadi:subpop:1). acquisition_methods detail 12 data domains with structured descriptions.
qualityExtensive structured metadata for instances, subpopulations, data domains. Each element has ID, name, description. RxNorm codes mentioned for medications.
semanticVariable-level metadata rich: 12 acquisition methods, 8 subpopulations, 4 sensitive element categories. Identifiers follow URI pattern (aireadi:*).
✓ 1/1 R10 5.Data Composition and Structure Cohort or Subpopulations Characteristics Described
evidenceinstances: 4,000 participants aged 40+, triple-balanced by race/ethnicity, T2DM severity, sex. subpopulations: 8 structured entries (4 racial/ethnic groups, 4 diabetes severity levels) each ~1,000 participants. Exclusions: pregnancy, type 1 diabetes.
qualityExceptional detail: target N=4,000, age 40+, triple-balanced design with specific subpopulation targets (25% each). Inclusion/exclusion criteria clear.
semanticSubpopulation metadata rich: demographics (race/ethnicity, sex), disease severity (4 T2DM levels), sample sizes. Semantically complete for AI/ML fairness assessment.
✓ 1/1 R10 5.Data Composition and Structure Number of Instances or Samples Reported
evidenceinstances: Target enrollment 4,000 people. subpopulations: approximately 1,000 participants per group (8 groups). collection_timeframes: enrollment began July 18, 2023, continues to November 30, 2026. distribution_dates: v1.0.0 through July 31, 2024.
qualityTarget N=4,000 clearly stated. Interim releases documented (pilot May 2024, v1.0.0 through July 2024). Subpopulation targets ~1,000 each.
semanticInstance counts specific and consistent: 4,000 total = 8 subpops × ~1,000 each. Temporal context provided (enrollment period, release dates).
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidenceinstances: Type 2 Diabetes Mellitus (T2DM) with 4 severity levels (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled). purposes: salutogenesis in T2DM. keywords: T2DM, diabetes severity, retinal imaging, continuous glucose monitoring.
qualityPrimary condition T2DM with granular severity stratification (4 levels). Secondary topics: salutogenesis, retinal complications, metabolic health, health equity.
semanticCondition representation clear: T2DM as primary, with comorbidities and complications (retinal, metabolic, cardiovascular via ECG/troponin).
5/5 R20 Q15 (Technical Documentation) Human Subject Representation
levelDetailed demographics and inclusion/exclusion criteria
evidenceinstances: 'Individual participants aged 40+ with and without T2DM. Target enrollment 4,000 people, triple-balanced by race/ethnicity (Asian, Black, Hispanic, White), T2DM severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled), biological sex (male, female). Must speak/read/understand English. Exclusion: pregnancy, type 1 diabetes'. subpopulations: 8 subgroups (4 race/ethnicity groups, 4 diabetes severity groups) each with target ~1,000 participants (25% of sample). sampling_strategies: describes triple-balanced recruitment with rationale for non-representativeness
qualityExceptional human subject representation with detailed demographics, inclusion/exclusion criteria, and subpopulation breakdowns. Triple-balanced design explicitly documented with targets and rationale.
correctnessAge criterion (40+) is appropriate for T2DM study. Triple-balanced design (32 groups = 4 race × 4 severity × 2 sex) is mathematically consistent with 4,000 target.
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count. Sampling strategy rationale aligns with purposes (bias mitigation, health equity)
1/1 R20 Q5 (Structural Completeness) Data File Size Availability
levelPass
evidenceinstances[0].description: 'Target enrollment is 4,000 people', subpopulations: 8 subgroups with target ~1,000 each, distribution_dates indicate v1.0.0 through July 31, 2024
qualityInstance count metadata clearly documented with target enrollment of 4,000 participants and subpopulation breakdowns.
correctnessSample size (4,000 participants) is plausible for multi-site NIH-funded study
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count
subpopulations
subpopulations:
- id: aireadi:subpop:1
  name: Asian participants
  description: Self-reported Asian race/ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:2
  name: Black participants
  description: Self-reported Black race/ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:3
  name: Hispanic participants
  description: Self-reported Hispanic ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:4
  name: White participants
  description: Self-reported White race/ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:5
  name: No diabetes
  description: Participants without diabetes diagnosis, target approximately 1,000 participants (25% of
    sample)
- id: aireadi:subpop:6
  name: Pre-diabetes and lifestyle-controlled diabetes
  description: Participants with pre-diabetes or lifestyle-controlled diabetes, target approximately 1,000
    participants (25% of sample)
- id: aireadi:subpop:7
  name: Medication-controlled diabetes
  description: Participants with diabetes treated with oral medications or non-insulin injections, target
    approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:8
  name: Insulin-controlled diabetes
  description: Participants with insulin-controlled diabetes, target approximately 1,000 participants
    (25% of sample)
✓ 1/1 R10 3.Data Reuse and Interoperability Variable Metadata with Identifiers Defined
evidenceinstances, subpopulations, sensitive_elements, confidential_elements all provide structured metadata with IDs (e.g., aireadi:instance:1, aireadi:subpop:1). acquisition_methods detail 12 data domains with structured descriptions.
qualityExtensive structured metadata for instances, subpopulations, data domains. Each element has ID, name, description. RxNorm codes mentioned for medications.
semanticVariable-level metadata rich: 12 acquisition methods, 8 subpopulations, 4 sensitive element categories. Identifiers follow URI pattern (aireadi:*).
✓ 1/1 R10 5.Data Composition and Structure Cohort or Subpopulations Characteristics Described
evidenceinstances: 4,000 participants aged 40+, triple-balanced by race/ethnicity, T2DM severity, sex. subpopulations: 8 structured entries (4 racial/ethnic groups, 4 diabetes severity levels) each ~1,000 participants. Exclusions: pregnancy, type 1 diabetes.
qualityExceptional detail: target N=4,000, age 40+, triple-balanced design with specific subpopulation targets (25% each). Inclusion/exclusion criteria clear.
semanticSubpopulation metadata rich: demographics (race/ethnicity, sex), disease severity (4 T2DM levels), sample sizes. Semantically complete for AI/ML fairness assessment.
✓ 1/1 R10 5.Data Composition and Structure Number of Instances or Samples Reported
evidenceinstances: Target enrollment 4,000 people. subpopulations: approximately 1,000 participants per group (8 groups). collection_timeframes: enrollment began July 18, 2023, continues to November 30, 2026. distribution_dates: v1.0.0 through July 31, 2024.
qualityTarget N=4,000 clearly stated. Interim releases documented (pilot May 2024, v1.0.0 through July 2024). Subpopulation targets ~1,000 each.
semanticInstance counts specific and consistent: 4,000 total = 8 subpops × ~1,000 each. Temporal context provided (enrollment period, release dates).
5/5 R20 Q15 (Technical Documentation) Human Subject Representation
levelDetailed demographics and inclusion/exclusion criteria
evidenceinstances: 'Individual participants aged 40+ with and without T2DM. Target enrollment 4,000 people, triple-balanced by race/ethnicity (Asian, Black, Hispanic, White), T2DM severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled), biological sex (male, female). Must speak/read/understand English. Exclusion: pregnancy, type 1 diabetes'. subpopulations: 8 subgroups (4 race/ethnicity groups, 4 diabetes severity groups) each with target ~1,000 participants (25% of sample). sampling_strategies: describes triple-balanced recruitment with rationale for non-representativeness
qualityExceptional human subject representation with detailed demographics, inclusion/exclusion criteria, and subpopulation breakdowns. Triple-balanced design explicitly documented with targets and rationale.
correctnessAge criterion (40+) is appropriate for T2DM study. Triple-balanced design (32 groups = 4 race × 4 severity × 2 sex) is mathematically consistent with 4,000 target.
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count. Sampling strategy rationale aligns with purposes (bias mitigation, health equity)
1/1 R20 Q5 (Structural Completeness) Data File Size Availability
levelPass
evidenceinstances[0].description: 'Target enrollment is 4,000 people', subpopulations: 8 subgroups with target ~1,000 each, distribution_dates indicate v1.0.0 through July 31, 2024
qualityInstance count metadata clearly documented with target enrollment of 4,000 participants and subpopulation breakdowns.
correctnessSample size (4,000 participants) is plausible for multi-site NIH-funded study
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count
sensitive_elements
sensitive_elements:
- id: aireadi:sensitive:1
  name: Genetic and biospecimen data
  description: 'Genomic DNA extracted from buffy coats, blood derivatives, and urine samples stored with
    potential for future genetic analyses. Available in controlled access dataset only. Includes genetic
    sequencing data from buffy coats, PBMCs, and PAXgene RNA.

    '
- id: aireadi:sensitive:2
  name: Geographic and demographic identifiers
  description: '5-digit zip code, detailed race, ethnicity, and sex information available in controlled
    access dataset only. Public dataset contains de-identified data.

    '
- id: aireadi:sensitive:3
  name: Medical history and records
  description: 'Past health records, medications with RxNorm codes, traffic and accident reports available
    in controlled access dataset only.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Variable Metadata with Identifiers Defined
evidenceinstances, subpopulations, sensitive_elements, confidential_elements all provide structured metadata with IDs (e.g., aireadi:instance:1, aireadi:subpop:1). acquisition_methods detail 12 data domains with structured descriptions.
qualityExtensive structured metadata for instances, subpopulations, data domains. Each element has ID, name, description. RxNorm codes mentioned for medications.
semanticVariable-level metadata rich: 12 acquisition methods, 8 subpopulations, 4 sensitive element categories. Identifiers follow URI pattern (aireadi:*).
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Privacy Protections Beyond Deidentification
evidenceconfidential_elements: controlled access tier with Data Access Committee oversight. sensitive_elements: genetic data, geographic identifiers, medical records restricted. License prohibits re-identification attempts.
qualityMulti-tier access control (public de-identified, controlled with DUA). Data Access Committee governs sensitive data. License terms enforce no re-identification.
semanticPrivacy protections semantically layered: de-identification + access control + Data Access Committee + license prohibitions. Appropriate for genomic health data.
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Sensitive Content and Warnings Provided
evidencesensitive_elements: 3 structured entries (genetic/biospecimen data in controlled access, geographic/demographic identifiers in controlled access, medical history/records in controlled access). confidential_elements: controlled access subset with Data Access Committee.
qualitySensitive data categories clearly identified: genomic (DNA, RNA), geographic (5-digit zip), demographic (detailed race/ethnicity), medical (records, medications, accidents). Access controls enforced via controlled tier.
semanticSensitive content documentation appropriate for health data: genetics, precise location, detailed demographics, medical records. Multi-tier access control (public de-identified, controlled with DUA).
confidential_elements
confidential_elements:
- id: aireadi:confidential:1
  name: Controlled access dataset
  description: 'A controlled access subset requires a separate data use agreement and includes 5-digit
    zip code, sex, race, ethnicity, genetic sequencing data (from buffy coats), past health records, medications,
    and traffic and accident reports. Access requirements are managed by the Data Access Committee.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Regulatory Restrictions and Confidentiality Level Specified
evidenceregulatory_restrictions: HIPAA and NIH data sharing compliance (NIH grant OT2OD032644), IRB oversight (45 CFR 46). confidential_elements: controlled access subset requires DUA.
qualityHIPAA, NIH policies, IRB regulations (45 CFR 46) all cited. Controlled access tier for sensitive data.
semanticRegulatory framework complete: HIPAA (privacy), NIH (data sharing), 45 CFR 46 (human subjects). Appropriate for health data.
✓ 1/1 R10 3.Data Reuse and Interoperability Variable Metadata with Identifiers Defined
evidenceinstances, subpopulations, sensitive_elements, confidential_elements all provide structured metadata with IDs (e.g., aireadi:instance:1, aireadi:subpop:1). acquisition_methods detail 12 data domains with structured descriptions.
qualityExtensive structured metadata for instances, subpopulations, data domains. Each element has ID, name, description. RxNorm codes mentioned for medications.
semanticVariable-level metadata rich: 12 acquisition methods, 8 subpopulations, 4 sensitive element categories. Identifiers follow URI pattern (aireadi:*).
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Privacy Protections Beyond Deidentification
evidenceconfidential_elements: controlled access tier with Data Access Committee oversight. sensitive_elements: genetic data, geographic identifiers, medical records restricted. License prohibits re-identification attempts.
qualityMulti-tier access control (public de-identified, controlled with DUA). Data Access Committee governs sensitive data. License terms enforce no re-identification.
semanticPrivacy protections semantically layered: de-identification + access control + Data Access Committee + license prohibitions. Appropriate for genomic health data.
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Sensitive Content and Warnings Provided
evidencesensitive_elements: 3 structured entries (genetic/biospecimen data in controlled access, geographic/demographic identifiers in controlled access, medical history/records in controlled access). confidential_elements: controlled access subset with Data Access Committee.
qualitySensitive data categories clearly identified: genomic (DNA, RNA), geographic (5-digit zip), demographic (detailed race/ethnicity), medical (records, medications, accidents). Access controls enforced via controlled tier.
semanticSensitive content documentation appropriate for health data: genetics, precise location, detailed demographics, medical records. Multi-tier access control (public de-identified, controlled with DUA).
5/5 R20 Q9 (Metadata Quality & Content) Access Requirements and Governance Documentation
levelLicense + restrictions + confidentiality classification
evidencelicense_and_use_terms: 'CC BY-NC 4.0 for public data, separate data use agreement for controlled access data' with detailed terms including prohibitions on clinical use, re-identification, and sharing. ip_restrictions: 'Non-commercial use restriction under CC BY-NC 4.0'. regulatory_restrictions: 'HIPAA and NIH data sharing compliance (NIH grant OT2OD032644), IRB oversight (45 CFR 46)'. confidential_elements: describes controlled access dataset requiring data use agreement
qualityExcellent governance documentation with clear license terms, IP restrictions, regulatory compliance, and confidentiality classifications. Two-tier access model (public CC BY-NC 4.0 + controlled access DUA) is well-defined.
correctnessCC BY-NC 4.0 license is appropriate for non-commercial research dataset. HIPAA and 45 CFR 46 are correct regulatory frameworks for human subjects health research.
consistencyLicense restrictions (non-commercial, no clinical use, no re-identification) align with prohibited_uses. Controlled access requirements align with sensitive_elements and confidential_elements
collection_mechanisms
collection_mechanisms:
- id: aireadi:collection:1
  name: In-person data collection visits
  description: 'Single study encounter per participant at one of three data collection sites (Birmingham,
    San Diego, Seattle). Multi-domain protocol containing over 10 data collection domains performed during
    the visit lasting between 2.5 and 4 hours.

    '
- id: aireadi:collection:2
  name: Electronic health record screening
  description: 'Source population identified by screening electronic health records for patients aged
    40+ who had medical encounters between 2020-2025. ICD-10 codes used to identify T2DM (E11.X) and pre-diabetes
    (R73.09) cases.

    '
- id: aireadi:collection:3
  name: Wave-based recruitment
  description: 'Participants recruited in waves to facilitate efficient sampling. Composition and size
    of each wave influenced by observed participation characteristics to maintain balance across race/ethnicity,
    sex, and diabetes severity. Enrollment began July 18, 2023 and continues until November 30, 2026.

    '
- id: aireadi:collection:4
  name: Home-based wearable monitoring
  description: 'Continuous glucose monitoring (Dexcom G6, 5-minute intervals), physical activity monitoring
    (Garmin VivoSmart 5), and environmental sensor monitoring (temperature, humidity, air quality) conducted
    at participants'' homes over 10-day monitoring periods.

    '
- id: aireadi:collection:5
  name: Biospecimen collection and biobanking
  description: 'Blood (53 mL) and urine collected during study visit. Local processing for plasma, serum,
    buffy coats at all sites. Centralized biobanking at UAB CCTS. Standardized operating procedures ensure
    consistent handling.

    '
✓ 1/1 R10 6.Data Provenance and Version Tracking Provenance and Source Derivation Documented
evidencecreators: 20 investigators with institutions and roles. funders: NIH Common Fund Bridge2AI grant OT2OD032644. collection_mechanisms, acquisition_methods, data_collectors describe data sources (3 collection sites, EHR screening, in-person visits, wearables, biospecimens).
qualityProvenance extensive: 20 creators with affiliations, NIH funding source, 3 collection sites (Birmingham, San Diego, Seattle), data collection procedures, instruments.
semanticProvenance chain complete: funding (NIH OT2OD032644) → creators (20 investigators, 3 institutions) → collection sites → data collectors → instruments. Traceable.
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Collection Mechanisms and Settings Described
evidencecollection_mechanisms: 5 structured entries (in-person visits at 3 sites lasting 2.5-4 hours, EHR screening with ICD-10 codes, wave-based recruitment, home wearable monitoring 10 days, biospecimen collection/biobanking). collection_timeframes: July 18, 2023 to November 30, 2026.
qualityCollection settings detailed: 3 sites (Birmingham, San Diego, Seattle), visit duration (2.5-4 hours), recruitment method (EHR screening with ICD-10 codes E11.X, R73.09), home monitoring period (10 days).
semanticCollection mechanisms replicable: sites specified, duration quantified, recruitment strategy (EHR + ICD-10 codes), timeline documented. High technical transparency.
5/5 R20 Q12 (Technical Documentation) Collection Protocol Clarity
levelFull collection protocol with methods, collectors, and timeframes
evidencecollection_mechanisms: 5 mechanisms including 'In-person data collection visits', 'Electronic health record screening', 'Wave-based recruitment', 'Home-based wearable monitoring', 'Biospecimen collection and biobanking'. acquisition_methods: 12 methods covering survey, physical measurements, retinal imaging, visual function, clinical lab, ECG, cognitive function, peripheral neuropathy, CGM, physical activity, environmental monitoring, biospecimens. data_collectors: 'Trained and certified study coordinators at three sites (UAB, UCSD, UW) following Manual of Procedures with certification process'. collection_timeframes: 'Enrollment July 18, 2023 to November 30, 2026 with periodic data releases (pilot May 2024, v1.0.0 Nov 2024)'
qualityComprehensive collection protocol documentation with detailed mechanisms, methods, collector training procedures, and timeframes. Covers all aspects of data collection from recruitment to biobanking.
correctnessCollection timeline (July 2023 - Nov 2026) is plausible for 4,000-participant multi-site study. Training/certification requirements appropriate for clinical research.
consistencyCollection mechanisms and acquisition methods align with data modalities described in keywords and purposes. Timeframes align with distribution dates and funding period
acquisition_methods
acquisition_methods:
- id: aireadi:acquisition:1
  name: Survey and questionnaire data
  description: 'Self-reported data collected via REDCap interfaces including demographics, medical history,
    social determinants of health, depression screening (CES-D-10), diabetes-related emotional distress
    (PAID scale), diabetes self-care score, dietary assessment, ophthalmic survey, substance use (smoking,
    alcohol, vaping, marijuana), general health conditions, and current medications with RxNorm codes.

    '
- id: aireadi:acquisition:2
  name: Physical measurements and vital signs
  description: 'Height, weight, waist and hip circumference (waist-hip ratio and BMI calculated), blood
    pressure (systolic and diastolic, measured twice separated by 2 minutes), and heart rate collected
    during in-person visit using standardized protocols.

    '
- id: aireadi:acquisition:3
  name: Retinal imaging
  description: 'Multi-device retinal imaging protocol capturing data from Aurora IQ (Optomed), EIDON widefield
    truecolor confocal fundus system (iCare), Spectralis HRA OCT and OCTA (Heidelberg Engineering), Maestro2
    3D OCT-1 (Topcon), Triton DRI OCT (Topcon), Cirrus 5000 (Carl Zeiss), and Fluorescence Lifetime Imaging
    Ophthalmoscopy (FLIO, Heidelberg Engineering). Both eyes imaged under dilated conditions (except Aurora
    IQ). Output formats include DICOM, with proprietary formats (.fda, .sdt) converted to DICOM.

    '
- id: aireadi:acquisition:4
  name: Visual function testing
  description: 'Visual acuity and contrast sensitivity under photopic (daylight) and mesopic (dim light)
    conditions using Electronic Visual Acuity tester (M&S Technology) and Mars chart (Mars Perceptrix).
    Autorefraction data collected using Topcon KR 800.

    '
- id: aireadi:acquisition:5
  name: Clinical laboratory testing
  description: 'Complete blood count (CBC) from fresh whole blood at local CLIA-certified labs. Central
    lab testing at UW Nutrition and Obesity Research Center (NORC) for EDTA plasma tests (NT-proBNP, Troponin-T,
    C-peptide, insulin), serum tests (CRP-HS, lipid panel, glucose, kidney and liver function markers),
    whole blood tests (HbA1c), and urine tests (creatinine, albumin, other markers).

    '
- id: aireadi:acquisition:6
  name: Electrocardiogram (ECG)
  description: '12-lead ECG data collected using Philips Pagewriter TC30 Cardiograph during study visit
    with participant sitting in reclining chair or lying supine at recorded position (0 degrees, 30 degrees,
    60 degrees, or 90 degrees relative to supine).

    '
- id: aireadi:acquisition:7
  name: Cognitive function testing
  description: 'Montreal Cognitive Assessment (MoCA) administered electronically on iPad using MoCA Duo
    Application (total score, section subscores, Memory Index Score, task completion times). Total possible
    score is 30, with higher numbers representing better performance.

    '
- id: aireadi:acquisition:8
  name: Peripheral neuropathy assessment
  description: 'Monofilament testing performed to assess peripheral neuropathy using 10g filament at three
    locations on each foot (10 times per location) with participant''s eyes closed, responding yes/no
    whether they feel the filament.

    '
- id: aireadi:acquisition:9
  name: Continuous glucose monitoring
  description: 'Dexcom G6 Continuous Glucose Monitor capturing blood glucose measurements (mg/dL) every
    5 minutes for 10 days. Data exported in CSV format.

    '
- id: aireadi:acquisition:10
  name: Physical activity monitoring
  description: 'Garmin VivoSmart 5 wearable device capturing number of steps, heart rate, sleep duration
    (circadian and diurnal rhythm), and oxygen saturation for 10 days. Data exported in .FIT format and
    converted to mHealth standard.

    '
- id: aireadi:acquisition:11
  name: Environmental monitoring
  description: 'Custom-designed environmental sensor (Karalis Johnson Retina Center, UW) capturing ambient
    temperature, relative humidity, nitrogen oxides (NO and NO2), volatile organic compounds, particulate
    matter (PM1.0, PM2.5, PM4, PM10), and multi-spectral light intensity (11 measurements) for 10 days.
    Data in CSV format.

    '
- id: aireadi:acquisition:12
  name: Biospecimen collection
  description: 'Non-fasting blood (53 mL) and urine collection. Processing includes whole blood for CBC,
    EDTA plasma, serum, buffy coats for genomic DNA extraction, peripheral blood mononuclear cells (PBMCs)
    from CPT tubes, and PAXgene RNA vacutainers. Samples stored at UAB CCTS biorepository at appropriate
    temperatures.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Variable Metadata with Identifiers Defined
evidenceinstances, subpopulations, sensitive_elements, confidential_elements all provide structured metadata with IDs (e.g., aireadi:instance:1, aireadi:subpop:1). acquisition_methods detail 12 data domains with structured descriptions.
qualityExtensive structured metadata for instances, subpopulations, data domains. Each element has ID, name, description. RxNorm codes mentioned for medications.
semanticVariable-level metadata rich: 12 acquisition methods, 8 subpopulations, 4 sensitive element categories. Identifiers follow URI pattern (aireadi:*).
✓ 1/1 R10 5.Data Composition and Structure Variable-Level Metadata and Tabular Flag
evidenceis_tabular: false (multimodal dataset). acquisition_methods: 12 structured entries detailing data domains (surveys, physical measurements, retinal imaging, visual function, clinical labs, ECG, cognitive testing, peripheral neuropathy, CGM, physical activity, environmental, biospecimens).
qualityis_tabular=false appropriate for multimodal data. 12 data domains documented with methods, instruments, formats, and measurement details.
semanticTabular flag correct (multimodal, not single table). Variable metadata extensive: 12 acquisition methods cover >10 data domains with instrument/method specifics.
✓ 1/1 R10 6.Data Provenance and Version Tracking Provenance and Source Derivation Documented
evidencecreators: 20 investigators with institutions and roles. funders: NIH Common Fund Bridge2AI grant OT2OD032644. collection_mechanisms, acquisition_methods, data_collectors describe data sources (3 collection sites, EHR screening, in-person visits, wearables, biospecimens).
qualityProvenance extensive: 20 creators with affiliations, NIH funding source, 3 collection sites (Birmingham, San Diego, Seattle), data collection procedures, instruments.
semanticProvenance chain complete: funding (NIH OT2OD032644) → creators (20 investigators, 3 institutions) → collection sites → data collectors → instruments. Traceable.
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Data Acquisition Methods Listed
evidenceacquisition_methods: 12 structured entries with instruments/devices (REDCap, Optomed Aurora IQ, iCare EIDON, Heidelberg Spectralis/FLIO, Topcon Maestro2/Triton, Zeiss Cirrus 5000, Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30, MoCA Duo iPad app, custom environmental sensor).
qualityExceptional instrument detail: specific models for retinal imaging (7 devices), ECG (Philips TC30), CGM (Dexcom G6), wearable (Garmin VivoSmart 5), cognitive testing (MoCA Duo), environmental (custom sensor). Measurement protocols described.
semanticAcquisition methods highly specific: device models, measurement conditions (e.g., dilated pupils for imaging, supine position for ECG), output formats (DICOM, CSV, FIT, XML). Replicable.
4/5 R20 Q10 (Metadata Quality & Content) Interoperability and Standardization
levelStandard formats + partial schema/ontology compliance
evidencedistribution_formats: 'DICOM for imaging, CSV for tabular, mHealth standard for wearable, XML for ECG'. preprocessing_strategies[4]: 'Data mapped to Observational Medical Outcomes Partnership Common Data Model for clinical data and DICOM format for retinal imaging'. acquisition_methods mention RxNorm codes for medications, ICD-10 codes for diagnoses. NOTE: D4D-core schema does not include 'conforms_to' or 'conforms_to_schema' fields present in full D4D schema
qualityStrong use of standard formats (DICOM, mHealth, OMOP CDM) and ontologies (RxNorm, ICD-10). However, formal schema conformance fields not present in D4D-core subset.
correctnessDICOM, mHealth, OMOP CDM, RxNorm, ICD-10 are all appropriate medical data standards. Usage aligns with data types.
consistencyStandard format usage (DICOM for imaging, OMOP CDM for clinical) aligns with acquisition methods and distribution formats
3/5 R20 Q11 (Technical Documentation) Tool and Software Transparency
levelStrategies documented but limited software tool details
evidencepreprocessing_strategies: 5 strategies including 'Data standardization and harmonization', 'Image format conversion', 'Biospecimen processing', 'Quality control and validation', 'Data mapping to standards'. cleaning_strategies: 1 strategy 'Multi-site harmonization'. acquisition_methods mention specific devices (Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30, multiple retinal imaging devices) and platforms (REDCap, MoCA Duo Application). NOTE: D4D-core schema does not include 'software_and_tools' or 'labeling_strategies' fields present in full D4D schema
qualityGood documentation of preprocessing and cleaning strategies with specific device/platform mentions. However, software tool details (versions, URLs) are limited and labeling strategies field not present in D4D-core subset.
correctnessDevices and platforms mentioned (REDCap, Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30) are appropriate for described data types
consistencyPreprocessing strategies (format conversion, harmonization) align with multi-site data collection and multiple acquisition devices
5/5 R20 Q12 (Technical Documentation) Collection Protocol Clarity
levelFull collection protocol with methods, collectors, and timeframes
evidencecollection_mechanisms: 5 mechanisms including 'In-person data collection visits', 'Electronic health record screening', 'Wave-based recruitment', 'Home-based wearable monitoring', 'Biospecimen collection and biobanking'. acquisition_methods: 12 methods covering survey, physical measurements, retinal imaging, visual function, clinical lab, ECG, cognitive function, peripheral neuropathy, CGM, physical activity, environmental monitoring, biospecimens. data_collectors: 'Trained and certified study coordinators at three sites (UAB, UCSD, UW) following Manual of Procedures with certification process'. collection_timeframes: 'Enrollment July 18, 2023 to November 30, 2026 with periodic data releases (pilot May 2024, v1.0.0 Nov 2024)'
qualityComprehensive collection protocol documentation with detailed mechanisms, methods, collector training procedures, and timeframes. Covers all aspects of data collection from recruitment to biobanking.
correctnessCollection timeline (July 2023 - Nov 2026) is plausible for 4,000-participant multi-site study. Training/certification requirements appropriate for clinical research.
consistencyCollection mechanisms and acquisition methods align with data modalities described in keywords and purposes. Timeframes align with distribution dates and funding period
collection_timeframes
collection_timeframes:
- id: aireadi:timeframe:1
  name: Study enrollment period
  description: 'Enrollment began July 18, 2023 (pilot phase) and continues until November 30, 2026. Each
    participant completes a single study encounter. Data released periodically: pilot data released May
    2024; v1.0.0 data through July 31, 2024 released November 2024; subsequent versions (v2.0.0, v3.0.0)
    released with additional participants. Final dataset expected after completion of 4,000 participant
    enrollment by November 2026.

    '
✓ 1/1 R10 5.Data Composition and Structure Number of Instances or Samples Reported
evidenceinstances: Target enrollment 4,000 people. subpopulations: approximately 1,000 participants per group (8 groups). collection_timeframes: enrollment began July 18, 2023, continues to November 30, 2026. distribution_dates: v1.0.0 through July 31, 2024.
qualityTarget N=4,000 clearly stated. Interim releases documented (pilot May 2024, v1.0.0 through July 2024). Subpopulation targets ~1,000 each.
semanticInstance counts specific and consistent: 4,000 total = 8 subpops × ~1,000 each. Temporal context provided (enrollment period, release dates).
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Collection Mechanisms and Settings Described
evidencecollection_mechanisms: 5 structured entries (in-person visits at 3 sites lasting 2.5-4 hours, EHR screening with ICD-10 codes, wave-based recruitment, home wearable monitoring 10 days, biospecimen collection/biobanking). collection_timeframes: July 18, 2023 to November 30, 2026.
qualityCollection settings detailed: 3 sites (Birmingham, San Diego, Seattle), visit duration (2.5-4 hours), recruitment method (EHR screening with ICD-10 codes E11.X, R73.09), home monitoring period (10 days).
semanticCollection mechanisms replicable: sites specified, duration quantified, recruitment strategy (EHR + ICD-10 codes), timeline documented. High technical transparency.
5/5 R20 Q12 (Technical Documentation) Collection Protocol Clarity
levelFull collection protocol with methods, collectors, and timeframes
evidencecollection_mechanisms: 5 mechanisms including 'In-person data collection visits', 'Electronic health record screening', 'Wave-based recruitment', 'Home-based wearable monitoring', 'Biospecimen collection and biobanking'. acquisition_methods: 12 methods covering survey, physical measurements, retinal imaging, visual function, clinical lab, ECG, cognitive function, peripheral neuropathy, CGM, physical activity, environmental monitoring, biospecimens. data_collectors: 'Trained and certified study coordinators at three sites (UAB, UCSD, UW) following Manual of Procedures with certification process'. collection_timeframes: 'Enrollment July 18, 2023 to November 30, 2026 with periodic data releases (pilot May 2024, v1.0.0 Nov 2024)'
qualityComprehensive collection protocol documentation with detailed mechanisms, methods, collector training procedures, and timeframes. Covers all aspects of data collection from recruitment to biobanking.
correctnessCollection timeline (July 2023 - Nov 2026) is plausible for 4,000-participant multi-site study. Training/certification requirements appropriate for clinical research.
consistencyCollection mechanisms and acquisition methods align with data modalities described in keywords and purposes. Timeframes align with distribution dates and funding period
data_collectors
data_collectors:
- id: aireadi:datacollector:1
  name: AI-READI Study Coordinators
  description: 'Trained and certified study coordinators at three data collection sites (University of
    Alabama at Birmingham, University of California San Diego, University of Washington). Coordinators
    follow a standardized Manual of Procedures (MOP) and complete a certification process before enrolling
    participants. Practice subjects required before beginning participant enrollment.

    '
✓ 1/1 R10 6.Data Provenance and Version Tracking Provenance and Source Derivation Documented
evidencecreators: 20 investigators with institutions and roles. funders: NIH Common Fund Bridge2AI grant OT2OD032644. collection_mechanisms, acquisition_methods, data_collectors describe data sources (3 collection sites, EHR screening, in-person visits, wearables, biospecimens).
qualityProvenance extensive: 20 creators with affiliations, NIH funding source, 3 collection sites (Birmingham, San Diego, Seattle), data collection procedures, instruments.
semanticProvenance chain complete: funding (NIH OT2OD032644) → creators (20 investigators, 3 institutions) → collection sites → data collectors → instruments. Traceable.
5/5 R20 Q12 (Technical Documentation) Collection Protocol Clarity
levelFull collection protocol with methods, collectors, and timeframes
evidencecollection_mechanisms: 5 mechanisms including 'In-person data collection visits', 'Electronic health record screening', 'Wave-based recruitment', 'Home-based wearable monitoring', 'Biospecimen collection and biobanking'. acquisition_methods: 12 methods covering survey, physical measurements, retinal imaging, visual function, clinical lab, ECG, cognitive function, peripheral neuropathy, CGM, physical activity, environmental monitoring, biospecimens. data_collectors: 'Trained and certified study coordinators at three sites (UAB, UCSD, UW) following Manual of Procedures with certification process'. collection_timeframes: 'Enrollment July 18, 2023 to November 30, 2026 with periodic data releases (pilot May 2024, v1.0.0 Nov 2024)'
qualityComprehensive collection protocol documentation with detailed mechanisms, methods, collector training procedures, and timeframes. Covers all aspects of data collection from recruitment to biobanking.
correctnessCollection timeline (July 2023 - Nov 2026) is plausible for 4,000-participant multi-site study. Training/certification requirements appropriate for clinical research.
consistencyCollection mechanisms and acquisition methods align with data modalities described in keywords and purposes. Timeframes align with distribution dates and funding period
sampling_strategies
sampling_strategies:
- id: aireadi:sampling:1
  name: Triple-balanced recruitment
  description: 'Recruitment sampling procedures aimed at achieving approximately equal distribution of
    participants across three dimensions: (1) race/ethnicity (Asian, Black, Hispanic, White), (2) T2DM
    severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled),
    and (3) biological sex (male, female). This balanced design is critical for developing unbiased machine
    learning models.

    '
  is_sample: true
  is_random: false
  is_representative: false
  why_not_representative:
  - 'The triple-balanced design intentionally over-samples racial/ethnic minority groups and specific
    diabetes severity groups relative to their population prevalence, to enable unbiased AI/ML model development.
    Participants are volunteers, introducing volunteer selection bias that may limit generalizability
    to non-volunteer populations.

    '
  strategies:
  - Targeted recruitment to balance demographics across race/ethnicity, sex, and diabetes severity
  - Wave-based recruitment with monitoring and adjustment through under- and oversampling
  - Recruitment from electronic health records screening using ICD-10 codes (E11.X for T2DM, R73.09 for
    pre-diabetes)
  - Personalized invitation letters and emails with REDCap recruitment interface
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: is_representative=false with why_not_representative explaining triple-balanced design oversamples minorities, volunteer selection bias. discouraged_uses: early versions may not have achieved balance. preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, REDCap validation).
qualitySampling limitations explicitly documented (non-representative by design, volunteer bias). Quality control procedures detailed. Early version limitations disclosed.
semanticData quality transparency high: sampling biases acknowledged, QC procedures described, version-specific limitations disclosed. Semantically honest.
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Known Limitations Documented
evidencesampling_strategies.why_not_representative: Triple-balanced design oversamples minorities, volunteer selection bias limits generalizability. discouraged_uses: early versions may not have achieved balance, clinical use without validation, re-identification attempts. retention_limit: finite biospecimen samples.
qualityLimitations documented: non-representative sampling (intentional), volunteer bias, early version incompleteness, finite biospecimens. Limitations spread across multiple fields (sampling_strategies, discouraged_uses, retention_limit).
semanticLimitations semantically appropriate: sampling bias acknowledged (triple-balanced design), volunteer bias noted, version-specific limitations disclosed, resource constraints (biospecimens) mentioned.
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Systematic Biases Identified and Described
evidencesampling_strategies.why_not_representative: volunteer selection bias may limit generalizability to non-volunteer populations. Triple-balanced design oversamples minorities relative to population prevalence. discouraged_uses: early versions may not have balanced distribution.
qualitySystematic biases identified: (1) volunteer selection bias (non-random), (2) demographic oversampling (intentional for fairness), (3) temporal bias (early versions incomplete). Biases explained with scientific rationale.
semanticBias documentation semantically honest: volunteer bias acknowledged, oversampling justified (unbiased ML models), temporal incompleteness disclosed. Fairness-aware design.
5/5 R20 Q15 (Technical Documentation) Human Subject Representation
levelDetailed demographics and inclusion/exclusion criteria
evidenceinstances: 'Individual participants aged 40+ with and without T2DM. Target enrollment 4,000 people, triple-balanced by race/ethnicity (Asian, Black, Hispanic, White), T2DM severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled), biological sex (male, female). Must speak/read/understand English. Exclusion: pregnancy, type 1 diabetes'. subpopulations: 8 subgroups (4 race/ethnicity groups, 4 diabetes severity groups) each with target ~1,000 participants (25% of sample). sampling_strategies: describes triple-balanced recruitment with rationale for non-representativeness
qualityExceptional human subject representation with detailed demographics, inclusion/exclusion criteria, and subpopulation breakdowns. Triple-balanced design explicitly documented with targets and rationale.
correctnessAge criterion (40+) is appropriate for T2DM study. Triple-balanced design (32 groups = 4 race × 4 severity × 2 sex) is mathematically consistent with 4,000 target.
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count. Sampling strategy rationale aligns with purposes (bias mitigation, health equity)
preprocessing_strategies
preprocessing_strategies:
- id: aireadi:preproc:1
  name: Data standardization and harmonization
  description: 'Data harmonized across three collection sites (Birmingham, San Diego, Seattle) using standardized
    operating procedures, common protocols, and centralized data management through REDCap. Ensures consistency
    and comparability across sites.

    '
- id: aireadi:preproc:2
  name: Image format conversion
  description: 'Retinal imaging data converted from proprietary formats (.fda, .sdt) to DICOM standard
    for the dataset. Wearable device data converted from .FIT format to mHealth standard.

    '
- id: aireadi:preproc:3
  name: Biospecimen processing
  description: 'Standardized local processing for plasma, serum, and buffy coats using consistent protocols.
    Centralized processing of CPT tubes for PBMC isolation at UAB CCTS. Batch shipping of biospecimens
    for central clinical lab analyses.

    '
- id: aireadi:preproc:4
  name: Quality control and validation
  description: 'Multiple quality control measures including standardized training of study coordinators,
    equipment calibration, duplicate measurements, and data validation checks in REDCap system. Data managers
    at each site oversee quality control before uploading to FAIRhub.

    '
- id: aireadi:preproc:5
  name: Data mapping to standards
  description: 'All data mapped to applicable data standard formats such as Observational Medical Outcomes
    Partnership Common Data Model for clinical data and DICOM format for retinal imaging. Data stored
    and shared as AI-ready enabling immediate AI/ML research without reformatting.

    '
✗ 0/1 R10 10.Cross-Platform and Community Integration Community Standards or Schema Conformance
evidencepreprocessing_strategies mention mapping to OMOP Common Data Model for clinical data and DICOM for imaging. No 'conforms_to' field in D4D-core schema.
qualityOMOP CDM and DICOM mentioned in preprocessing context but no formal 'conforms_to' declaration. D4D-core may not include schema conformance field.
semanticStandards referenced (OMOP, DICOM, mHealth) but not formalized in 'conforms_to' field. Field not part of D4D-core exchange layer.
✓ 1/1 R10 3.Data Reuse and Interoperability Data Formats Are Standardized (encoding, format)
evidencedistribution_formats: DICOM (ISO 12052 standard), mHealth standard, CSV, XML. preprocessing_strategies mention mapping to OMOP Common Data Model for clinical data.
qualityMultiple standardized formats: DICOM (ISO medical imaging), mHealth (wearable interop), CSV/XML (generic). OMOP CDM mentioned for clinical data.
semanticFormats follow recognized standards: DICOM (medical imaging), mHealth (wearable), OMOP CDM (clinical observational data). Interoperability-ready.
✗ 0/1 R10 3.Data Reuse and Interoperability Schema or Ontology Conformance Stated
evidenceNo 'conforms_to' field in D4D-core schema. preprocessing_strategies mention 'mapping to applicable data standard formats such as Observational Medical Outcomes Partnership Common Data Model' but no explicit conforms_to declaration.
qualityD4D-core schema may not include 'conforms_to' field. OMOP CDM mentioned in preprocessing but not formalized as schema conformance.
semanticField not part of D4D-core exchange layer. OMOP CDM reference exists but not in structured conformance declaration.
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: is_representative=false with why_not_representative explaining triple-balanced design oversamples minorities, volunteer selection bias. discouraged_uses: early versions may not have achieved balance. preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, REDCap validation).
qualitySampling limitations explicitly documented (non-representative by design, volunteer bias). Quality control procedures detailed. Early version limitations disclosed.
semanticData quality transparency high: sampling biases acknowledged, QC procedures described, version-specific limitations disclosed. Semantically honest.
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Preprocessing, Cleaning, and Labeling Strategies
evidencepreprocessing_strategies: 5 entries (data standardization/harmonization across sites, image format conversion DICOM, wearable FIT→mHealth conversion, biospecimen processing protocols, quality control). cleaning_strategies: multi-site harmonization. No labeling_strategies field (may not be in D4D-core).
qualityPreprocessing steps documented: format conversions (proprietary→DICOM, FIT→mHealth), harmonization across sites, QC measures (training, calibration, duplicate measurements, REDCap validation). No labeling strategy (dataset is not pre-labeled for ML tasks).
semanticPreprocessing appropriate for multimodal data: format standardization, quality control, multi-site harmonization. Labeling not applicable (this is raw data for downstream labeling by researchers).
✗ 0/1 R10 8.Technical Transparency (Data Collection and Processing) External Standards and Resources Referenced
evidenceexternal_resources: 9 entries (project website, documentation, FAIRhub portal, Bridge2AI, NIH RePORTER, Zenodo, BMJ Open protocol DOI, Nature Metabolism commentary DOI). preprocessing_strategies mention OMOP CDM. No 'conforms_to' field for formal standards.
qualityExternal publications documented (BMJ Open protocol https://doi.org/10.1136/bmjopen-2024-097449, Nature Metabolism https://doi.org/10.1038/s42255-024-01165-x). OMOP CDM mentioned but not formalized. Standards like DICOM, mHealth, HIPAA referenced in descriptions but not in structured standards field.
semanticPublications provide external documentation (BMJ Open protocol, Nature Metabolism). Standards mentioned (OMOP, DICOM, mHealth, HIPAA) but not in structured 'conforms_to' field (may not be part of D4D-core).
✗ 0/1 R10 9.Dataset Evaluation and Limitations Disclosure Data Anomalies and Quality Issues Noted
evidencepreprocessing_strategies mention quality control measures (equipment calibration, duplicate measurements, REDCap validation) but no 'anomalies' field in D4D-core schema. No specific data quality issues or anomalies documented.
qualityD4D-core may not include 'anomalies' field. Quality control procedures described (calibration, validation) but no known anomalies reported.
semanticField not part of D4D-core schema. QC procedures suggest proactive anomaly prevention but no post-collection anomalies documented.
4/5 R20 Q10 (Metadata Quality & Content) Interoperability and Standardization
levelStandard formats + partial schema/ontology compliance
evidencedistribution_formats: 'DICOM for imaging, CSV for tabular, mHealth standard for wearable, XML for ECG'. preprocessing_strategies[4]: 'Data mapped to Observational Medical Outcomes Partnership Common Data Model for clinical data and DICOM format for retinal imaging'. acquisition_methods mention RxNorm codes for medications, ICD-10 codes for diagnoses. NOTE: D4D-core schema does not include 'conforms_to' or 'conforms_to_schema' fields present in full D4D schema
qualityStrong use of standard formats (DICOM, mHealth, OMOP CDM) and ontologies (RxNorm, ICD-10). However, formal schema conformance fields not present in D4D-core subset.
correctnessDICOM, mHealth, OMOP CDM, RxNorm, ICD-10 are all appropriate medical data standards. Usage aligns with data types.
consistencyStandard format usage (DICOM for imaging, OMOP CDM for clinical) aligns with acquisition methods and distribution formats
3/5 R20 Q11 (Technical Documentation) Tool and Software Transparency
levelStrategies documented but limited software tool details
evidencepreprocessing_strategies: 5 strategies including 'Data standardization and harmonization', 'Image format conversion', 'Biospecimen processing', 'Quality control and validation', 'Data mapping to standards'. cleaning_strategies: 1 strategy 'Multi-site harmonization'. acquisition_methods mention specific devices (Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30, multiple retinal imaging devices) and platforms (REDCap, MoCA Duo Application). NOTE: D4D-core schema does not include 'software_and_tools' or 'labeling_strategies' fields present in full D4D schema
qualityGood documentation of preprocessing and cleaning strategies with specific device/platform mentions. However, software tool details (versions, URLs) are limited and labeling strategies field not present in D4D-core subset.
correctnessDevices and platforms mentioned (REDCap, Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30) are appropriate for described data types
consistencyPreprocessing strategies (format conversion, harmonization) align with multi-site data collection and multiple acquisition devices
cleaning_strategies
cleaning_strategies:
- id: aireadi:cleaning:1
  name: Multi-site harmonization
  description: 'Standardized protocols and procedures across all three data collection sites ensure data
    consistency and quality. Common equipment, training, and REDCap data management system used to maintain
    FAIR principles compliance.

    '
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Preprocessing, Cleaning, and Labeling Strategies
evidencepreprocessing_strategies: 5 entries (data standardization/harmonization across sites, image format conversion DICOM, wearable FIT→mHealth conversion, biospecimen processing protocols, quality control). cleaning_strategies: multi-site harmonization. No labeling_strategies field (may not be in D4D-core).
qualityPreprocessing steps documented: format conversions (proprietary→DICOM, FIT→mHealth), harmonization across sites, QC measures (training, calibration, duplicate measurements, REDCap validation). No labeling strategy (dataset is not pre-labeled for ML tasks).
semanticPreprocessing appropriate for multimodal data: format standardization, quality control, multi-site harmonization. Labeling not applicable (this is raw data for downstream labeling by researchers).
3/5 R20 Q11 (Technical Documentation) Tool and Software Transparency
levelStrategies documented but limited software tool details
evidencepreprocessing_strategies: 5 strategies including 'Data standardization and harmonization', 'Image format conversion', 'Biospecimen processing', 'Quality control and validation', 'Data mapping to standards'. cleaning_strategies: 1 strategy 'Multi-site harmonization'. acquisition_methods mention specific devices (Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30, multiple retinal imaging devices) and platforms (REDCap, MoCA Duo Application). NOTE: D4D-core schema does not include 'software_and_tools' or 'labeling_strategies' fields present in full D4D schema
qualityGood documentation of preprocessing and cleaning strategies with specific device/platform mentions. However, software tool details (versions, URLs) are limited and labeling strategies field not present in D4D-core subset.
correctnessDevices and platforms mentioned (REDCap, Dexcom G6, Garmin VivoSmart 5, Philips Pagewriter TC30) are appropriate for described data types
consistencyPreprocessing strategies (format conversion, harmonization) align with multi-site data collection and multiple acquisition devices
intended_uses
intended_uses:
- id: aireadi:use:1
  name: AI/ML model development for T2DM
  description: 'Primary intended use is development and training of artificial intelligence and machine
    learning models to study Type 2 Diabetes Mellitus, disease trajectories, and salutogenesis (pathways
    to health resilience). Designed for pseudotime manifold analysis to predict disease progression.

    '
- id: aireadi:use:2
  name: Multi-modal T2DM research
  description: 'Research leveraging multiple data domains (imaging, clinical, genomic, wearable, environmental,
    survey) to understand complex interactions and relationships in T2DM progression and management.

    '
- id: aireadi:use:3
  name: Health equity research
  description: 'Studies examining racial and ethnic disparities in T2DM outcomes, social determinants
    of health effects, and development of equitable AI/ML applications for diverse populations.

    '
- id: aireadi:use:4
  name: Biomarker discovery
  description: 'Discovery of novel biomarkers for T2DM progression, complications, and salutogenesis using
    biospecimens from the biorepository.

    '
- id: aireadi:use:5
  name: Model dataset for AI-ready data standards
  description: 'Use as an exemplar for future AI-ready medical dataset development, demonstrating best
    practices in data collection, preparation, sharing, and ethical governance.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Use Guidance Provided (intended, prohibited uses)
evidenceintended_uses: 5 entries (AI/ML model development, multi-modal research, health equity, biomarker discovery, model dataset). discouraged_uses: 3 entries (early versions limitations, clinical validation, re-identification). prohibited_uses: 3 entries (clinical treatment decisions, re-identification, sharing with non-licensed parties).
qualityComprehensive use guidance across all three categories (intended, discouraged, prohibited). Ethical boundaries clear (no clinical use, no re-identification).
semanticUse guidance semantically aligned with license (non-commercial, research-only) and data sensitivity (health data prohibits clinical decisions without validation).
discouraged_uses
discouraged_uses:
- id: aireadi:discouraged:1
  name: Uses during ongoing enrollment without awareness of limitations
  description: 'As enrollment is ongoing until November 2026, pilot data releases and periodic updates
    may not have achieved balanced distribution across all groups. Early versions should be used with
    awareness of this limitation.

    '
- id: aireadi:discouraged:2
  name: Clinical decision-making without validation
  description: 'Dataset is for research purposes. Any AI/ML models developed should undergo appropriate
    clinical validation before use in patient care or clinical decision-making.

    '
- id: aireadi:discouraged:3
  name: Re-identification attempts
  description: 'Attempts to re-identify participants from de-identified data violate ethical principles
    and data use agreements. The license explicitly prohibits attempts to identify or contact individual
    data subjects or groups.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Use Guidance Provided (intended, prohibited uses)
evidenceintended_uses: 5 entries (AI/ML model development, multi-modal research, health equity, biomarker discovery, model dataset). discouraged_uses: 3 entries (early versions limitations, clinical validation, re-identification). prohibited_uses: 3 entries (clinical treatment decisions, re-identification, sharing with non-licensed parties).
qualityComprehensive use guidance across all three categories (intended, discouraged, prohibited). Ethical boundaries clear (no clinical use, no re-identification).
semanticUse guidance semantically aligned with license (non-commercial, research-only) and data sensitivity (health data prohibits clinical decisions without validation).
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: is_representative=false with why_not_representative explaining triple-balanced design oversamples minorities, volunteer selection bias. discouraged_uses: early versions may not have achieved balance. preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, REDCap validation).
qualitySampling limitations explicitly documented (non-representative by design, volunteer bias). Quality control procedures detailed. Early version limitations disclosed.
semanticData quality transparency high: sampling biases acknowledged, QC procedures described, version-specific limitations disclosed. Semantically honest.
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Known Limitations Documented
evidencesampling_strategies.why_not_representative: Triple-balanced design oversamples minorities, volunteer selection bias limits generalizability. discouraged_uses: early versions may not have achieved balance, clinical use without validation, re-identification attempts. retention_limit: finite biospecimen samples.
qualityLimitations documented: non-representative sampling (intentional), volunteer bias, early version incompleteness, finite biospecimens. Limitations spread across multiple fields (sampling_strategies, discouraged_uses, retention_limit).
semanticLimitations semantically appropriate: sampling bias acknowledged (triple-balanced design), volunteer bias noted, version-specific limitations disclosed, resource constraints (biospecimens) mentioned.
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Systematic Biases Identified and Described
evidencesampling_strategies.why_not_representative: volunteer selection bias may limit generalizability to non-volunteer populations. Triple-balanced design oversamples minorities relative to population prevalence. discouraged_uses: early versions may not have balanced distribution.
qualitySystematic biases identified: (1) volunteer selection bias (non-random), (2) demographic oversampling (intentional for fairness), (3) temporal bias (early versions incomplete). Biases explained with scientific rationale.
semanticBias documentation semantically honest: volunteer bias acknowledged, oversampling justified (unbiased ML models), temporal incompleteness disclosed. Fairness-aware design.
prohibited_uses
prohibited_uses:
- id: aireadi:prohibited:1
  name: Clinical treatment decisions
  description: 'The AI-READI Data License Agreement explicitly prohibits using the data to make clinical
    treatment decisions for individual patients. The dataset is intended for research purposes only and
    has not been validated for direct clinical use.

    '
- id: aireadi:prohibited:2
  name: Re-identification of participants
  description: 'Attempting to re-identify individual data subjects or groups from the de-identified public
    dataset is explicitly prohibited by the data use agreement and violates ethical principles.

    '
- id: aireadi:prohibited:3
  name: Sharing with non-licensed parties
  description: 'Sharing data with parties who have not entered into the applicable license agreement (CC
    BY-NC 4.0 for public data; separate data use agreement for controlled access data) is prohibited.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Use Guidance Provided (intended, prohibited uses)
evidenceintended_uses: 5 entries (AI/ML model development, multi-modal research, health equity, biomarker discovery, model dataset). discouraged_uses: 3 entries (early versions limitations, clinical validation, re-identification). prohibited_uses: 3 entries (clinical treatment decisions, re-identification, sharing with non-licensed parties).
qualityComprehensive use guidance across all three categories (intended, discouraged, prohibited). Ethical boundaries clear (no clinical use, no re-identification).
semanticUse guidance semantically aligned with license (non-commercial, research-only) and data sensitivity (health data prohibits clinical decisions without validation).
distribution_formats
distribution_formats:
- id: aireadi:format:1
  name: DICOM for imaging
  description: 'Retinal imaging data distributed in DICOM format (converted from proprietary .fda and
    .sdt formats for standardization).

    '
- id: aireadi:format:2
  name: CSV for tabular and time-series data
  description: 'Survey data, clinical lab results, continuous glucose monitoring, environmental sensor
    data, and other tabular/time-series data provided in CSV format.

    '
- id: aireadi:format:3
  name: mHealth standard for wearable data
  description: 'Physical activity monitoring data (from Garmin VivoSmart 5) converted from .FIT format
    to mHealth standard for interoperability.

    '
- id: aireadi:format:4
  name: XML for ECG data
  description: 'Electrocardiogram data from Philips Pagewriter TC30 exported in .xml format.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Distribution Formats and File Types Specified
evidencedistribution_formats: DICOM (imaging), CSV (tabular/time-series), mHealth standard (wearable), XML (ECG). distributions: ZIP archives. media_type: application/zip
qualityFour data format types mapped to content (DICOM for imaging, CSV for tabular, mHealth for wearables, XML for ECG). Container format ZIP with MIME type.
semanticFormats semantically appropriate: DICOM (medical imaging standard), mHealth (wearable interop), CSV (tabular), XML (ECG). MIME type correct.
✓ 1/1 R10 3.Data Reuse and Interoperability Data Formats Are Standardized (encoding, format)
evidencedistribution_formats: DICOM (ISO 12052 standard), mHealth standard, CSV, XML. preprocessing_strategies mention mapping to OMOP Common Data Model for clinical data.
qualityMultiple standardized formats: DICOM (ISO medical imaging), mHealth (wearable interop), CSV/XML (generic). OMOP CDM mentioned for clinical data.
semanticFormats follow recognized standards: DICOM (medical imaging), mHealth (wearable), OMOP CDM (clinical observational data). Interoperability-ready.
4/5 R20 Q10 (Metadata Quality & Content) Interoperability and Standardization
levelStandard formats + partial schema/ontology compliance
evidencedistribution_formats: 'DICOM for imaging, CSV for tabular, mHealth standard for wearable, XML for ECG'. preprocessing_strategies[4]: 'Data mapped to Observational Medical Outcomes Partnership Common Data Model for clinical data and DICOM format for retinal imaging'. acquisition_methods mention RxNorm codes for medications, ICD-10 codes for diagnoses. NOTE: D4D-core schema does not include 'conforms_to' or 'conforms_to_schema' fields present in full D4D schema
qualityStrong use of standard formats (DICOM, mHealth, OMOP CDM) and ontologies (RxNorm, ICD-10). However, formal schema conformance fields not present in D4D-core subset.
correctnessDICOM, mHealth, OMOP CDM, RxNorm, ICD-10 are all appropriate medical data standards. Usage aligns with data types.
consistencyStandard format usage (DICOM for imaging, OMOP CDM for clinical) aligns with acquisition methods and distribution formats
5/5 R20 Q4 (Structural Completeness) File Enumeration and Type Variety
level>3 file types
evidencedistribution_formats: 4 formats (DICOM for imaging, CSV for tabular/time-series, mHealth standard for wearable, XML for ECG). distributions: 2 distributions (public access ZIP, controlled access ZIP) with media_type: application/zip
qualityExcellent file type variety with 4 distinct standard formats appropriate for multimodal medical dataset.
correctnessFile formats (DICOM, CSV, mHealth, XML) are standard and appropriate for medical data types
consistencyDistribution formats align with acquisition methods (retinal imaging→DICOM, CGM→CSV, wearables→mHealth, ECG→XML)
distribution_dates
distribution_dates:
- id: aireadi:distdate:1
  name: Pilot data release
  description: Pilot data released May 2024 as an early access release.
- id: aireadi:distdate:2
  name: v1.0.0 release
  description: Version 1.0.0 data (through July 31, 2024) released November 2024.
- id: aireadi:distdate:3
  name: v2.0.0 and v3.0.0 releases
  description: Versions 2.0.0 and 3.0.0 released with additional participants following v1.0.0.
- id: aireadi:distdate:4
  name: Final dataset release
  description: Final dataset expected after completion of 4,000 participant enrollment by November 2026.
✓ 1/1 R10 5.Data Composition and Structure Number of Instances or Samples Reported
evidenceinstances: Target enrollment 4,000 people. subpopulations: approximately 1,000 participants per group (8 groups). collection_timeframes: enrollment began July 18, 2023, continues to November 30, 2026. distribution_dates: v1.0.0 through July 31, 2024.
qualityTarget N=4,000 clearly stated. Interim releases documented (pilot May 2024, v1.0.0 through July 2024). Subpopulation targets ~1,000 each.
semanticInstance counts specific and consistent: 4,000 total = 8 subpops × ~1,000 each. Temporal context provided (enrollment period, release dates).
✓ 1/1 R10 6.Data Provenance and Version Tracking Dataset Version Number Provided
evidencedistribution_dates: pilot (May 2024), v1.0.0 (November 2024, data through July 31, 2024), v2.0.0 and v3.0.0 mentioned, final dataset by November 2026. version_access: semantic versioning (v1.0.0, v2.0.0, v3.0.0).
qualitySemantic versioning used (v1.0.0, v2.0.0, v3.0.0). Multiple versions documented with release dates.
semanticVersion numbering follows semantic versioning convention. Timeline clear: pilot → v1.0.0 (Nov 2024) → v2.0.0, v3.0.0 → final (Nov 2026).
4/5 R20 Q13 (Technical Documentation) Version History Documentation
levelVersion tracking with access and updates, missing errata
evidenceupdates: 'Periodic data releases as enrollment progresses. Pilot data released May 2024. v1.0.0 (through July 31, 2024) released November 2024. Subsequent versions v2.0.0 and v3.0.0 released with additional participants. Final dataset expected after enrollment completion November 2026'. version_access: 'All prior versions maintained with version-specific documentation at https://docs.aireadi.org/. Each version includes changelog and data dictionary. Semantic versioning used (v1.0.0, v2.0.0, v3.0.0)'. distribution_dates: 4 release milestones documented. NOTE: D4D-core schema does not include 'errata' or 'release_notes' fields present in full D4D schema
qualityStrong version tracking with semantic versioning, version access documentation, and planned update schedule. However, errata and release_notes fields not present in D4D-core subset.
correctnessSemantic versioning (v1.0.0, v2.0.0, v3.0.0) follows standard practice. Release schedule aligns with enrollment timeline.
consistencyVersion releases (pilot May 2024, v1.0.0 Nov 2024) align with collection_timeframes and enrollment progress
4/5 R20 Q19 (FAIRness & Accessibility) Data Integrity and Provenance
levelVersion control with timestamps and changelog
evidenceupdates: 'Periodic data releases with version-specific documentation. Pilot data released May 2024. v1.0.0 released November 2024. Subsequent versions v2.0.0, v3.0.0 released with additional participants'. version_access: 'All prior versions maintained with version-specific documentation, changelogs, and data dictionaries at https://docs.aireadi.org/. Semantic versioning used'. distribution_dates: 4 release milestones with dates documented
qualityStrong provenance tracking with versioned releases, timestamps, changelogs, and version-specific documentation. However, detailed provenance metadata (processing lineage) not captured in D4D-core subset.
correctnessRelease dates (May 2024, Nov 2024) are plausible and chronologically ordered. Semantic versioning follows standard conventions.
consistencyVersion release schedule aligns with enrollment timeline and collection_timeframes. Changelog availability mentioned in version_access
1/1 R20 Q5 (Structural Completeness) Data File Size Availability
levelPass
evidenceinstances[0].description: 'Target enrollment is 4,000 people', subpopulations: 8 subgroups with target ~1,000 each, distribution_dates indicate v1.0.0 through July 31, 2024
qualityInstance count metadata clearly documented with target enrollment of 4,000 participants and subpopulation breakdowns.
correctnessSample size (4,000 participants) is plausible for multi-site NIH-funded study
consistencySubpopulation targets (8 groups × ~1,000 = ~4,000) align with overall instance count
distributions
distributions:
- id: aireadi:dist:1
  name: Public access dataset (ZIP archive)
  description: 'Public access subset of the AI-READI dataset available at https://fairhub.io/datasets/2
    upon agreement with the CC BY-NC 4.0 license. Contains non-sensitive data including survey data, blood
    and urine lab results, fitness activity levels, clinical measurements, retinal images, ECG, blood
    glucose levels, and environmental variables. Distributed as a ZIP archive containing DICOM, CSV, mHealth,
    and XML files.

    '
  format: ZIP
  media_type: application/zip
- id: aireadi:dist:2
  name: Controlled access dataset (ZIP archive)
  description: 'Controlled access subset requiring a data use agreement. Contains sensitive data including
    5-digit zip code, sex, race, ethnicity, genetic sequencing data, past health records, medications,
    and traffic and accident reports. Distributed as a ZIP archive containing DICOM, CSV, mHealth, and
    XML files.

    '
  format: ZIP
  media_type: application/zip
✓ 1/1 R10 2.Dataset Access and Retrieval Download URL or Platform Link Available
evidencepage: https://fairhub.io/datasets/2, distributions describe public access at FAIRhub upon CC BY-NC 4.0 agreement
qualityFAIRhub platform URL provided. Access contingent on license agreement (standard practice for health data).
semanticDownload mechanism clear: FAIRhub portal with license agreement. URL valid.
✓ 1/1 R10 2.Dataset Access and Retrieval Distribution Formats and File Types Specified
evidencedistribution_formats: DICOM (imaging), CSV (tabular/time-series), mHealth standard (wearable), XML (ECG). distributions: ZIP archives. media_type: application/zip
qualityFour data format types mapped to content (DICOM for imaging, CSV for tabular, mHealth for wearables, XML for ECG). Container format ZIP with MIME type.
semanticFormats semantically appropriate: DICOM (medical imaging standard), mHealth (wearable interop), CSV (tabular), XML (ECG). MIME type correct.
5/5 R20 Q17 (FAIRness & Accessibility) Accessibility (Access Mechanism)
levelFully defined access path (platform, login, policy)
evidencedistributions[0]: 'Public access subset available at https://fairhub.io/datasets/2 upon agreement with CC BY-NC 4.0 license. Distributed as ZIP archive containing DICOM, CSV, mHealth, and XML files'. distributions[1]: 'Controlled access subset requiring data use agreement. Distributed as ZIP archive'. license_and_use_terms describes two-tier access model with specific requirements and prohibitions
qualityClear access mechanism documentation with two-tier model: public access via license agreement on FAIRhub platform, controlled access via separate data use agreement. Distribution formats and access procedures are well-defined.
correctnessTwo-tier access model (public CC BY-NC 4.0 + controlled DUA) is appropriate for dataset with sensitive genetic/demographic data
consistencyAccess tiers align with sensitive_elements and confidential_elements. Distribution format (ZIP with DICOM/CSV/mHealth/XML) aligns with distribution_formats
5/5 R20 Q4 (Structural Completeness) File Enumeration and Type Variety
level>3 file types
evidencedistribution_formats: 4 formats (DICOM for imaging, CSV for tabular/time-series, mHealth standard for wearable, XML for ECG). distributions: 2 distributions (public access ZIP, controlled access ZIP) with media_type: application/zip
qualityExcellent file type variety with 4 distinct standard formats appropriate for multimodal medical dataset.
correctnessFile formats (DICOM, CSV, mHealth, XML) are standard and appropriate for medical data types
consistencyDistribution formats align with acquisition methods (retinal imaging→DICOM, CGM→CSV, wearables→mHealth, ECG→XML)
maintainers
maintainers:
- id: aireadi:maintainer:1
  name: AI-READI Consortium
  description: 'Multidisciplinary consortium managing dataset maintenance including data collection sites,
    coordinating centers, and data governance committees. Contact through the University of Washington
    as lead institution and data coordination center. Documentation maintained at https://docs.aireadi.org/
    with version-specific guides for each data release.

    '
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2. maintainers: AI-READI Consortium. external_resources: FAIRhub landing page, Zenodo archive https://doi.org/10.5281/zenodo.10642459.
qualityPublished on FAIRhub (recognized FAIR data repository) with additional Zenodo archival copy. Multi-platform distribution.
semanticPlatform recognized: FAIRhub is FAIR-focused repository, Zenodo is general-purpose research data repository (CERN). Dual platform approach ensures preservation.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Creators and Acknowledgements Documented
evidencecreators: 20 investigators with names, roles (Contact PI, Principal Investigator, Co-Investigators), institutions (University of Washington, UAB, UCSD, Stanford, etc.). funders acknowledge Research to Prevent Blindness. maintainers: AI-READI Consortium.
qualityComprehensive creator list: 20 named individuals with institutional affiliations and roles. Consortium acknowledged. Non-NIH funder (Research to Prevent Blindness) mentioned.
semanticCreator metadata rich: names, roles, institutions. Consortium structure (multi-site collaboration) clear. Acknowledgements include non-federal funding (RPB).
updates
updates:
  id: aireadi:updates:1
  name: Periodic data releases
  description: 'Dataset updated periodically as enrollment progresses toward target of 4,000 participants
    by November 2026. Version-specific documentation maintained for each release. Pilot data released
    May 2024. Data through July 31, 2024 released November 2024 as v1.0.0. Subsequent versions v2.0.0
    and v3.0.0 released with additional participants. Final dataset expected after completion of enrollment
    by November 2026.

    '
✓ 1/1 R10 6.Data Provenance and Version Tracking Update Schedule or Frequency Indicated
evidenceupdates: Dataset updated periodically as enrollment progresses toward 4,000 participants by November 2026. Pilot May 2024, v1.0.0 November 2024, v2.0.0 and v3.0.0 released with additional participants, final dataset by November 2026.
qualityUpdate schedule clear: periodic releases tied to enrollment milestones, final dataset November 2026. Pattern established (pilot, v1, v2, v3, final).
semanticUpdate frequency tied to enrollment progress. Timeline explicit: pilot (May 2024) → final (Nov 2026). Predictable release pattern.
4/5 R20 Q13 (Technical Documentation) Version History Documentation
levelVersion tracking with access and updates, missing errata
evidenceupdates: 'Periodic data releases as enrollment progresses. Pilot data released May 2024. v1.0.0 (through July 31, 2024) released November 2024. Subsequent versions v2.0.0 and v3.0.0 released with additional participants. Final dataset expected after enrollment completion November 2026'. version_access: 'All prior versions maintained with version-specific documentation at https://docs.aireadi.org/. Each version includes changelog and data dictionary. Semantic versioning used (v1.0.0, v2.0.0, v3.0.0)'. distribution_dates: 4 release milestones documented. NOTE: D4D-core schema does not include 'errata' or 'release_notes' fields present in full D4D schema
qualityStrong version tracking with semantic versioning, version access documentation, and planned update schedule. However, errata and release_notes fields not present in D4D-core subset.
correctnessSemantic versioning (v1.0.0, v2.0.0, v3.0.0) follows standard practice. Release schedule aligns with enrollment timeline.
consistencyVersion releases (pilot May 2024, v1.0.0 Nov 2024) align with collection_timeframes and enrollment progress
4/5 R20 Q19 (FAIRness & Accessibility) Data Integrity and Provenance
levelVersion control with timestamps and changelog
evidenceupdates: 'Periodic data releases with version-specific documentation. Pilot data released May 2024. v1.0.0 released November 2024. Subsequent versions v2.0.0, v3.0.0 released with additional participants'. version_access: 'All prior versions maintained with version-specific documentation, changelogs, and data dictionaries at https://docs.aireadi.org/. Semantic versioning used'. distribution_dates: 4 release milestones with dates documented
qualityStrong provenance tracking with versioned releases, timestamps, changelogs, and version-specific documentation. However, detailed provenance metadata (processing lineage) not captured in D4D-core subset.
correctnessRelease dates (May 2024, Nov 2024) are plausible and chronologically ordered. Semantic versioning follows standard conventions.
consistencyVersion release schedule aligns with enrollment timeline and collection_timeframes. Changelog availability mentioned in version_access
retention_limit
retention_limit:
  id: aireadi:retention:1
  name: Data and biospecimen retention
  description: 'Digital data maintained according to NIH data sharing policies. Biospecimen retention
    subject to institutional policies and consent agreements at UAB CCTS. Finite number of biospecimen
    samples available for distribution to researchers. Procedures for reviewing and prioritizing biospecimen
    requests are under development.

    '
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Known Limitations Documented
evidencesampling_strategies.why_not_representative: Triple-balanced design oversamples minorities, volunteer selection bias limits generalizability. discouraged_uses: early versions may not have achieved balance, clinical use without validation, re-identification attempts. retention_limit: finite biospecimen samples.
qualityLimitations documented: non-representative sampling (intentional), volunteer bias, early version incompleteness, finite biospecimens. Limitations spread across multiple fields (sampling_strategies, discouraged_uses, retention_limit).
semanticLimitations semantically appropriate: sampling bias acknowledged (triple-balanced design), volunteer bias noted, version-specific limitations disclosed, resource constraints (biospecimens) mentioned.
version_access
version_access:
  id: aireadi:versionaccess:1
  name: Version-specific documentation
  description: 'All prior versions of the dataset are maintained with version-specific documentation at
    https://docs.aireadi.org/. Each version includes a changelog and data dictionary. Dataset versioning
    uses semantic versioning (e.g., v1.0.0, v2.0.0, v3.0.0).

    '
✓ 1/1 R10 6.Data Provenance and Version Tracking Dataset Version Number Provided
evidencedistribution_dates: pilot (May 2024), v1.0.0 (November 2024, data through July 31, 2024), v2.0.0 and v3.0.0 mentioned, final dataset by November 2026. version_access: semantic versioning (v1.0.0, v2.0.0, v3.0.0).
qualitySemantic versioning used (v1.0.0, v2.0.0, v3.0.0). Multiple versions documented with release dates.
semanticVersion numbering follows semantic versioning convention. Timeline clear: pilot → v1.0.0 (Nov 2024) → v2.0.0, v3.0.0 → final (Nov 2026).
✓ 1/1 R10 6.Data Provenance and Version Tracking Version Access Methods Documented
evidenceversion_access: All prior versions maintained with version-specific documentation at https://docs.aireadi.org/. Each version includes changelog and data dictionary.
qualityPrior versions maintained at docs.aireadi.org with version-specific docs, changelogs, and data dictionaries.
semanticVersion access mechanism clear: persistent documentation portal with version-specific guides. Backwards compatibility preserved.
✗ 0/1 R10 6.Data Provenance and Version Tracking Change Descriptions and Errata Provided
evidenceversion_access mentions 'Each version includes a changelog' but no 'errata' field in D4D-core schema. No explicit change descriptions between versions in this file.
qualityChangelog mentioned in version_access but not provided in this D4D file. D4D-core may not include 'errata' field.
semanticField not part of D4D-core schema. External changelogs exist (docs.aireadi.org) but not embedded in D4D metadata.
4/5 R20 Q13 (Technical Documentation) Version History Documentation
levelVersion tracking with access and updates, missing errata
evidenceupdates: 'Periodic data releases as enrollment progresses. Pilot data released May 2024. v1.0.0 (through July 31, 2024) released November 2024. Subsequent versions v2.0.0 and v3.0.0 released with additional participants. Final dataset expected after enrollment completion November 2026'. version_access: 'All prior versions maintained with version-specific documentation at https://docs.aireadi.org/. Each version includes changelog and data dictionary. Semantic versioning used (v1.0.0, v2.0.0, v3.0.0)'. distribution_dates: 4 release milestones documented. NOTE: D4D-core schema does not include 'errata' or 'release_notes' fields present in full D4D schema
qualityStrong version tracking with semantic versioning, version access documentation, and planned update schedule. However, errata and release_notes fields not present in D4D-core subset.
correctnessSemantic versioning (v1.0.0, v2.0.0, v3.0.0) follows standard practice. Release schedule aligns with enrollment timeline.
consistencyVersion releases (pilot May 2024, v1.0.0 Nov 2024) align with collection_timeframes and enrollment progress
4/5 R20 Q19 (FAIRness & Accessibility) Data Integrity and Provenance
levelVersion control with timestamps and changelog
evidenceupdates: 'Periodic data releases with version-specific documentation. Pilot data released May 2024. v1.0.0 released November 2024. Subsequent versions v2.0.0, v3.0.0 released with additional participants'. version_access: 'All prior versions maintained with version-specific documentation, changelogs, and data dictionaries at https://docs.aireadi.org/. Semantic versioning used'. distribution_dates: 4 release milestones with dates documented
qualityStrong provenance tracking with versioned releases, timestamps, changelogs, and version-specific documentation. However, detailed provenance metadata (processing lineage) not captured in D4D-core subset.
correctnessRelease dates (May 2024, Nov 2024) are plausible and chronologically ordered. Semantic versioning follows standard conventions.
consistencyVersion release schedule aligns with enrollment timeline and collection_timeframes. Changelog availability mentioned in version_access
extension_mechanism
extension_mechanism:
  id: aireadi:extension:1
  name: Ancillary study process
  description: 'Researchers may apply to access biospecimens for future ancillary studies according to
    procedures and policies being developed by the AI-READI Consortium. Requests are reviewed and prioritized
    by designated committees.

    '
no field-level feedback matched
ethical_reviews
ethical_reviews:
- id: aireadi:ethics:1
  name: University of Washington IRB Approval
  description: 'Study approved by Institutional Review Board (IRB) of University of Washington (approval
    number STUDY00016228), with reliance agreements from IRBs of University of Alabama at Birmingham and
    University of California, San Diego. Written informed consent provided by all participants.

    '
⚠ low R20 · consistency
issuehuman_subject_research.involves_human_subjects=True and ethical_reviews present with IRB approval details
fieldshuman_subject_research.involves_human_subjects, ethical_reviews
fixConsistency maintained - no action needed
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards IRB or Ethics Review Documented
evidenceethical_reviews: University of Washington IRB approval STUDY00016228 with reliance agreements from UAB and UCSD. human_subject_research.involves_human_subjects: true with IRB details.
qualityIRB approval number (STUDY00016228), lead institution (UW), reliance agreements (UAB, UCSD) all documented. Bioethics guidance and Community Advisory Board mentioned.
semanticConsistency check PASSED: involves_human_subjects=true AND IRB approval documented with specific number and institutions. Semantically complete.
✗ 0/1 R10 9.Dataset Evaluation and Limitations Disclosure Ethical Review Details Including Conflicts
evidenceethical_reviews: IRB approval STUDY00016228 with reliance agreements. human_subject_research: bioethics guidance, Community Advisory Board. No conflicts of interest disclosure in D4D-core schema.
qualityEthics review documented (IRB, bioethics co-investigators, CAB) but no conflict of interest statement. D4D-core may not include conflicts field.
semanticEthics oversight complete (IRB, bioethics, CAB) but conflicts of interest not addressed. Field may not be part of D4D-core schema.
5/5 R20 Q8 (Metadata Quality & Content) Ethical and Privacy Declarations
levelComprehensive (all human subjects protections documented)
evidenceethical_reviews: 'University of Washington IRB Approval STUDY00016228 with reliance agreements from UAB and UCSD'. human_subject_research.involves_human_subjects: true with description of bioethics guidance and Community Advisory Board. informed_consent: 'Written informed consent provided by all participants'. is_deidentified: describes public dataset de-identification and controlled access for sensitive data. at_risk_populations: describes protections for T2DM participants and racial/ethnic minority groups with bioethics oversight and Community Advisory Board
qualityComprehensive ethical documentation covering all major protection areas. IRB approval with institutional details, informed consent process, de-identification procedures, and at-risk population protections are all present.
correctnessIRB approval number STUDY00016228 follows standard format. Reliance agreements appropriate for multi-site study (UAB, UCSD, UW).
consistencyinvolves_human_subjects=true aligns with presence of ethical_reviews, informed_consent, and at_risk_populations. De-identification approach (public vs. controlled access tiers) aligns with sensitive_elements and confidential_elements
human_subject_research
human_subject_research:
  id: aireadi:hsr:1
  name: AI-READI Human Subjects Research
  description: 'Study involves human subjects research with IRB approval and written informed consent
    from all participants. Bioethics guidance integrated throughout study design. Community Advisory Board
    of 11 persons with diversity in race and ethnicity contributes to protocol development. Ethical and
    equitable data collection and management practices implemented across all three data collection sites.
    IRB approval number STUDY00016228 from University of Washington with reliance agreements from University
    of Alabama at Birmingham and University of California San Diego.

    '
  involves_human_subjects: true
⚠ low R20 · consistency
issuehuman_subject_research.involves_human_subjects=True and ethical_reviews present with IRB approval details
fieldshuman_subject_research.involves_human_subjects, ethical_reviews
fixConsistency maintained - no action needed
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards IRB or Ethics Review Documented
evidenceethical_reviews: University of Washington IRB approval STUDY00016228 with reliance agreements from UAB and UCSD. human_subject_research.involves_human_subjects: true with IRB details.
qualityIRB approval number (STUDY00016228), lead institution (UW), reliance agreements (UAB, UCSD) all documented. Bioethics guidance and Community Advisory Board mentioned.
semanticConsistency check PASSED: involves_human_subjects=true AND IRB approval documented with specific number and institutions. Semantically complete.
✗ 0/1 R10 9.Dataset Evaluation and Limitations Disclosure Ethical Review Details Including Conflicts
evidenceethical_reviews: IRB approval STUDY00016228 with reliance agreements. human_subject_research: bioethics guidance, Community Advisory Board. No conflicts of interest disclosure in D4D-core schema.
qualityEthics review documented (IRB, bioethics co-investigators, CAB) but no conflict of interest statement. D4D-core may not include conflicts field.
semanticEthics oversight complete (IRB, bioethics, CAB) but conflicts of interest not addressed. Field may not be part of D4D-core schema.
5/5 R20 Q8 (Metadata Quality & Content) Ethical and Privacy Declarations
levelComprehensive (all human subjects protections documented)
evidenceethical_reviews: 'University of Washington IRB Approval STUDY00016228 with reliance agreements from UAB and UCSD'. human_subject_research.involves_human_subjects: true with description of bioethics guidance and Community Advisory Board. informed_consent: 'Written informed consent provided by all participants'. is_deidentified: describes public dataset de-identification and controlled access for sensitive data. at_risk_populations: describes protections for T2DM participants and racial/ethnic minority groups with bioethics oversight and Community Advisory Board
qualityComprehensive ethical documentation covering all major protection areas. IRB approval with institutional details, informed consent process, de-identification procedures, and at-risk population protections are all present.
correctnessIRB approval number STUDY00016228 follows standard format. Reliance agreements appropriate for multi-site study (UAB, UCSD, UW).
consistencyinvolves_human_subjects=true aligns with presence of ethical_reviews, informed_consent, and at_risk_populations. De-identification approach (public vs. controlled access tiers) aligns with sensitive_elements and confidential_elements
at_risk_populations
at_risk_populations:
  id: aireadi:atrisk:1
  name: At-risk population protections
  description: 'The dataset focuses on individuals with and without Type 2 Diabetes Mellitus (T2DM), with
    intentional inclusion of historically underrepresented racial and ethnic minority groups. The study
    design incorporates bioethics guidance from co-investigators specializing in bioethics and community
    engagement. A Community Advisory Board of 11 persons with diversity in race and ethnicity provides
    oversight. Exclusion criteria include pregnancy (protecting pregnant individuals from research burden).
    De-identification procedures protect participant privacy. Controlled access requirements protect sensitive
    data for populations at higher re-identification risk.

    '
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Vulnerable Populations and Compensation Documented
evidenceat_risk_populations: Intentional inclusion of historically underrepresented racial/ethnic minority groups with bioethics guidance, Community Advisory Board oversight (11 diverse members), pregnancy exclusion for protection.
qualityVulnerable population protections documented: racial/ethnic minorities intentionally included with ethical safeguards (bioethics co-investigators, CAB). Pregnancy excluded to protect pregnant individuals.
semanticAt-risk population protections appropriate: Community Advisory Board with racial/ethnic diversity provides oversight, bioethics guidance integrated, exclusions justified (pregnancy protection).
5/5 R20 Q8 (Metadata Quality & Content) Ethical and Privacy Declarations
levelComprehensive (all human subjects protections documented)
evidenceethical_reviews: 'University of Washington IRB Approval STUDY00016228 with reliance agreements from UAB and UCSD'. human_subject_research.involves_human_subjects: true with description of bioethics guidance and Community Advisory Board. informed_consent: 'Written informed consent provided by all participants'. is_deidentified: describes public dataset de-identification and controlled access for sensitive data. at_risk_populations: describes protections for T2DM participants and racial/ethnic minority groups with bioethics oversight and Community Advisory Board
qualityComprehensive ethical documentation covering all major protection areas. IRB approval with institutional details, informed consent process, de-identification procedures, and at-risk population protections are all present.
correctnessIRB approval number STUDY00016228 follows standard format. Reliance agreements appropriate for multi-site study (UAB, UCSD, UW).
consistencyinvolves_human_subjects=true aligns with presence of ethical_reviews, informed_consent, and at_risk_populations. De-identification approach (public vs. controlled access tiers) aligns with sensitive_elements and confidential_elements
is_deidentified
is_deidentified:
  id: aireadi:deidentified:1
  name: De-identification status
  description: 'The public access dataset is de-identified, with sensitive personal health information
    (5-digit zip code, detailed race/ethnicity, genetic data, past health records) moved to the controlled
    access dataset. The AI-READI Data License Agreement prohibits re-identification attempts. De-identification
    procedures follow applicable regulations and guidelines.

    '
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Deidentification Method Described
evidenceis_deidentified: public access dataset is de-identified, sensitive PHI moved to controlled access. De-identification procedures follow applicable regulations and guidelines. License prohibits re-identification attempts.
qualityDe-identification status clear: public dataset de-identified, controlled access for sensitive data (zip code, race, genetics). Method follows regulations (likely HIPAA Safe Harbor or Expert Determination, not explicitly stated).
semanticConsistency check PASSED: is_deidentified documented AND public/controlled access distinction explained. Method not explicitly named (Safe Harbor/Expert Determination) but regulatory compliance stated.
5/5 R20 Q8 (Metadata Quality & Content) Ethical and Privacy Declarations
levelComprehensive (all human subjects protections documented)
evidenceethical_reviews: 'University of Washington IRB Approval STUDY00016228 with reliance agreements from UAB and UCSD'. human_subject_research.involves_human_subjects: true with description of bioethics guidance and Community Advisory Board. informed_consent: 'Written informed consent provided by all participants'. is_deidentified: describes public dataset de-identification and controlled access for sensitive data. at_risk_populations: describes protections for T2DM participants and racial/ethnic minority groups with bioethics oversight and Community Advisory Board
qualityComprehensive ethical documentation covering all major protection areas. IRB approval with institutional details, informed consent process, de-identification procedures, and at-risk population protections are all present.
correctnessIRB approval number STUDY00016228 follows standard format. Reliance agreements appropriate for multi-site study (UAB, UCSD, UW).
consistencyinvolves_human_subjects=true aligns with presence of ethical_reviews, informed_consent, and at_risk_populations. De-identification approach (public vs. controlled access tiers) aligns with sensitive_elements and confidential_elements
license_and_use_terms
license_and_use_terms:
  id: aireadi:license:1
  name: Creative Commons Attribution Non-Commercial and AI-READI Data License
  description: 'Public access data distributed under Creative Commons Attribution Non-Commercial (CC BY-NC
    4.0) license. Permits others to distribute, remix, adapt, build upon this work non-commercially, and
    license their derivative works on different terms, provided the original work is properly cited, appropriate
    credit is given, any changes made indicated, and the use is non-commercial. Controlled access data
    requires a separate data use agreement with the University of Washington as Licensor. The AI-READI
    Data License Agreement prohibits clinical treatment decisions based on the data, re-identification
    attempts, and sharing data with non-licensed parties. See http://creativecommons.org/licenses/by-nc/4.0/
    for full CC BY-NC 4.0 license terms and https://docs.aireadi.org/ for the AI-READI specific license
    terms.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Access Policy and IP Restrictions Defined
evidencelicense_and_use_terms: CC BY-NC 4.0 for public data, separate data use agreement for controlled access. ip_restrictions: Non-commercial use restriction.
qualityClear two-tier access model (public CC BY-NC 4.0, controlled DUA). IP restrictions explicitly non-commercial.
semanticLicense terms semantically appropriate for health research data. Non-commercial restriction clearly stated.
✓ 1/1 R10 3.Data Reuse and Interoperability License Terms Allow Reuse
evidencelicense_and_use_terms: CC BY-NC 4.0 permits distribution, remix, adaptation, derivative works non-commercially with attribution. Full license at http://creativecommons.org/licenses/by-nc/4.0/
qualityCC BY-NC 4.0 explicitly permits derivative works, adaptation, remixing with attribution. Non-commercial restriction clear.
semanticLicense semantically appropriate for research data sharing. Reuse permitted with attribution and non-commercial constraint.
5/5 R20 Q17 (FAIRness & Accessibility) Accessibility (Access Mechanism)
levelFully defined access path (platform, login, policy)
evidencedistributions[0]: 'Public access subset available at https://fairhub.io/datasets/2 upon agreement with CC BY-NC 4.0 license. Distributed as ZIP archive containing DICOM, CSV, mHealth, and XML files'. distributions[1]: 'Controlled access subset requiring data use agreement. Distributed as ZIP archive'. license_and_use_terms describes two-tier access model with specific requirements and prohibitions
qualityClear access mechanism documentation with two-tier model: public access via license agreement on FAIRhub platform, controlled access via separate data use agreement. Distribution formats and access procedures are well-defined.
correctnessTwo-tier access model (public CC BY-NC 4.0 + controlled DUA) is appropriate for dataset with sensitive genetic/demographic data
consistencyAccess tiers align with sensitive_elements and confidential_elements. Distribution format (ZIP with DICOM/CSV/mHealth/XML) aligns with distribution_formats
5/5 R20 Q18 (FAIRness & Accessibility) Reusability (License Clarity)
levelLicense explicitly defines reuse terms
evidencelicense_and_use_terms: 'CC BY-NC 4.0 permits distribution, remix, adaptation, and building upon the work non-commercially with proper citation and credit. Controlled access data requires separate data use agreement. Prohibits clinical treatment decisions, re-identification attempts, and sharing with non-licensed parties. See http://creativecommons.org/licenses/by-nc/4.0/ and https://docs.aireadi.org/ for full terms'
qualityExcellent license clarity with explicit reuse permissions (remix, adapt, build upon) and restrictions (non-commercial, no clinical use, no re-identification). Provides URLs to full license terms.
correctnessCC BY-NC 4.0 license URL is correct. License terms accurately described (attribution, non-commercial, derivatives allowed).
consistencyLicense restrictions align with prohibited_uses and ip_restrictions. Two-tier licensing aligns with public vs. controlled access distributions
5/5 R20 Q9 (Metadata Quality & Content) Access Requirements and Governance Documentation
levelLicense + restrictions + confidentiality classification
evidencelicense_and_use_terms: 'CC BY-NC 4.0 for public data, separate data use agreement for controlled access data' with detailed terms including prohibitions on clinical use, re-identification, and sharing. ip_restrictions: 'Non-commercial use restriction under CC BY-NC 4.0'. regulatory_restrictions: 'HIPAA and NIH data sharing compliance (NIH grant OT2OD032644), IRB oversight (45 CFR 46)'. confidential_elements: describes controlled access dataset requiring data use agreement
qualityExcellent governance documentation with clear license terms, IP restrictions, regulatory compliance, and confidentiality classifications. Two-tier access model (public CC BY-NC 4.0 + controlled access DUA) is well-defined.
correctnessCC BY-NC 4.0 license is appropriate for non-commercial research dataset. HIPAA and 45 CFR 46 are correct regulatory frameworks for human subjects health research.
consistencyLicense restrictions (non-commercial, no clinical use, no re-identification) align with prohibited_uses. Controlled access requirements align with sensitive_elements and confidential_elements
ip_restrictions
ip_restrictions:
  id: aireadi:ip:1
  name: Non-commercial use restriction
  description: 'The CC BY-NC 4.0 license restricts use to non-commercial purposes. Controlled access data
    requires a separate data use agreement with the University of Washington. No third-party IP restrictions
    beyond the licensing terms have been identified.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Access Policy and IP Restrictions Defined
evidencelicense_and_use_terms: CC BY-NC 4.0 for public data, separate data use agreement for controlled access. ip_restrictions: Non-commercial use restriction.
qualityClear two-tier access model (public CC BY-NC 4.0, controlled DUA). IP restrictions explicitly non-commercial.
semanticLicense terms semantically appropriate for health research data. Non-commercial restriction clearly stated.
5/5 R20 Q9 (Metadata Quality & Content) Access Requirements and Governance Documentation
levelLicense + restrictions + confidentiality classification
evidencelicense_and_use_terms: 'CC BY-NC 4.0 for public data, separate data use agreement for controlled access data' with detailed terms including prohibitions on clinical use, re-identification, and sharing. ip_restrictions: 'Non-commercial use restriction under CC BY-NC 4.0'. regulatory_restrictions: 'HIPAA and NIH data sharing compliance (NIH grant OT2OD032644), IRB oversight (45 CFR 46)'. confidential_elements: describes controlled access dataset requiring data use agreement
qualityExcellent governance documentation with clear license terms, IP restrictions, regulatory compliance, and confidentiality classifications. Two-tier access model (public CC BY-NC 4.0 + controlled access DUA) is well-defined.
correctnessCC BY-NC 4.0 license is appropriate for non-commercial research dataset. HIPAA and 45 CFR 46 are correct regulatory frameworks for human subjects health research.
consistencyLicense restrictions (non-commercial, no clinical use, no re-identification) align with prohibited_uses. Controlled access requirements align with sensitive_elements and confidential_elements
regulatory_restrictions
regulatory_restrictions:
  id: aireadi:regulatory:1
  name: HIPAA and NIH data sharing compliance
  description: 'Dataset collection and sharing complies with HIPAA regulations and NIH data sharing policies
    (NIH grant OT2OD032644). IRB oversight ensures compliance with human subjects research regulations
    (45 CFR 46). Controlled access requirements protect sensitive health information. No export control
    restrictions identified.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Regulatory Restrictions and Confidentiality Level Specified
evidenceregulatory_restrictions: HIPAA and NIH data sharing compliance (NIH grant OT2OD032644), IRB oversight (45 CFR 46). confidential_elements: controlled access subset requires DUA.
qualityHIPAA, NIH policies, IRB regulations (45 CFR 46) all cited. Controlled access tier for sensitive data.
semanticRegulatory framework complete: HIPAA (privacy), NIH (data sharing), 45 CFR 46 (human subjects). Appropriate for health data.
5/5 R20 Q9 (Metadata Quality & Content) Access Requirements and Governance Documentation
levelLicense + restrictions + confidentiality classification
evidencelicense_and_use_terms: 'CC BY-NC 4.0 for public data, separate data use agreement for controlled access data' with detailed terms including prohibitions on clinical use, re-identification, and sharing. ip_restrictions: 'Non-commercial use restriction under CC BY-NC 4.0'. regulatory_restrictions: 'HIPAA and NIH data sharing compliance (NIH grant OT2OD032644), IRB oversight (45 CFR 46)'. confidential_elements: describes controlled access dataset requiring data use agreement
qualityExcellent governance documentation with clear license terms, IP restrictions, regulatory compliance, and confidentiality classifications. Two-tier access model (public CC BY-NC 4.0 + controlled access DUA) is well-defined.
correctnessCC BY-NC 4.0 license is appropriate for non-commercial research dataset. HIPAA and 45 CFR 46 are correct regulatory frameworks for human subjects health research.
consistencyLicense restrictions (non-commercial, no clinical use, no re-identification) align with prohibited_uses. Controlled access requirements align with sensitive_elements and confidential_elements
external_resources
external_resources:
- id: aireadi:resource:1
  name: AI-READI Project Website
  description: Official project website with overview and resources at https://aireadi.org/
- id: aireadi:resource:2
  name: AI-READI Dataset Documentation
  description: Comprehensive dataset documentation with version-specific guides at https://docs.aireadi.org/
- id: aireadi:resource:3
  name: FAIRhub Dataset Landing Page
  description: Dataset repository and download portal for AI-READI data at https://fairhub.io/datasets/2
- id: aireadi:resource:4
  name: Bridge2AI Program
  description: Parent NIH Common Fund program supporting AI-ready biomedical datasets at https://bridge2ai.org/
- id: aireadi:resource:5
  name: NIH RePORTER Project Details
  description: Federal grant information and project details for grant 1OT2OD032644-01 at https://reporter.nih.gov/project-details/10471118
- id: aireadi:resource:6
  name: Data Sharing Information
  description: Policies and procedures for data access and sharing at https://aireadi.org/goals/data-sharing
- id: aireadi:resource:7
  name: Zenodo Archive
  description: Additional dataset documentation and resources at https://doi.org/10.5281/zenodo.10642459
- id: aireadi:resource:8
  name: Protocol Publication (BMJ Open)
  description: BMJ Open publication describing study design and protocol (Owsley et al. 2025) at https://doi.org/10.1136/bmjopen-2024-097449
- id: aireadi:resource:9
  name: Nature Metabolism Commentary
  description: Overview of AI-READI approach and significance published in Nature Metabolism at https://doi.org/10.1038/s42255-024-01165-x
✓ 1/1 R10 1.Dataset Discovery and Identification Landing Page and Resources (page, hierarchical resources)
evidencepage: https://fairhub.io/datasets/2, external_resources include project website (aireadi.org), documentation (docs.aireadi.org), FAIRhub portal
qualityLanding page URL plus 9 external resources (project site, docs, NIH RePORTER, publications).
semanticMultiple access points documented. URL structure valid.
✓ 1/1 R10 1.Dataset Discovery and Identification Hierarchical Structure (parent datasets, relationships)
evidenceexternal_resources list Bridge2AI Program (parent program) at https://bridge2ai.org/, Zenodo archive https://doi.org/10.5281/zenodo.10642459
qualityParent program (Bridge2AI) documented in external_resources. Zenodo archive provides alternate access point.
semanticParent-child relationship clear (AI-READI is part of Bridge2AI program). No peer dataset relationships documented.
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2. maintainers: AI-READI Consortium. external_resources: FAIRhub landing page, Zenodo archive https://doi.org/10.5281/zenodo.10642459.
qualityPublished on FAIRhub (recognized FAIR data repository) with additional Zenodo archival copy. Multi-platform distribution.
semanticPlatform recognized: FAIRhub is FAIR-focused repository, Zenodo is general-purpose research data repository (CERN). Dual platform approach ensures preservation.
✓ 1/1 R10 10.Cross-Platform and Community Integration Citation and DOI for Cross-referencing
evidencedoi: 10.57895/fairhub.2. external_resources: Zenodo DOI 10.5281/zenodo.10642459, BMJ Open protocol DOI 10.1136/bmjopen-2024-097449, Nature Metabolism DOI 10.1038/s42255-024-01165-x.
qualityDataset DOI (10.57895/fairhub.2), Zenodo archive DOI (10.5281/zenodo.10642459), and publication DOIs (BMJ Open, Nature Metabolism) all provided. No citation field in D4D-core but DOIs enable citation.
semanticDOIs for dataset (FAIRhub), archive (Zenodo), and publications (BMJ, Nature) enable cross-referencing. Citation format not provided but DOI sufficient for auto-generation.
✓ 1/1 R10 10.Cross-Platform and Community Integration Outreach Materials and Documentation Links
evidenceexternal_resources: project website (aireadi.org), documentation portal (docs.aireadi.org), FAIRhub landing page, data sharing info (aireadi.org/goals/data-sharing), BMJ Open protocol, Nature Metabolism commentary.
qualityComprehensive outreach: project website, documentation portal with version-specific guides, data sharing policies, protocol publication (BMJ Open), commentary (Nature Metabolism).
semanticOutreach materials extensive: website, docs, publications (2 peer-reviewed), data sharing policies. Community engagement via multiple channels.
✓ 1/1 R10 10.Cross-Platform and Community Integration Related Datasets with Typed Relationships
evidenceexternal_resources: Bridge2AI Program (parent program) at bridge2ai.org, Zenodo archive (alternate version) at 10.5281/zenodo.10642459. funders: NIH Common Fund Bridge2AI (program affiliation).
qualityParent program relationship (Bridge2AI) documented. Zenodo archive provides alternate version. No peer dataset relationships (supplements, derives from) documented.
semanticHierarchical relationship clear (AI-READI part of Bridge2AI program). Zenodo archive is alternate distribution (isVersionOf relationship). No lateral dataset relationships.
✓ 1/1 R10 2.Dataset Access and Retrieval Related Datasets and External Resources Linked
evidenceexternal_resources: 9 entries including project website, documentation, FAIRhub portal, Bridge2AI program, NIH RePORTER, Zenodo archive, BMJ Open protocol, Nature Metabolism commentary
qualityComprehensive external resource links: documentation, program affiliation, grant details, publications, archives.
semanticExternal resources cover documentation (docs.aireadi.org), program context (Bridge2AI), provenance (NIH RePORTER), publications (DOIs). Well-integrated.
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Grant IDs or Award Numbers Present
evidencefunders: grant OT2OD032644, P30DK035816, UL1TR003096. external_resources: NIH RePORTER project-details/10471118 for grant 1OT2OD032644-01.
qualityPrimary grant OT2OD032644 follows NIH format [Type][Number][Institute][Digits]: OT2=Other Transaction, OD=Office of Director, 032644=award number. Supporting grants P30DK035816 (P30=program project), UL1TR003096 (UL1=university infrastructure) also valid NIH formats.
semanticGrant number format validation PASSED: OT2OD032644 follows NIH pattern. P30 (program project), UL1 (infrastructure) formats correct. NIH RePORTER link confirms grant.
✗ 0/1 R10 8.Technical Transparency (Data Collection and Processing) External Standards and Resources Referenced
evidenceexternal_resources: 9 entries (project website, documentation, FAIRhub portal, Bridge2AI, NIH RePORTER, Zenodo, BMJ Open protocol DOI, Nature Metabolism commentary DOI). preprocessing_strategies mention OMOP CDM. No 'conforms_to' field for formal standards.
qualityExternal publications documented (BMJ Open protocol https://doi.org/10.1136/bmjopen-2024-097449, Nature Metabolism https://doi.org/10.1038/s42255-024-01165-x). OMOP CDM mentioned but not formalized. Standards like DICOM, mHealth, HIPAA referenced in descriptions but not in structured standards field.
semanticPublications provide external documentation (BMJ Open protocol, Nature Metabolism). Standards mentioned (OMOP, DICOM, mHealth, HIPAA) but not in structured 'conforms_to' field (may not be part of D4D-core).
5/5 R20 Q14 (Technical Documentation) Associated Publications
levelMultiple references with DOIs
evidenceexternal_resources: 9 resources including 'Protocol Publication (BMJ Open)' at https://doi.org/10.1136/bmjopen-2024-097449, 'Nature Metabolism Commentary' at https://doi.org/10.1038/s42255-024-01165-x, 'Zenodo Archive' at https://doi.org/10.5281/zenodo.10642459, plus project website, documentation portal, dataset landing page, NIH RePORTER, and data sharing policies. NOTE: D4D-core schema does not include 'citation' field present in full D4D schema
qualityExcellent publication and resource documentation with 3 DOI-linked publications (BMJ Open protocol, Nature Metabolism commentary, Zenodo archive) plus 6 additional persistent URLs for documentation and project resources.
correctnessDOI formats (10.1136, 10.1038, 10.5281) match known registrars (BMJ, Nature, Zenodo). URLs are properly formatted and plausible.
consistencyPublications (protocol paper, commentary) align with dataset scope and timeline. External resources cover expected documentation types (project site, data portal, funder page)
1/1 R20 Q16 (FAIRness & Accessibility) Findability (Persistent Links)
levelPass
evidencepage: 'https://fairhub.io/datasets/2', doi: '10.57895/fairhub.2', external_resources: 9 persistent URLs including https://aireadi.org/, https://docs.aireadi.org/, https://fairhub.io/datasets/2, https://bridge2ai.org/, https://reporter.nih.gov/project-details/10471118, https://doi.org/10.5281/zenodo.10642459, https://doi.org/10.1136/bmjopen-2024-097449, https://doi.org/10.1038/s42255-024-01165-x
qualityMultiple persistent URLs present including DOI, dataset landing page, project website, documentation portal, and publication DOIs.
correctnessAll URLs follow proper format. DOI resolves to expected resource. Domain names are plausible for described organizations.
consistencyPage URL and DOI suffix both reference 'datasets/2' confirming alignment
1/1 R20 Q20 (FAIRness & Accessibility) Interlinking Across Platforms
levelPass
evidenceexternal_resources: Links to 9 platforms/resources including FAIRhub (dataset repository), project website (aireadi.org), documentation portal (docs.aireadi.org), Bridge2AI parent program, NIH RePORTER, Zenodo archive, BMJ Open publication, Nature Metabolism publication. DOI provides cross-platform identifier. page URL provides FAIRhub landing page
qualityExcellent cross-platform interlinking with connections to dataset repository (FAIRhub), project infrastructure (websites, documentation), funder database (NIH RePORTER), archival repository (Zenodo), and publications (BMJ Open, Nature Metabolism).
correctnessAll platform domains are plausible and properly formatted. DOI provides globally resolvable identifier across platforms.
consistencyPlatform links align with dataset lifecycle: FAIRhub (distribution), docs.aireadi.org (documentation), NIH RePORTER (funding), Zenodo (archival), journals (publications)
1/1 R20 Q6 (Metadata Quality & Content) Dataset Identification Metadata
levelPass
evidencedoi: '10.57895/fairhub.2', page: 'https://fairhub.io/datasets/2', external_resources include persistent URLs
qualityMultiple persistent identifiers present including DOI and persistent page URL.
correctnessDOI prefix 10.57895 is non-standard but valid for FAIRhub institutional repository. DOI format follows standard pattern.
consistencyDOI suffix 'fairhub.2' aligns with page URL '/datasets/2'

Unmatched feedback

Feedback that referenced multiple fields or no specific field.
✗ 0/1 R10 8.Technical Transparency (Data Collection and Processing) Software and Tools Documented
evidenceREDCap mentioned for data collection and validation. MoCA Duo Application for cognitive testing. No 'software_and_tools' field in D4D-core schema. No processing software versions, analysis pipelines, or GitHub repositories documented.
qualityD4D-core schema may not include 'software_and_tools' field. REDCap and MoCA Duo mentioned in acquisition context but no comprehensive software inventory.
semanticField not part of D4D-core exchange layer. Software mentioned in acquisition_methods (REDCap, MoCA Duo) but not systematically cataloged.
⚠ info R10 · schema_limitation
issueD4D-core schema excludes many fields expected by rubric10 (e.g., prohibited_uses, discouraged_uses are present but not typical core fields)
fieldsschema_type
fixThis is expected for the exchange-layer subset; full rubric10 is optimized for comprehensive D4D, not core subset

Recommendations

  1. R10 · Verify DOI prefix 10.57895 is officially registered with DataCite or Crossref for FAIRhub institutional repository
  2. R10 · Consider adding 'conforms_to' field in future D4D-core revisions to formalize OMOP CDM, DICOM, mHealth standard conformance
  3. R10 · Add 'software_and_tools' section documenting REDCap version, data processing pipelines, analysis software (if D4D-core schema supports)
  4. R10 · Document conflicts of interest for creators and funders if not already disclosed in external documentation
  5. R10 · Formalize changelog/errata in D4D metadata (currently external at docs.aireadi.org) for better version tracking
  6. R10 · Add 'anomalies' section documenting any known data quality issues discovered post-collection
  7. R10 · Structure grant numbers as separate fields (e.g., primary_grant: OT2OD032644, supporting_grants: [P30DK035816, UL1TR003096]) for machine readability
  8. R10 · Link to related Bridge2AI datasets (VOICE, CM4AI, CHORUS) with typed relationships (isPartOf Bridge2AI, relatedTo other datasets)
  9. R10 · Add citation recommendation format to external_resources for consistent attribution
  10. R10 · Document data processing code repositories (GitHub/GitLab) if publicly available for reproducibility
  11. R20 · Consider migrating to standard DOI registrar (DataCite 10.5281 or Crossref) for broader interoperability if not already registered with FAIRhub's institutional DOI service
  12. R20 · Add software version numbers and URLs/RRIDs to preprocessing_strategies and acquisition_methods descriptions (e.g., 'REDCap version X.Y', 'Dexcom G6 firmware version', 'OMOP CDM v5.4')
  13. R20 · Include direct links to specific documentation pages for each version release in version_access description
  14. R20 · Consider documenting errata and release notes in external_resources or updates field descriptions as workaround for missing D4D-core fields
  15. R20 · Add formal dataset citation string to description or external_resources as workaround for missing 'citation' field in D4D-core
  16. R20 · Document processing lineage and data transformation steps in more detail within preprocessing_strategies descriptions
  17. R20 · Consider adding RRID identifiers for software tools and equipment once available (e.g., RRID for REDCap, retinal imaging devices)
  18. R20 · Specify which version of OMOP CDM is used in preprocessing_strategies[4] description