Interleaved Semantic Evaluation

Project: AI_READI · Method: claudecode_agent
YAML: data/d4d_concatenated/claudecode_agent/AI_READI_d4d.yaml
R10 JSON: data/evaluation_llm/rubric10_semantic/concatenated/AI_READI_claudecode_agent_evaluation.json
R20 JSON: data/evaluation_llm/rubric20_semantic/concatenated/AI_READI_claudecode_agent_evaluation.json
Model: claude-sonnet-4-5-20250929
Rubric10 (semantic)
44/50 (88.0%)
Rubric20 (semantic)
79/84 (94.0%)
Consistency checks (R10/R20)
39 pass · 0 fail · 3 warn
Mapped feedback / fields
125 across 30 fields
R10 sub-element R20 question Semantic issue

Strengths

  • Outstanding structural completeness with all fields comprehensively populated
  • Exemplary ethics documentation with IRB approval, consent, Community Advisory Board
  • Comprehensive FAIR compliance with multiple persistent identifiers and dual-tier access
  • Excellent interoperability through OMOP CDM, DICOM, mHealth, RxNorm, ICD-10 standards
  • Exceptional technical documentation with 12 acquisition methods and specific devices
  • Well-documented version history with structured release timeline
  • Detailed demographic characterization with triple-balanced design transparency
  • Strong funding documentation with NIH grant numbers and exact amounts
  • Comprehensive collection protocol covering full workflow with specific timeline
  • Multiple associated publications providing external validation

Weaknesses

  • Software versions and repository links not included
  • Controlled access procedures described as 'in development'
  • RRID identifiers not present for software/tools
  • Participant compensation not documented
  • Vulnerable population safeguards not explicitly detailed

Field-by-field

id
id: https://fairhub.io/datasets/2
✓ 1/1 R10 1.Dataset Discovery and Identification Persistent Identifier (DOI, RRID, or URI)
evidencedoi: 10.57895/fairhub.2, id: https://fairhub.io/datasets/2
qualityDOI present with proper format. Prefix 10.57895 is FAIRhub's DataCite prefix (plausible and valid).
semanticformat_valid: True; prefix_plausible: True; registrar: DataCite (FAIRhub)
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid, title (512 chars), description, keywords (19 terms), license all present with exceptional detail
qualityAll mandatory fields comprehensively populated
correctnessID is valid FAIRhub URL, license is standard CC designation
consistencyKeywords match description content, license appropriate for health data
name
name: AI-READI
no field-level feedback matched
title
title: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI)
✓ 1/1 R10 1.Dataset Discovery and Identification Dataset Title and Description Completeness
evidencetitle: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI); description: 423 characters with specific details on 4,000 participants, 3 sites, multimodal data, sampling strategy
qualityComprehensive description exceeds 200 characters with rich semantic content including participant numbers, sites, data modalities, and design rationale.
semanticlength: 423; specificity: high; semantic_density: rich
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidencetitle and description focus on Type 2 Diabetes Mellitus; purposes: understanding T2DM salutogenesis, disease trajectories; instances: T2DM severity stratification (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); keywords: Type 2 Diabetes Mellitus, T2DM, salutogenesis; acquisition_methods cover T2DM-related domains (retinal complications, CGM, metabolic markers)
qualityPrimary condition (Type 2 Diabetes Mellitus) clearly defined with severity stratification, salutogenesis focus, and T2DM-specific measurements (retinal imaging, CGM, metabolic panels).
semanticprimary_condition: Type 2 Diabetes Mellitus; condition_stratification: 4 severity levels; complication_domains: retinal; metabolic; cardiovascular; cognitive; peripheral neuropathy; topic_clarity: high
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid, title (512 chars), description, keywords (19 terms), license all present with exceptional detail
qualityAll mandatory fields comprehensively populated
correctnessID is valid FAIRhub URL, license is standard CC designation
consistencyKeywords match description content, license appropriate for health data
description
description: 'The AI-READI is a flagship dataset consisting of multimodal data collected from 4,000 individuals
  with and without Type 2 Diabetes Mellitus (T2DM), harmonized across 3 data collection sites (Birmingham,
  Alabama; San Diego, California; Seattle, Washington). The dataset was designed with future AI/Machine
  Learning studies in mind, including recruitment sampling procedures aimed at achieving approximately
  equal distribution of participants across diabetes severity (triple-balanced by race/ethnicity, biological
  sex, and T2DM severity), as well as a multi-domain data acquisition protocol (survey data, physical
  measurements, clinical data, imaging data, wearable device data, environmental sensors, biospecimens)
  to enable downstream AI/ML analyses that may not be feasible with existing data sources such as claims
  or electronic health records data. The goal is to better understand salutogenesis (the pathway from
  disease to health) in T2DM. The study follows FAIR principles and incorporates ethical and equitable
  data collection and management practices.

  '
✓ 1/1 R10 1.Dataset Discovery and Identification Dataset Title and Description Completeness
evidencetitle: Artificial Intelligence Ready and Equitable Atlas for Diabetes Insights (AI-READI); description: 423 characters with specific details on 4,000 participants, 3 sites, multimodal data, sampling strategy
qualityComprehensive description exceeds 200 characters with rich semantic content including participant numbers, sites, data modalities, and design rationale.
semanticlength: 423; specificity: high; semantic_density: rich
✓ 1/1 R10 10.Cross-Platform and Community Integration Community Standards or Schema Conformance
evidencepreprocessing_strategies: OMOP Common Data Model, DICOM, mHealth standard, RxNorm, ICD-10; description and keywords: FAIR principles compliance; license: CC BY-NC 4.0 (community standard license)
qualityConformance to multiple community standards (OMOP, DICOM, mHealth, RxNorm, ICD-10) with explicit FAIR principles adherence. CC BY-NC 4.0 is widely recognized standard license.
semanticstandard_count: 5; fair_compliance: True; standard_license: CC BY-NC 4.0; clinical_standards: OMOP CDM; RxNorm; ICD-10; technical_standards: DICOM; mHealth
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidencetitle and description focus on Type 2 Diabetes Mellitus; purposes: understanding T2DM salutogenesis, disease trajectories; instances: T2DM severity stratification (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); keywords: Type 2 Diabetes Mellitus, T2DM, salutogenesis; acquisition_methods cover T2DM-related domains (retinal complications, CGM, metabolic markers)
qualityPrimary condition (Type 2 Diabetes Mellitus) clearly defined with severity stratification, salutogenesis focus, and T2DM-specific measurements (retinal imaging, CGM, metabolic panels).
semanticprimary_condition: Type 2 Diabetes Mellitus; condition_stratification: 4 severity levels; complication_domains: retinal; metabolic; cardiovascular; cognitive; peripheral neuropathy; topic_clarity: high
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Motivation or Purpose for Dataset Creation
evidencepurposes: 3 defined (understanding T2DM salutogenesis, establishing AI/ML data standards, addressing demographic inequities); addressing_gaps: 3 defined (lack of multimodal T2DM datasets, demographic underrepresentation, AI-readiness of medical datasets); description mentions salutogenesis pathway research
qualityClear scientific rationale with 3 purposes and 3 research gaps addressed. Salutogenesis (disease to health pathway) is novel scientific angle. Equity and AI-readiness motivations explicit.
semanticpurpose_count: 3; research_gap_count: 3; scientific_novelty: salutogenesis approach; motivation_clarity: high
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Funding Sources and Mechanisms Listed
evidencefunders: NIH Common Fund Bridge2AI Program; description: grant OT2OD032644 administered by NIH Office of the Director, additional support from P30DK035816, UL1TR003096, Research to Prevent Blindness; total funding in 2022: $5,026,499; opportunity number OTA-21-008
qualityPrimary funding source (NIH Common Fund Bridge2AI) with specific grant numbers, administering office, additional grants, total funding amount, and opportunity number. Comprehensive funding transparency.
semanticfunding_agency: NIH; funding_program: Common Fund Bridge2AI; primary_grant: OT2OD032644; additional_grants: P30DK035816; UL1TR003096; total_funding_documented: True
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid, title (512 chars), description, keywords (19 terms), license all present with exceptional detail
qualityAll mandatory fields comprehensively populated
correctnessID is valid FAIRhub URL, license is standard CC designation
consistencyKeywords match description content, license appropriate for health data
5/5 R20 Q2 (Structural Completeness) Entry Length Adequacy
level>200 chars
evidencedescription: 512 chars | purposes avg: 310 chars
qualityAll narrative fields exceed 200 characters with substantive content
correctnessContent length reflects genuine detail, not padding
consistencyMaintains consistent terminology across fields
page
page: https://fairhub.io/datasets/2
✓ 1/1 R10 1.Dataset Discovery and Identification Landing Page and Resources (page, hierarchical resources)
evidencepage: https://fairhub.io/datasets/2; external_resources with 9 resource entries including project website, documentation, FAIRhub, Zenodo, publications
qualityLanding page provided with extensive external resources (9 distinct resources) including documentation, repository, publications, and grant information.
semanticlanding_page_present: True; resource_count: 9; url_validity: all_plausible
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2; FAIRhub is recognized FAIR-compliant repository; external_resources include FAIRhub, Zenodo (10.5281/zenodo.10642459); maintainers: AI-READI Consortium via University of Washington
qualityPublished on FAIRhub (FAIR-compliant repository) with Zenodo archival. Multiple platform presence enhances discoverability and preservation.
semanticprimary_platform: FAIRhub; platform_recognition: FAIR-compliant; archival_platform: Zenodo; multi_platform_presence: True
✓ 1/1 R10 10.Cross-Platform and Community Integration Outreach Materials and Documentation Links
evidenceexternal_resources: 9 resources including project website (aireadi.org), comprehensive documentation (docs.aireadi.org with version-specific guides), data sharing information (aireadi.org/goals/data-sharing), publications (BMJ Open, Nature Metabolism), FAIRhub landing page, Zenodo archive, Bridge2AI program site, NIH RePORTER
qualityExtensive outreach and documentation (9 resources) including project website, versioned documentation portal, data sharing policies, peer-reviewed publications, and program context. Comprehensive user support.
semanticdocumentation_portal: True; project_website: True; version_specific_docs: True; publication_count: 2; data_sharing_policy_url: True; outreach_resource_count: 9
✓ 1/1 R10 2.Dataset Access and Retrieval Download URL or Platform Link Available
evidencepage: https://fairhub.io/datasets/2; subsets specify public data available for download upon license agreement, controlled data via DUA
qualityDirect platform link to FAIRhub repository with clear download mechanisms described for both public and controlled access data.
semanticdownload_url_present: True; platform: FAIRhub; access_mechanism_clarity: high
✓ 1/1 R10 6.Data Provenance and Version Tracking Version Access Methods Documented
evidenceupdates: version-specific documentation maintained at https://docs.aireadi.org/ for each release; FAIRhub landing page https://fairhub.io/datasets/2 provides access
qualityVersion-specific documentation URLs provided. FAIRhub platform likely supports version access but explicit version retrieval mechanism not detailed.
semanticversion_docs_url: True; repository_versioning: implied via FAIRhub; version_retrieval_explicit: False
language
language: en
no field-level feedback matched
license
license: CC BY-NC 4.0
✓ 1/1 R10 10.Cross-Platform and Community Integration Community Standards or Schema Conformance
evidencepreprocessing_strategies: OMOP Common Data Model, DICOM, mHealth standard, RxNorm, ICD-10; description and keywords: FAIR principles compliance; license: CC BY-NC 4.0 (community standard license)
qualityConformance to multiple community standards (OMOP, DICOM, mHealth, RxNorm, ICD-10) with explicit FAIR principles adherence. CC BY-NC 4.0 is widely recognized standard license.
semanticstandard_count: 5; fair_compliance: True; standard_license: CC BY-NC 4.0; clinical_standards: OMOP CDM; RxNorm; ICD-10; technical_standards: DICOM; mHealth
✓ 1/1 R10 2.Dataset Access and Retrieval Access Policy and IP Restrictions Defined
evidencelicense_and_use_terms: CC BY-NC 4.0 with detailed AI-READI Data License Agreement; subsets define public vs controlled access; license prohibits clinical treatment decisions, re-identification, sharing with non-licensed parties
qualityComprehensive access policy with dual licensing (public CC BY-NC 4.0 + controlled access DUA). Clear restrictions and use terms documented.
semanticlicense_specificity: high; access_levels: 2; restriction_clarity: explicit
✓ 1/1 R10 2.Dataset Access and Retrieval Regulatory Restrictions and Confidentiality Level Specified
evidencesensitive_elements: 3 defined (genetic/biospecimen, geographic/demographic identifiers, medical history/records) with controlled access designation; license prohibits re-identification
qualityExplicit documentation of sensitive data elements with controlled access requirements. Regulatory compliance through IRB and data use agreements.
semanticsensitivity_classification: present; regulatory_framework: IRB + DUA; data_protection_level: tiered
✓ 1/1 R10 2.Dataset Access and Retrieval Download URL or Platform Link Available
evidencepage: https://fairhub.io/datasets/2; subsets specify public data available for download upon license agreement, controlled data via DUA
qualityDirect platform link to FAIRhub repository with clear download mechanisms described for both public and controlled access data.
semanticdownload_url_present: True; platform: FAIRhub; access_mechanism_clarity: high
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Deidentification Method Described
evidencesubsets distinguish public (de-identified, not sensitive PHI) from controlled access (5-digit zip, detailed demographics, genetic data, health records); license prohibits re-identification attempts
qualityClear deidentification approach with tiered access: public dataset contains de-identified non-sensitive data, controlled dataset contains potentially identifiable elements (5-digit zip, genetics). Re-identification explicitly prohibited.
semanticdeidentification_approach: tiered access with public de-identified subset; identifiers_removed_from_public: detailed location; genetics; medical records; controlled_access_for_sensitive: True; re_identification_prohibition: True
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Privacy Protections Beyond Deidentification
evidencelicense prohibits re-identification, sharing with non-licensed parties; Data Access Committee developing controlled access requirements; bioethics guidance throughout study; sensitive_elements documented with access restrictions
qualityMulti-layered privacy protections including contractual prohibitions, data access committee oversight, bioethics integration, and explicit sensitive data classification.
semanticdata_access_committee: True; contractual_protections: True; bioethics_oversight: True; multi_layered_approach: True
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid, title (512 chars), description, keywords (19 terms), license all present with exceptional detail
qualityAll mandatory fields comprehensively populated
correctnessID is valid FAIRhub URL, license is standard CC designation
consistencyKeywords match description content, license appropriate for health data
5/5 R20 Q18 (FAIRness & Accessibility) Reusability (License Clarity)
levelLicense explicitly defines reuse terms
evidenceCC BY-NC 4.0 with explicit permissions/restrictions, custom license prohibitions documented
qualityExemplary license clarity
correctnessCC BY-NC summary accurate
consistencyLicense terms align with intended/discouraged uses
doi
doi: 10.57895/fairhub.2
⚠ low R20 · correctness
issueDOI prefix 10.57895 is valid for FAIRhub - matches expected registrar pattern
fieldsdoi
fixNo action needed - DOI format is correct
✓ 1/1 R10 1.Dataset Discovery and Identification Persistent Identifier (DOI, RRID, or URI)
evidencedoi: 10.57895/fairhub.2, id: https://fairhub.io/datasets/2
qualityDOI present with proper format. Prefix 10.57895 is FAIRhub's DataCite prefix (plausible and valid).
semanticformat_valid: True; prefix_plausible: True; registrar: DataCite (FAIRhub)
✓ 1/1 R10 10.Cross-Platform and Community Integration Citation and DOI for Cross-referencing
evidencedoi: 10.57895/fairhub.2; license_and_use_terms require proper citation and attribution; external_resources include publication DOIs (10.1136/bmjopen-2024-097449, 10.1038/s42255-024-01165-x) and Zenodo DOI (10.5281/zenodo.10642459)
qualityDataset DOI present (10.57895/fairhub.2) with citation requirement in license. Related publication DOIs provided for cross-referencing. Strong citation ecosystem.
semanticdataset_doi: 10.57895/fairhub.2; citation_requirement: True; publication_dois: 2; zenodo_doi: True; cross_reference_count: 4
keywords
keywords:
- Type 2 Diabetes Mellitus
- T2DM
- AI-READI
- Machine Learning
- Artificial Intelligence
- multimodal dataset
- harmonized data
- multi-site study
- salutogenesis
- FAIR principles
- retinal imaging
- continuous glucose monitoring
- wearable devices
- biorepository
- biospecimens
- triple-balanced sampling
- health equity
- Bridge2AI
- cross-sectional study
✓ 1/1 R10 1.Dataset Discovery and Identification Keywords or Tags for Searchability
evidencekeywords: 18 terms including Type 2 Diabetes Mellitus, T2DM, AI-READI, Machine Learning, multimodal dataset, harmonized data, salutogenesis, FAIR principles, retinal imaging, continuous glucose monitoring, wearable devices, biorepository, triple-balanced sampling, health equity, Bridge2AI
qualityExtensive keywords (18 total) covering domain, methods, technologies, principles, and project affiliation. Highly searchable.
semanticcount: 18; domain_coverage: comprehensive; technical_specificity: high
✓ 1/1 R10 10.Cross-Platform and Community Integration Community Standards or Schema Conformance
evidencepreprocessing_strategies: OMOP Common Data Model, DICOM, mHealth standard, RxNorm, ICD-10; description and keywords: FAIR principles compliance; license: CC BY-NC 4.0 (community standard license)
qualityConformance to multiple community standards (OMOP, DICOM, mHealth, RxNorm, ICD-10) with explicit FAIR principles adherence. CC BY-NC 4.0 is widely recognized standard license.
semanticstandard_count: 5; fair_compliance: True; standard_license: CC BY-NC 4.0; clinical_standards: OMOP CDM; RxNorm; ICD-10; technical_standards: DICOM; mHealth
✓ 1/1 R10 10.Cross-Platform and Community Integration Related Datasets with Typed Relationships
evidenceexternal_resources: Bridge2AI Program link (parent program); keywords: Bridge2AI (program affiliation); subsets define hierarchical relationships (public vs controlled vs biorepository); funders: NIH Common Fund Bridge2AI (program context)
qualityClear relationship to Bridge2AI program (parent initiative) with program URL and multiple references. Internal hierarchical relationships via subsets. Part of larger Bridge2AI ecosystem though specific related datasets not enumerated.
semanticparent_program: Bridge2AI; program_url: True; subset_relationships: 3; ecosystem_integration: Bridge2AI consortium; specific_related_datasets: False
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidencetitle and description focus on Type 2 Diabetes Mellitus; purposes: understanding T2DM salutogenesis, disease trajectories; instances: T2DM severity stratification (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); keywords: Type 2 Diabetes Mellitus, T2DM, salutogenesis; acquisition_methods cover T2DM-related domains (retinal complications, CGM, metabolic markers)
qualityPrimary condition (Type 2 Diabetes Mellitus) clearly defined with severity stratification, salutogenesis focus, and T2DM-specific measurements (retinal imaging, CGM, metabolic panels).
semanticprimary_condition: Type 2 Diabetes Mellitus; condition_stratification: 4 severity levels; complication_domains: retinal; metabolic; cardiovascular; cognitive; peripheral neuropathy; topic_clarity: high
5/5 R20 Q1 (Structural Completeness) Field Completeness
level≥90% fields populated
evidenceid, title (512 chars), description, keywords (19 terms), license all present with exceptional detail
qualityAll mandatory fields comprehensively populated
correctnessID is valid FAIRhub URL, license is standard CC designation
consistencyKeywords match description content, license appropriate for health data
5/5 R20 Q3 (Structural Completeness) Keyword Diversity
level≥8 keywords
evidence19 keywords spanning disease, methodology, data types, principles
qualityComprehensive keyword coverage
correctnessAll keywords domain-appropriate
consistencyKeywords align with description
purposes
purposes:
- id: aireadi:purpose:1
  name: Understanding T2DM salutogenesis
  description: 'Better understand salutogenesis (the pathway from disease to health) in Type 2 Diabetes
    Mellitus using a hypothesis-agnostic, harmonized, multi-domain dataset designed specifically for AI/ML
    research. The dataset aims to provide critical insights into how individuals can transition from diabetes
    toward health resilience through pseudotime manifold analysis.

    '
- id: aireadi:purpose:2
  name: Establishing AI/ML data standards
  description: 'Establish standards, best practices, and guidelines for collection, preparation, and sharing
    of medical/health data sets targeted for AI/ML applications. This includes guidance from bioethicists
    on ethical and equitable data collection and management practices, with adherence to FAIR principles.

    '
- id: aireadi:purpose:3
  name: Addressing demographic inequities in T2DM research
  description: 'Address the lack of racial and ethnic diversity in T2DM research by creating a dataset
    that is triple-balanced across race/ethnicity (Asian, Black, Hispanic, White), biological sex (male,
    female), and diabetes severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled,
    insulin-controlled).

    '
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidencetitle and description focus on Type 2 Diabetes Mellitus; purposes: understanding T2DM salutogenesis, disease trajectories; instances: T2DM severity stratification (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); keywords: Type 2 Diabetes Mellitus, T2DM, salutogenesis; acquisition_methods cover T2DM-related domains (retinal complications, CGM, metabolic markers)
qualityPrimary condition (Type 2 Diabetes Mellitus) clearly defined with severity stratification, salutogenesis focus, and T2DM-specific measurements (retinal imaging, CGM, metabolic panels).
semanticprimary_condition: Type 2 Diabetes Mellitus; condition_stratification: 4 severity levels; complication_domains: retinal; metabolic; cardiovascular; cognitive; peripheral neuropathy; topic_clarity: high
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Motivation or Purpose for Dataset Creation
evidencepurposes: 3 defined (understanding T2DM salutogenesis, establishing AI/ML data standards, addressing demographic inequities); addressing_gaps: 3 defined (lack of multimodal T2DM datasets, demographic underrepresentation, AI-readiness of medical datasets); description mentions salutogenesis pathway research
qualityClear scientific rationale with 3 purposes and 3 research gaps addressed. Salutogenesis (disease to health pathway) is novel scientific angle. Equity and AI-readiness motivations explicit.
semanticpurpose_count: 3; research_gap_count: 3; scientific_novelty: salutogenesis approach; motivation_clarity: high
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Primary Research Objectives or Tasks
evidencetasks: 3 defined (enable multi-domain AI/ML analyses for T2DM, develop unbiased AI/ML models, study T2DM disease trajectories); purposes align with AI/ML research, health equity, biomarker discovery
qualitySpecific research tasks documented (3 tasks) with clear focus on AI/ML model development, bias mitigation, and disease trajectory analysis. Aligned with purposes.
semantictask_count: 3; task_specificity: high; ml_focus: True; disease_trajectory_focus: True
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Systematic Biases Identified and Described
evidencesampling_strategies: volunteer selection bias documented; why_not_representative: triple-balanced over-sampling creates intentional imbalance relative to population prevalence for equity purposes; discouraged_uses: early data may have sampling imbalance during recruitment waves
qualityVolunteer bias explicitly identified. Intentional sampling imbalance (for equity) distinguished from unintentional bias. Wave-based recruitment bias acknowledged for early releases.
semanticbias_documentation: True; volunteer_bias: True; sampling_bias_acknowledged: True; intentional_vs_unintentional_bias: distinguished
5/5 R20 Q2 (Structural Completeness) Entry Length Adequacy
level>200 chars
evidencedescription: 512 chars | purposes avg: 310 chars
qualityAll narrative fields exceed 200 characters with substantive content
correctnessContent length reflects genuine detail, not padding
consistencyMaintains consistent terminology across fields
tasks
tasks:
- id: aireadi:task:1
  name: Enable multi-domain AI/ML analyses for T2DM
  description: 'Enable downstream AI/ML analyses across survey, clinical, imaging, wearable device, environmental,
    and biospecimen domains related to T2DM that may not be feasible with existing data sources such as
    claims or electronic health records data alone. The multimodal nature of the data supports complex
    machine learning model development.

    '
- id: aireadi:task:2
  name: Develop unbiased AI/ML models
  description: 'Support the development of unbiased machine learning models through balanced data collection
    across demographic groups and diabetes severity levels. The triple-balanced design is critical for
    preventing algorithmic bias in AI/ML applications.

    '
- id: aireadi:task:3
  name: Study T2DM disease trajectories
  description: 'Study disease trajectories and salutogenesis pathways in T2DM through cross-sectional
    analysis of participants at different disease stages, enabling pseudotime manifold analysis to predict
    disease progression and paths to health resilience.

    '
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Primary Research Objectives or Tasks
evidencetasks: 3 defined (enable multi-domain AI/ML analyses for T2DM, develop unbiased AI/ML models, study T2DM disease trajectories); purposes align with AI/ML research, health equity, biomarker discovery
qualitySpecific research tasks documented (3 tasks) with clear focus on AI/ML model development, bias mitigation, and disease trajectory analysis. Aligned with purposes.
semantictask_count: 3; task_specificity: high; ml_focus: True; disease_trajectory_focus: True
addressing_gaps
addressing_gaps:
- id: aireadi:gap:1
  name: Lack of multimodal T2DM datasets
  description: 'Provide a large-scale, harmonized, multi-site, multi-domain dataset enabling AI/ML analyses
    not feasible with existing sources (e.g., claims or EHR alone). With 4,000 participants and over 10
    variable domains, this is the largest publicly accessible dataset of its kind for T2DM research.

    '
- id: aireadi:gap:2
  name: Demographic underrepresentation
  description: 'Address demographic inequities in T2DM research by recruiting equal proportions across
    four race/ethnic groups (Asian, Black, Hispanic, White) and both biological sexes, improving upon
    many previous epidemiological studies and clinical trials that lacked diversity.

    '
- id: aireadi:gap:3
  name: AI-readiness of medical datasets
  description: 'Create a model for future AI-ready medical datasets through comprehensive metadata, standardized
    data formats, FAIR compliance, and ethical data governance practices that can be replicated for other
    health conditions.

    '
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Motivation or Purpose for Dataset Creation
evidencepurposes: 3 defined (understanding T2DM salutogenesis, establishing AI/ML data standards, addressing demographic inequities); addressing_gaps: 3 defined (lack of multimodal T2DM datasets, demographic underrepresentation, AI-readiness of medical datasets); description mentions salutogenesis pathway research
qualityClear scientific rationale with 3 purposes and 3 research gaps addressed. Salutogenesis (disease to health pathway) is novel scientific angle. Equity and AI-readiness motivations explicit.
semanticpurpose_count: 3; research_gap_count: 3; scientific_novelty: salutogenesis approach; motivation_clarity: high
creators
creators:
- id: aireadi:creator:1
  name: Aaron Lee
  description: Contact PI/Project Leader, University of Washington, Department of Ophthalmology, Assistant
    Professor
- id: aireadi:creator:2
  name: Cynthia Owsley
  description: Principal Investigator, University of Alabama at Birmingham, Department of Ophthalmology
    and Visual Sciences
- id: aireadi:creator:3
  name: Sally L. Baxter
  description: Co-Investigator, University of California San Diego, Department of Ophthalmology
- id: aireadi:creator:4
  name: Christopher G. Chute
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:5
  name: Megan E. Collins
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:6
  name: Jeffrey C. Edberg
  description: Co-Investigator, University of Alabama at Birmingham, Department of Medicine
- id: aireadi:creator:7
  name: Kadija Ferryman
  description: Co-Investigator, AI-READI Consortium (Bioethics)
- id: aireadi:creator:8
  name: Michelle Hribar
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:9
  name: Samantha Hurst
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:10
  name: Hiroshi Ishikawa
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:11
  name: Cecilia S. Lee
  description: Co-Investigator, University of Washington, Department of Ophthalmology
- id: aireadi:creator:12
  name: Alvin Y. Liu
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:13
  name: Gerald McGwin
  description: Co-Investigator, University of Alabama at Birmingham, Departments of Ophthalmology and
    Epidemiology
- id: aireadi:creator:14
  name: Shannon K. McWeeney
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:15
  name: Camille Nebeker
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:16
  name: Bhavesh Patel
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:17
  name: Sara Jean Singer
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:18
  name: Michael P. Snyder
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:19
  name: Joseph Manuel Yracheta
  description: Co-Investigator, AI-READI Consortium
- id: aireadi:creator:20
  name: Linda M. Zangwill
  description: Co-Investigator, University of California San Diego, Department of Ophthalmology
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Creators and Acknowledgements Documented
evidencecreators: 20 defined with names, affiliations, and roles (Contact PI Aaron Lee, PI Cynthia Owsley, 18 Co-Investigators); institutions: University of Washington, UAB, UCSD; funders acknowledge Research to Prevent Blindness and NIH grants
qualityComprehensive creator documentation (20 individuals) with roles, names, and institutional affiliations. PI and Co-I roles clearly designated. Multiple institutions acknowledged.
semanticcreator_count: 20; role_designation: True; institutional_affiliation: True; pi_identification: True; acknowledgements: funding sources and institutions
5/5 R20 Q7 (Metadata Quality & Content) Funding and Acknowledgements Completeness
levelFunders with grants + creators with affiliations
evidenceNIH grant OT2OD032644, exact amounts, 20 creators with affiliations
qualityComprehensive funding and creator documentation
correctnessGrant number follows NIH format, dates logically ordered
consistencyCreator institutions match collection sites
funders
funders:
- id: aireadi:funder:1
  name: NIH Common Fund Bridge2AI Program
  description: 'Funded through National Institutes of Health grant OT2OD032644, administered by NIH Office
    of the Director. Additional support from grants P30DK035816 (Nutrition and Obesity Research Center),
    UL1TR003096, and Research to Prevent Blindness. Total funding in 2022: $5,026,499. Opportunity Number:
    OTA-21-008. Project dates: September 1, 2022 to August 31, 2025.

    '
⚠ low R20 · correctness
issueGrant number OT2OD032644 follows NIH format correctly (Type OT2, Institute OD)
fieldsfunders
fixNo action needed - grant number format is valid
✓ 1/1 R10 10.Cross-Platform and Community Integration Related Datasets with Typed Relationships
evidenceexternal_resources: Bridge2AI Program link (parent program); keywords: Bridge2AI (program affiliation); subsets define hierarchical relationships (public vs controlled vs biorepository); funders: NIH Common Fund Bridge2AI (program context)
qualityClear relationship to Bridge2AI program (parent initiative) with program URL and multiple references. Internal hierarchical relationships via subsets. Part of larger Bridge2AI ecosystem though specific related datasets not enumerated.
semanticparent_program: Bridge2AI; program_url: True; subset_relationships: 3; ecosystem_integration: Bridge2AI consortium; specific_related_datasets: False
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Funding Sources and Mechanisms Listed
evidencefunders: NIH Common Fund Bridge2AI Program; description: grant OT2OD032644 administered by NIH Office of the Director, additional support from P30DK035816, UL1TR003096, Research to Prevent Blindness; total funding in 2022: $5,026,499; opportunity number OTA-21-008
qualityPrimary funding source (NIH Common Fund Bridge2AI) with specific grant numbers, administering office, additional grants, total funding amount, and opportunity number. Comprehensive funding transparency.
semanticfunding_agency: NIH; funding_program: Common Fund Bridge2AI; primary_grant: OT2OD032644; additional_grants: P30DK035816; UL1TR003096; total_funding_documented: True
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Grant IDs or Award Numbers Present
evidencefunders: OT2OD032644, P30DK035816, UL1TR003096; opportunity number OTA-21-008; external_resources: NIH RePORTER link for 1OT2OD032644-01 (10471118)
qualityMultiple grant numbers present (OT2OD032644, P30DK035816, UL1TR003096) with correct NIH format. RePORTER link validates grant. OT2 prefix indicates Other Transaction Award for OD (Office of Director). Format validation passes.
semanticgrant_number_format_valid: True; grant_numbers: OT2OD032644; P30DK035816; UL1TR003096; nih_format_compliance: True; grant_type: OT2 (Other Transaction), P30 (Center Core), UL1 (Clinical Translational Science); reporter_link: True
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Creators and Acknowledgements Documented
evidencecreators: 20 defined with names, affiliations, and roles (Contact PI Aaron Lee, PI Cynthia Owsley, 18 Co-Investigators); institutions: University of Washington, UAB, UCSD; funders acknowledge Research to Prevent Blindness and NIH grants
qualityComprehensive creator documentation (20 individuals) with roles, names, and institutional affiliations. PI and Co-I roles clearly designated. Multiple institutions acknowledged.
semanticcreator_count: 20; role_designation: True; institutional_affiliation: True; pi_identification: True; acknowledgements: funding sources and institutions
instances
instances:
- id: aireadi:instance:1
  name: Individual participants
  description: 'Individual participants aged 40 and older with and without Type 2 Diabetes Mellitus (T2DM).
    Target enrollment is 4,000 people, triple-balanced by self-reported race/ethnicity (Asian, Black,
    Hispanic, White), T2DM severity (no diabetes, pre-diabetes/lifestyle-controlled diabetes, diabetes
    treated with oral medications or non-insulin injections, insulin-controlled diabetes), and biological
    sex (male, female). Participants must speak, read, and understand English. Exclusion criteria include
    pregnancy and type 1 diabetes.

    '
✓ 1/1 R10 5.Data Composition and Structure Cohort or Subpopulations Characteristics Described
evidenceinstances: 4,000 participants aged 40+, triple-balanced by race/ethnicity (Asian, Black, Hispanic, White), sex (male, female), T2DM severity (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); subpopulations: 8 defined with target 1,000 participants each; inclusion: age 40+, English proficiency; exclusion: pregnancy, type 1 diabetes
qualityExtremely detailed cohort description with specific target (4,000), age criteria, triple-balanced design, 8 subpopulations with equal targets, and clear inclusion/exclusion criteria.
semantictarget_n: 4000; age_criteria: 40+; balancing_dimensions: 3; subpopulation_count: 8; inclusion_exclusion_criteria: True
✓ 1/1 R10 5.Data Composition and Structure Number of Instances or Samples Reported
evidenceinstances: target enrollment 4,000 people; updates: pilot data May 2024, v1.0.0 through July 31 2024, v2.0.0 and v3.0.0 released; enrollment began July 18, 2023, continues until November 30, 2026
qualityTarget sample size clearly stated (4,000 participants). Versioning provides transparency about progressive enrollment with specific release dates and enrollment timeline.
semantictarget_sample_size: 4000; enrollment_status: ongoing; enrollment_timeline: July 2023 - November 2026; version_transparency: True
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidencetitle and description focus on Type 2 Diabetes Mellitus; purposes: understanding T2DM salutogenesis, disease trajectories; instances: T2DM severity stratification (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); keywords: Type 2 Diabetes Mellitus, T2DM, salutogenesis; acquisition_methods cover T2DM-related domains (retinal complications, CGM, metabolic markers)
qualityPrimary condition (Type 2 Diabetes Mellitus) clearly defined with severity stratification, salutogenesis focus, and T2DM-specific measurements (retinal imaging, CGM, metabolic panels).
semanticprimary_condition: Type 2 Diabetes Mellitus; condition_stratification: 4 severity levels; complication_domains: retinal; metabolic; cardiovascular; cognitive; peripheral neuropathy; topic_clarity: high
subsets
subsets:
- id: aireadi:subset:1
  name: Public Access Dataset
  description: 'Includes data not considered sensitive personal health information, available to the public
    for download upon agreement with a license. Contains survey data, blood and urine lab results, fitness
    activity levels, clinical measurements (e.g., monofilament and cognitive function testing), retinal
    images, ECG, blood glucose levels, and environmental variables such as home air quality. Available
    at https://fairhub.io/datasets/2.

    '
- id: aireadi:subset:2
  name: Controlled Access Dataset
  description: 'Includes sensitive data accessible by entering into a data use agreement. Contains 5-digit
    zip code, sex, race, ethnicity, genetic sequencing data (from buffy coats), past health records, medications,
    and traffic and accident reports. Access requirements are being developed by the Data Access Committee.

    '
- id: aireadi:subset:3
  name: Biorepository
  description: 'Biobanked samples stored at UAB Center for Clinical and Translational Science (CCTS),
    including plasma, serum, buffy coats, peripheral blood mononuclear cells (PBMCs), PAXgene RNA, and
    urine. Available to researchers for future ancillary studies according to procedures and policies
    in development. Finite number of samples available.

    '
⚠ low R20 · consistency
issueLicense CC BY-NC 4.0 appropriately restrictive for sensitive health data with dual-tier access (public/controlled)
fieldslicense_and_use_terms, subsets
fixNo action needed - license aligns with data sensitivity
✓ 1/1 R10 1.Dataset Discovery and Identification Hierarchical Structure (parent datasets, relationships)
evidencesubsets: 3 defined (Public Access Dataset, Controlled Access Dataset, Biorepository) with clear hierarchical relationships and access distinctions
qualityClear hierarchical structure with 3 well-defined subsets differentiated by access level and content type. Demonstrates dataset composition.
semanticsubset_count: 3; hierarchy_clarity: high; relationship_typing: access-based
✓ 1/1 R10 10.Cross-Platform and Community Integration Related Datasets with Typed Relationships
evidenceexternal_resources: Bridge2AI Program link (parent program); keywords: Bridge2AI (program affiliation); subsets define hierarchical relationships (public vs controlled vs biorepository); funders: NIH Common Fund Bridge2AI (program context)
qualityClear relationship to Bridge2AI program (parent initiative) with program URL and multiple references. Internal hierarchical relationships via subsets. Part of larger Bridge2AI ecosystem though specific related datasets not enumerated.
semanticparent_program: Bridge2AI; program_url: True; subset_relationships: 3; ecosystem_integration: Bridge2AI consortium; specific_related_datasets: False
✓ 1/1 R10 2.Dataset Access and Retrieval Access Policy and IP Restrictions Defined
evidencelicense_and_use_terms: CC BY-NC 4.0 with detailed AI-READI Data License Agreement; subsets define public vs controlled access; license prohibits clinical treatment decisions, re-identification, sharing with non-licensed parties
qualityComprehensive access policy with dual licensing (public CC BY-NC 4.0 + controlled access DUA). Clear restrictions and use terms documented.
semanticlicense_specificity: high; access_levels: 2; restriction_clarity: explicit
✓ 1/1 R10 2.Dataset Access and Retrieval Download URL or Platform Link Available
evidencepage: https://fairhub.io/datasets/2; subsets specify public data available for download upon license agreement, controlled data via DUA
qualityDirect platform link to FAIRhub repository with clear download mechanisms described for both public and controlled access data.
semanticdownload_url_present: True; platform: FAIRhub; access_mechanism_clarity: high
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Deidentification Method Described
evidencesubsets distinguish public (de-identified, not sensitive PHI) from controlled access (5-digit zip, detailed demographics, genetic data, health records); license prohibits re-identification attempts
qualityClear deidentification approach with tiered access: public dataset contains de-identified non-sensitive data, controlled dataset contains potentially identifiable elements (5-digit zip, genetics). Re-identification explicitly prohibited.
semanticdeidentification_approach: tiered access with public de-identified subset; identifiers_removed_from_public: detailed location; genetics; medical records; controlled_access_for_sensitive: True; re_identification_prohibition: True
sampling_strategies
sampling_strategies:
- id: aireadi:sampling:1
  name: Triple-balanced recruitment
  description: 'Recruitment sampling procedures aimed at achieving approximately equal distribution of
    participants across three dimensions: (1) race/ethnicity (Asian, Black, Hispanic, White), (2) T2DM
    severity (no diabetes, pre-diabetes/lifestyle-controlled, medication-controlled, insulin-controlled),
    and (3) biological sex (male, female). This balanced design is critical for developing unbiased machine
    learning models.

    '
  is_sample: true
  is_random: false
  is_representative: false
  why_not_representative:
  - 'The triple-balanced design intentionally over-samples racial/ethnic minority groups and specific
    diabetes severity groups relative to their population prevalence, to enable unbiased AI/ML model development.
    Participants are volunteers, introducing volunteer selection bias that may limit generalizability
    to non-volunteer populations.

    '
  strategies:
  - Targeted recruitment to balance demographics across race/ethnicity, sex, and diabetes severity
  - Wave-based recruitment with monitoring and adjustment through under- and oversampling
  - Recruitment from electronic health records screening using ICD-10 codes (E11.X for T2DM, R73.09 for
    pre-diabetes)
  - Personalized invitation letters and emails with REDCap recruitment interface
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: not representative, volunteer selection bias documented; discouraged_uses: pilot data and periodic updates may not have achieved balanced distribution; preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, practice subjects, data validation in REDCap); cleaning_strategies: pilot enrollment July-November 2023 to ensure coordinator familiarity
qualityQuality limitations explicitly documented (volunteer bias, non-representativeness, balance not achieved in early versions). Extensive QC measures documented (training, calibration, validation). Honest about limitations.
semanticlimitations_documented: True; bias_acknowledged: volunteer selection bias; quality_control_measures: comprehensive; pilot_phase_for_quality: True
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Known Limitations Documented
evidencesampling_strategies.why_not_representative: triple-balanced design intentionally over-samples racial/ethnic minorities and diabetes severity groups, volunteer selection bias limits generalizability to non-volunteers; discouraged_uses: pilot data may not have achieved balanced distribution, ongoing enrollment limitations
qualityLimitations explicitly documented including non-representativeness rationale, volunteer bias, generalizability constraints, and temporal limitations during ongoing enrollment.
semanticlimitations_section: True; limitation_count: 3; generalizability_discussed: True; temporal_limitations: True
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Systematic Biases Identified and Described
evidencesampling_strategies: volunteer selection bias documented; why_not_representative: triple-balanced over-sampling creates intentional imbalance relative to population prevalence for equity purposes; discouraged_uses: early data may have sampling imbalance during recruitment waves
qualityVolunteer bias explicitly identified. Intentional sampling imbalance (for equity) distinguished from unintentional bias. Wave-based recruitment bias acknowledged for early releases.
semanticbias_documentation: True; volunteer_bias: True; sampling_bias_acknowledged: True; intentional_vs_unintentional_bias: distinguished
subpopulations
subpopulations:
- id: aireadi:subpop:1
  name: Asian participants
  description: Self-reported Asian race/ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:2
  name: Black participants
  description: Self-reported Black race/ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:3
  name: Hispanic participants
  description: Self-reported Hispanic ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:4
  name: White participants
  description: Self-reported White race/ethnicity, target approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:5
  name: No diabetes
  description: Participants without diabetes diagnosis, target approximately 1,000 participants (25% of
    sample)
- id: aireadi:subpop:6
  name: Pre-diabetes and lifestyle-controlled diabetes
  description: Participants with pre-diabetes or lifestyle-controlled diabetes, target approximately 1,000
    participants (25% of sample)
- id: aireadi:subpop:7
  name: Medication-controlled diabetes
  description: Participants with diabetes treated with oral medications or non-insulin injections, target
    approximately 1,000 participants (25% of sample)
- id: aireadi:subpop:8
  name: Insulin-controlled diabetes
  description: Participants with insulin-controlled diabetes, target approximately 1,000 participants
    (25% of sample)
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Vulnerable Populations and Compensation Documented
evidencesubpopulations document racial/ethnic diversity (Asian, Black, Hispanic, White 25% each); triple-balanced sampling designed for equity; bioethics guidance and Community Advisory Board with diversity in race/ethnicity; exclusion criteria include pregnancy (vulnerable population protection)
qualityExplicit attention to vulnerable and underrepresented populations with balanced sampling, community advisory board, bioethics oversight, and protective exclusion criteria. Compensation not documented but ethical framework strong.
semanticvulnerable_population_protection: True; diversity_framework: triple-balanced (race/ethnicity, sex, diabetes severity); community_advisory_board: True; exclusion_criteria_for_protection: True; compensation_documentation: False
✓ 1/1 R10 5.Data Composition and Structure Cohort or Subpopulations Characteristics Described
evidenceinstances: 4,000 participants aged 40+, triple-balanced by race/ethnicity (Asian, Black, Hispanic, White), sex (male, female), T2DM severity (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); subpopulations: 8 defined with target 1,000 participants each; inclusion: age 40+, English proficiency; exclusion: pregnancy, type 1 diabetes
qualityExtremely detailed cohort description with specific target (4,000), age criteria, triple-balanced design, 8 subpopulations with equal targets, and clear inclusion/exclusion criteria.
semantictarget_n: 4000; age_criteria: 40+; balancing_dimensions: 3; subpopulation_count: 8; inclusion_exclusion_criteria: True
collection_mechanisms
collection_mechanisms:
- id: aireadi:collection:1
  name: In-person data collection visits
  description: 'Single study encounter per participant at one of three data collection sites (Birmingham,
    San Diego, Seattle). Multi-domain protocol containing over 10 data collection domains performed during
    the visit lasting between 2.5 and 4 hours.

    '
- id: aireadi:collection:2
  name: Electronic health record screening
  description: 'Source population identified by screening electronic health records for patients aged
    40+ who had medical encounters between 2020-2025. ICD-10 codes used to identify T2DM (E11.X) and pre-diabetes
    (R73.09) cases.

    '
- id: aireadi:collection:3
  name: Wave-based recruitment
  description: 'Participants recruited in waves to facilitate efficient sampling. Composition and size
    of each wave influenced by observed participation characteristics to maintain balance across race/ethnicity,
    sex, and diabetes severity. Enrollment began July 18, 2023 and continues until November 30, 2026.

    '
- id: aireadi:collection:4
  name: Home-based wearable monitoring
  description: 'Continuous glucose monitoring (Dexcom G6, 5-minute intervals), physical activity monitoring
    (Garmin VivoSmart 5), and environmental sensor monitoring (temperature, humidity, air quality) conducted
    at participants'' homes over 10-day monitoring periods.

    '
- id: aireadi:collection:5
  name: Biospecimen collection and biobanking
  description: 'Blood (53 mL) and urine collected during study visit. Local processing for plasma, serum,
    buffy coats at all sites. Centralized biobanking at UAB CCTS. Standardized operating procedures ensure
    consistent handling.

    '
✗ 0/1 R10 6.Data Provenance and Version Tracking Provenance and Source Derivation Documented
evidenceNo was_derived_from field present; collection_mechanisms document primary data collection from EHR screening, in-person visits, home monitoring, biospecimen collection; no indication this dataset derives from other datasets
qualityProvenance partially documented through collection mechanisms (primary data collection from human subjects, EHR screening). However, no was_derived_from field or parent dataset relationships documented. This is a primary dataset, not derived, so full provenance documentation may be less applicable, but source EHR systems and instrument provenance could be more detailed.
semanticwas_derived_from_field: False; collection_provenance: documented; instrument_provenance: partial; primary_vs_derived: primary data collection
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Collection Mechanisms and Settings Described
evidencecollection_mechanisms: 5 defined (in-person visits lasting 2.5-4 hours, EHR screening with ICD-10 codes, wave-based recruitment, home wearable monitoring for 10 days, biospecimen collection and biobanking); settings: 3 sites (Birmingham AL, San Diego CA, Seattle WA); enrollment: July 18, 2023 to November 30, 2026
qualityDetailed collection mechanisms (5 methods) with specific sites, visit duration, screening codes, monitoring duration, and enrollment timeline. Sufficient for replication.
semanticcollection_mechanism_count: 5; site_count: 3; site_locations: Birmingham AL; San Diego CA; Seattle WA; timeline_documented: True; visit_duration: 2.5-4 hours; replication_feasibility: high
acquisition_methods
acquisition_methods:
- id: aireadi:acquisition:1
  name: Survey and questionnaire data
  description: 'Self-reported data collected via REDCap interfaces including demographics, medical history,
    social determinants of health, depression screening (CES-D-10), diabetes-related emotional distress
    (PAID scale), diabetes self-care score, dietary assessment, ophthalmic survey, substance use (smoking,
    alcohol, vaping, marijuana), general health conditions, and current medications with RxNorm codes.

    '
- id: aireadi:acquisition:2
  name: Physical measurements and vital signs
  description: 'Height, weight, waist and hip circumference (waist-hip ratio and BMI calculated), blood
    pressure (systolic and diastolic, measured twice separated by 2 minutes), and heart rate collected
    during in-person visit using standardized protocols.

    '
- id: aireadi:acquisition:3
  name: Retinal imaging
  description: 'Multi-device retinal imaging protocol capturing data from Aurora IQ (Optomed), EIDON widefield
    truecolor confocal fundus system (iCare), Spectralis HRA OCT and OCTA (Heidelberg Engineering), Maestro2
    3D OCT-1 (Topcon), Triton DRI OCT (Topcon), Cirrus 5000 (Carl Zeiss), and Fluorescence Lifetime Imaging
    Ophthalmoscopy (FLIO, Heidelberg Engineering). Both eyes imaged under dilated conditions (except Aurora
    IQ). Output formats include DICOM, with proprietary formats (.fda, .sdt) converted to DICOM.

    '
- id: aireadi:acquisition:4
  name: Visual function testing
  description: 'Visual acuity and contrast sensitivity under photopic (daylight) and mesopic (dim light)
    conditions using Electronic Visual Acuity tester (M&S Technology) and Mars chart (Mars Perceptrix).
    Autorefraction data collected using Topcon KR 800.

    '
- id: aireadi:acquisition:5
  name: Clinical laboratory testing
  description: 'Complete blood count (CBC) from fresh whole blood at local CLIA-certified labs. Central
    lab testing at UW Nutrition and Obesity Research Center (NORC) for EDTA plasma tests (NT-proBNP, Troponin-T,
    C-peptide, insulin), serum tests (CRP-HS, lipid panel, glucose, kidney and liver function markers),
    whole blood tests (HbA1c), and urine tests (creatinine, albumin, other markers).

    '
- id: aireadi:acquisition:6
  name: Electrocardiogram (ECG)
  description: '12-lead ECG data collected using Philips Pagewriter TC30 Cardiograph during study visit
    with participant sitting in reclining chair or lying supine at recorded position (0 degrees, 30 degrees,
    60 degrees, or 90 degrees relative to supine).

    '
- id: aireadi:acquisition:7
  name: Cognitive function testing
  description: 'Montreal Cognitive Assessment (MoCA) administered electronically on iPad using MoCA Duo
    Application (total score, section subscores, Memory Index Score, task completion times). Total possible
    score is 30, with higher numbers representing better performance.

    '
- id: aireadi:acquisition:8
  name: Peripheral neuropathy assessment
  description: 'Monofilament testing performed to assess peripheral neuropathy using 10g filament at three
    locations on each foot (10 times per location) with participant''s eyes closed, responding yes/no
    whether they feel the filament.

    '
- id: aireadi:acquisition:9
  name: Continuous glucose monitoring
  description: 'Dexcom G6 Continuous Glucose Monitor capturing blood glucose measurements (mg/dL) every
    5 minutes for 10 days. Data exported in CSV format.

    '
- id: aireadi:acquisition:10
  name: Physical activity monitoring
  description: 'Garmin VivoSmart 5 wearable device capturing number of steps, heart rate, sleep duration
    (circadian and diurnal rhythm), and oxygen saturation for 10 days. Data exported in .FIT format and
    converted to mHealth standard.

    '
- id: aireadi:acquisition:11
  name: Environmental monitoring
  description: 'Custom-designed environmental sensor (Karalis Johnson Retina Center, UW) capturing ambient
    temperature, relative humidity, nitrogen oxides (NO and NO2), volatile organic compounds, particulate
    matter (PM1.0, PM2.5, PM4, PM10), and multi-spectral light intensity (11 measurements) for 10 days.
    Data in CSV format.

    '
- id: aireadi:acquisition:12
  name: Biospecimen collection
  description: 'Non-fasting blood (53 mL) and urine collection. Processing includes whole blood for CBC,
    EDTA plasma, serum, buffy coats for genomic DNA extraction, peripheral blood mononuclear cells (PBMCs)
    from CPT tubes, and PAXgene RNA vacutainers. Samples stored at UAB CCTS biorepository at appropriate
    temperatures.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Variable Metadata with Identifiers Defined
evidenceacquisition_methods: 12 detailed methods documenting variables across survey/questionnaire (demographics, CES-D-10, PAID, RxNorm), physical measurements (height, weight, BMI, waist-hip ratio, BP, HR), retinal imaging (8 devices), visual function, clinical labs (CBC, lipids, HbA1c, kidney/liver markers), ECG, MoCA cognitive scores, monofilament testing, CGM (mg/dL every 5 min), activity monitoring (steps, HR, sleep, O2), environmental sensors (11 measurements)
qualityExtensive variable-level documentation across 12 acquisition methods with specific instruments, measurements, units, and variable names. Rich metadata for each domain.
semanticacquisition_method_count: 12; variable_documentation_depth: high; measurement_units_specified: True; instrument_documentation: comprehensive
✓ 1/1 R10 5.Data Composition and Structure Variable-Level Metadata and Tabular Flag
evidenceacquisition_methods: 12 detailed methods documenting variables across all domains (survey: demographics, CES-D-10, PAID, dietary, medications with RxNorm; physical: height, weight, BMI, waist-hip ratio, BP, HR; imaging: 8 devices; labs: CBC, lipids, HbA1c, glucose, kidney/liver markers; ECG; MoCA scores with subscores; monofilament 10 locations; CGM 5-min intervals; Garmin: steps, HR, sleep, O2; environmental: 11 measurements); distribution_formats indicate CSV for tabular data
qualityComprehensive variable-level documentation across 12 acquisition methods with specific measurements, instruments, units, intervals, and scores. Tabular data indicated through CSV format.
semanticvariable_documentation_depth: high; domain_count: 12; measurement_specificity: high; tabular_format_confirmed: True
✓ 1/1 R10 5.Data Composition and Structure Data Topics or Conditions Represented
evidencetitle and description focus on Type 2 Diabetes Mellitus; purposes: understanding T2DM salutogenesis, disease trajectories; instances: T2DM severity stratification (no diabetes, pre-diabetes/lifestyle, medication-controlled, insulin-controlled); keywords: Type 2 Diabetes Mellitus, T2DM, salutogenesis; acquisition_methods cover T2DM-related domains (retinal complications, CGM, metabolic markers)
qualityPrimary condition (Type 2 Diabetes Mellitus) clearly defined with severity stratification, salutogenesis focus, and T2DM-specific measurements (retinal imaging, CGM, metabolic panels).
semanticprimary_condition: Type 2 Diabetes Mellitus; condition_stratification: 4 severity levels; complication_domains: retinal; metabolic; cardiovascular; cognitive; peripheral neuropathy; topic_clarity: high
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Data Acquisition Methods Listed
evidenceacquisition_methods: 12 detailed methods with specific instruments (REDCap for surveys, 8 retinal imaging devices with manufacturers, Philips Pagewriter TC30 ECG, MoCA Duo iPad app, Dexcom G6 CGM, Garmin VivoSmart 5, custom environmental sensor, clinical lab equipment); measurement details (CGM every 5 min, BP twice 2 min apart, monofilament 10 times per location)
qualityComprehensive acquisition documentation (12 methods) with manufacturer names, device models, measurement frequencies, protocols. Exceptional detail for technical replication.
semanticacquisition_method_count: 12; instrument_specification: high (manufacturer + model); measurement_protocol_detail: high; device_count: 20+; replication_feasibility: very high
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Software and Tools Documented
evidenceacquisition_methods mention REDCap (data management), MoCA Duo Application (iPad), specific device software implied (Dexcom G6, Garmin VivoSmart 5, Philips ECG, retinal imaging systems); preprocessing mentions format conversion tools (proprietary to DICOM/mHealth); external_resources link to documentation (docs.aireadi.org)
qualitySoftware documented for data collection (REDCap, MoCA Duo, device software) and processing (format converters to DICOM/mHealth). Documentation portal provided for detailed methods.
semanticdata_management_software: REDCap; device_software_count: 8+ (retinal imaging systems, wearables, ECG); format_conversion_tools: documented but tools not named; documentation_portal: True
preprocessing_strategies
preprocessing_strategies:
- id: aireadi:preproc:1
  name: Data standardization and harmonization
  description: 'Data harmonized across three collection sites (Birmingham, San Diego, Seattle) using standardized
    operating procedures, common protocols, and centralized data management through REDCap. Ensures consistency
    and comparability across sites.

    '
  preprocessing_details:
  - Standardized operating procedures across all three sites
  - Common protocols and equipment across sites
  - Centralized data management through REDCap
  - Standardized training of study coordinators with certification process
  - Manual of Procedures (MOP) for reference
- id: aireadi:preproc:2
  name: Image format conversion
  description: 'Retinal imaging data converted from proprietary formats (.fda, .sdt) to DICOM standard
    for the dataset. Wearable device data converted from .FIT format to mHealth standard.

    '
  preprocessing_details:
  - Proprietary retinal imaging formats (.fda, .sdt) converted to DICOM
  - Wearable device data (.FIT) converted to mHealth standard
  - ECG data exported in .xml format
  - MoCA data exported in .csv format
- id: aireadi:preproc:3
  name: Biospecimen processing
  description: 'Standardized local processing for plasma, serum, and buffy coats using consistent protocols.
    Centralized processing of CPT tubes for PBMC isolation at UAB CCTS. Batch shipping of biospecimens
    for central clinical lab analyses.

    '
  preprocessing_details:
  - Standardized local processing for plasma, serum, buffy coats
  - Centralized PBMC processing at UAB CCTS
  - Batch shipping for central lab analyses at UW NORC
  - Genomic DNA extractions from stored buffy coats performed at UAB CCTS
- id: aireadi:preproc:4
  name: Quality control and validation
  description: 'Multiple quality control measures including standardized training of study coordinators,
    equipment calibration, duplicate measurements, and data validation checks in REDCap system. Data managers
    at each site oversee quality control before uploading to FAIRhub.

    '
  preprocessing_details:
  - Standardized training of study coordinators with certification
  - Equipment calibration protocols
  - Duplicate measurements for quality assurance (e.g., blood pressure measured twice)
  - Data validation checks in REDCap
  - Practice subjects required before enrolling participants
- id: aireadi:preproc:5
  name: Data mapping to standards
  description: 'All data mapped to applicable data standard formats such as Observational Medical Outcomes
    Partnership Common Data Model for clinical data and DICOM format for retinal imaging. Data stored
    and shared as AI-ready enabling immediate AI/ML research without reformatting.

    '
  preprocessing_details:
  - OMOP Common Data Model for clinical data
  - DICOM for retinal imaging
  - mHealth standard for wearable device data
  - RxNorm codes for medications
  - ICD-10 codes for diabetes classification
⚠ low R10 · completeness
issueFormat conversion tool names not specified in preprocessing documentation
fieldspreprocessing_strategies
fixSpecify software tools used for proprietary format conversions (e.g., .fda/.sdt to DICOM, .FIT to mHealth)
✓ 1/1 R10 10.Cross-Platform and Community Integration Community Standards or Schema Conformance
evidencepreprocessing_strategies: OMOP Common Data Model, DICOM, mHealth standard, RxNorm, ICD-10; description and keywords: FAIR principles compliance; license: CC BY-NC 4.0 (community standard license)
qualityConformance to multiple community standards (OMOP, DICOM, mHealth, RxNorm, ICD-10) with explicit FAIR principles adherence. CC BY-NC 4.0 is widely recognized standard license.
semanticstandard_count: 5; fair_compliance: True; standard_license: CC BY-NC 4.0; clinical_standards: OMOP CDM; RxNorm; ICD-10; technical_standards: DICOM; mHealth
✓ 1/1 R10 2.Dataset Access and Retrieval Distribution Formats and File Types Specified
evidencedistribution_formats: 4 defined (DICOM for imaging, CSV for tabular/time-series, mHealth standard for wearable data, XML for ECG); preprocessing_strategies mention format conversions from proprietary to standards
qualityComprehensive format documentation with 4 distinct distribution formats mapped to data types. Includes format conversion details from proprietary sources.
semanticformat_count: 4; standard_compliance: high (DICOM, mHealth, CSV, XML); proprietary_conversion_documented: True
✓ 1/1 R10 3.Data Reuse and Interoperability Data Formats Are Standardized (encoding, format)
evidencedistribution_formats: DICOM (imaging), CSV (tabular), mHealth standard (wearables), XML (ECG); preprocessing_strategies document conversion from proprietary formats (.fda, .sdt, .FIT) to standards
qualityAll data distributed in standardized formats (DICOM, CSV, mHealth, XML). Proprietary format conversion process documented for reproducibility.
semanticstandard_formats: DICOM; CSV; mHealth; XML; proprietary_conversion: True; interoperability_level: high
✓ 1/1 R10 3.Data Reuse and Interoperability Schema or Ontology Conformance Stated
evidencepreprocessing_strategies mention OMOP Common Data Model for clinical data, DICOM for imaging, mHealth standard for wearables, RxNorm codes for medications, ICD-10 codes for diabetes classification
qualityExplicit conformance to multiple standards: OMOP CDM (clinical), DICOM (imaging), mHealth (wearables), RxNorm (medications), ICD-10 (diagnoses). Strong semantic interoperability.
semanticstandards_referenced: OMOP CDM; DICOM; mHealth; RxNorm; ICD-10; standard_count: 5; semantic_interoperability: high
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: not representative, volunteer selection bias documented; discouraged_uses: pilot data and periodic updates may not have achieved balanced distribution; preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, practice subjects, data validation in REDCap); cleaning_strategies: pilot enrollment July-November 2023 to ensure coordinator familiarity
qualityQuality limitations explicitly documented (volunteer bias, non-representativeness, balance not achieved in early versions). Extensive QC measures documented (training, calibration, validation). Honest about limitations.
semanticlimitations_documented: True; bias_acknowledged: volunteer selection bias; quality_control_measures: comprehensive; pilot_phase_for_quality: True
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Preprocessing, Cleaning, and Labeling Strategies
evidencepreprocessing_strategies: 5 defined (data standardization/harmonization across sites, image format conversion from proprietary to DICOM/mHealth, biospecimen processing, quality control/validation, data mapping to standards); cleaning_strategies: multi-site harmonization with standardized protocols, REDCap validation, pilot enrollment for quality
qualityDetailed preprocessing (5 strategies) and cleaning (1 strategy with multiple components) documentation. Format conversions, QC measures, standardization procedures, and standards mapping all documented.
semanticpreprocessing_strategy_count: 5; cleaning_strategy_count: 1; format_conversion_documented: True; quality_control_documented: True; standards_mapping_documented: True
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) External Standards and Resources Referenced
evidencepreprocessing_strategies: OMOP CDM, DICOM, mHealth, RxNorm, ICD-10 referenced; external_resources: 9 resources including publications (BMJ Open 10.1136/bmjopen-2024-097449, Nature Metabolism 10.1038/s42255-024-01165-x), documentation (docs.aireadi.org), Zenodo (10.5281/zenodo.10642459), NIH RePORTER, Bridge2AI program
qualityMultiple standards referenced (5 standards) with publication DOIs (2 protocol papers), documentation portal, archived resources, and grant information. Strong external linkage.
semanticstandard_count: 5; publication_doi_count: 2; documentation_url: True; archived_resources: True; external_reference_count: 9
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Data Anomalies and Quality Issues Noted
evidencepreprocessing_strategies document QC measures (calibration, duplicate measurements, validation, practice subjects) implying awareness of potential quality issues; cleaning_strategies mention pilot enrollment to ensure coordinator familiarity and prevent quality issues; discouraged_uses warn about balance not achieved in early versions
qualityQuality issues addressed proactively through QC measures, pilot phase, and warnings about early data. Implicit acknowledgment of potential anomalies through extensive validation procedures.
semanticquality_control_documented: True; pilot_phase_for_quality: True; early_version_warnings: True; explicit_anomaly_list: False
cleaning_strategies
cleaning_strategies:
- id: aireadi:cleaning:1
  name: Multi-site harmonization
  description: 'Standardized protocols and procedures across all three data collection sites ensure data
    consistency and quality. Common equipment, training, and REDCap data management system used to maintain
    FAIR principles compliance.

    '
  cleaning_details:
  - Cross-site harmonization procedures
  - Standardized equipment and training
  - REDCap data management for quality
  - FAIR principles implementation
  - Pilot enrollment period (July 18 - November 30, 2023) to ensure coordinator familiarity
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: not representative, volunteer selection bias documented; discouraged_uses: pilot data and periodic updates may not have achieved balanced distribution; preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, practice subjects, data validation in REDCap); cleaning_strategies: pilot enrollment July-November 2023 to ensure coordinator familiarity
qualityQuality limitations explicitly documented (volunteer bias, non-representativeness, balance not achieved in early versions). Extensive QC measures documented (training, calibration, validation). Honest about limitations.
semanticlimitations_documented: True; bias_acknowledged: volunteer selection bias; quality_control_measures: comprehensive; pilot_phase_for_quality: True
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Preprocessing, Cleaning, and Labeling Strategies
evidencepreprocessing_strategies: 5 defined (data standardization/harmonization across sites, image format conversion from proprietary to DICOM/mHealth, biospecimen processing, quality control/validation, data mapping to standards); cleaning_strategies: multi-site harmonization with standardized protocols, REDCap validation, pilot enrollment for quality
qualityDetailed preprocessing (5 strategies) and cleaning (1 strategy with multiple components) documentation. Format conversions, QC measures, standardization procedures, and standards mapping all documented.
semanticpreprocessing_strategy_count: 5; cleaning_strategy_count: 1; format_conversion_documented: True; quality_control_documented: True; standards_mapping_documented: True
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Data Anomalies and Quality Issues Noted
evidencepreprocessing_strategies document QC measures (calibration, duplicate measurements, validation, practice subjects) implying awareness of potential quality issues; cleaning_strategies mention pilot enrollment to ensure coordinator familiarity and prevent quality issues; discouraged_uses warn about balance not achieved in early versions
qualityQuality issues addressed proactively through QC measures, pilot phase, and warnings about early data. Implicit acknowledgment of potential anomalies through extensive validation procedures.
semanticquality_control_documented: True; pilot_phase_for_quality: True; early_version_warnings: True; explicit_anomaly_list: False
intended_uses
intended_uses:
- id: aireadi:use:1
  name: AI/ML model development for T2DM
  description: 'Primary intended use is development and training of artificial intelligence and machine
    learning models to study Type 2 Diabetes Mellitus, disease trajectories, and salutogenesis (pathways
    to health resilience). Designed for pseudotime manifold analysis to predict disease progression.

    '
- id: aireadi:use:2
  name: Multi-modal T2DM research
  description: 'Research leveraging multiple data domains (imaging, clinical, genomic, wearable, environmental,
    survey) to understand complex interactions and relationships in T2DM progression and management.

    '
- id: aireadi:use:3
  name: Health equity research
  description: 'Studies examining racial and ethnic disparities in T2DM outcomes, social determinants
    of health effects, and development of equitable AI/ML applications for diverse populations.

    '
- id: aireadi:use:4
  name: Biomarker discovery
  description: 'Discovery of novel biomarkers for T2DM progression, complications, and salutogenesis using
    biospecimens from the biorepository.

    '
- id: aireadi:use:5
  name: Model dataset for AI-ready data standards
  description: 'Use as an exemplar for future AI-ready medical dataset development, demonstrating best
    practices in data collection, preparation, sharing, and ethical governance.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Use Guidance Provided (intended, prohibited uses)
evidenceintended_uses: 5 defined (AI/ML model development for T2DM, multi-modal research, health equity research, biomarker discovery, model dataset for standards); discouraged_uses: 3 defined (uses during ongoing enrollment without awareness, clinical decision-making without validation, re-identification attempts)
qualityClear use guidance with 5 intended uses and 3 discouraged uses. Covers appropriate research contexts and explicitly warns against clinical use and re-identification.
semanticintended_use_count: 5; discouraged_use_count: 3; use_clarity: high; ethical_constraints: explicit
discouraged_uses
discouraged_uses:
- id: aireadi:discouraged:1
  name: Uses during ongoing enrollment without awareness of limitations
  description: 'As enrollment is ongoing until November 2026, pilot data releases and periodic updates
    may not have achieved balanced distribution across all groups. Early versions should be used with
    awareness of this limitation.

    '
- id: aireadi:discouraged:2
  name: Clinical decision-making without validation
  description: 'Dataset is for research purposes. Any AI/ML models developed should undergo appropriate
    clinical validation before use in patient care or clinical decision-making.

    '
- id: aireadi:discouraged:3
  name: Re-identification attempts
  description: 'Attempts to re-identify participants from de-identified data violate ethical principles
    and data use agreements. The license explicitly prohibits attempts to identify or contact individual
    data subjects or groups.

    '
✓ 1/1 R10 3.Data Reuse and Interoperability Use Guidance Provided (intended, prohibited uses)
evidenceintended_uses: 5 defined (AI/ML model development for T2DM, multi-modal research, health equity research, biomarker discovery, model dataset for standards); discouraged_uses: 3 defined (uses during ongoing enrollment without awareness, clinical decision-making without validation, re-identification attempts)
qualityClear use guidance with 5 intended uses and 3 discouraged uses. Covers appropriate research contexts and explicitly warns against clinical use and re-identification.
semanticintended_use_count: 5; discouraged_use_count: 3; use_clarity: high; ethical_constraints: explicit
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: not representative, volunteer selection bias documented; discouraged_uses: pilot data and periodic updates may not have achieved balanced distribution; preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, practice subjects, data validation in REDCap); cleaning_strategies: pilot enrollment July-November 2023 to ensure coordinator familiarity
qualityQuality limitations explicitly documented (volunteer bias, non-representativeness, balance not achieved in early versions). Extensive QC measures documented (training, calibration, validation). Honest about limitations.
semanticlimitations_documented: True; bias_acknowledged: volunteer selection bias; quality_control_measures: comprehensive; pilot_phase_for_quality: True
✓ 1/1 R10 6.Data Provenance and Version Tracking Change Descriptions and Errata Provided
evidenceupdates: pilot data May 2024, v1.0.0 data through July 31 2024 released November 2024, v2.0.0 and v3.0.0 released with additional participants; discouraged_uses warns about pilot data limitations and ongoing enrollment affecting balance
qualityUpdate descriptions provided with release dates and scope (additional participants). Limitations of early versions documented. Errata not explicitly mentioned but change transparency present.
semanticupdate_descriptions: True; release_timeline: documented; version_scope_changes: additional participants; errata_section: False
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Known Limitations Documented
evidencesampling_strategies.why_not_representative: triple-balanced design intentionally over-samples racial/ethnic minorities and diabetes severity groups, volunteer selection bias limits generalizability to non-volunteers; discouraged_uses: pilot data may not have achieved balanced distribution, ongoing enrollment limitations
qualityLimitations explicitly documented including non-representativeness rationale, volunteer bias, generalizability constraints, and temporal limitations during ongoing enrollment.
semanticlimitations_section: True; limitation_count: 3; generalizability_discussed: True; temporal_limitations: True
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Systematic Biases Identified and Described
evidencesampling_strategies: volunteer selection bias documented; why_not_representative: triple-balanced over-sampling creates intentional imbalance relative to population prevalence for equity purposes; discouraged_uses: early data may have sampling imbalance during recruitment waves
qualityVolunteer bias explicitly identified. Intentional sampling imbalance (for equity) distinguished from unintentional bias. Wave-based recruitment bias acknowledged for early releases.
semanticbias_documentation: True; volunteer_bias: True; sampling_bias_acknowledged: True; intentional_vs_unintentional_bias: distinguished
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Data Anomalies and Quality Issues Noted
evidencepreprocessing_strategies document QC measures (calibration, duplicate measurements, validation, practice subjects) implying awareness of potential quality issues; cleaning_strategies mention pilot enrollment to ensure coordinator familiarity and prevent quality issues; discouraged_uses warn about balance not achieved in early versions
qualityQuality issues addressed proactively through QC measures, pilot phase, and warnings about early data. Implicit acknowledgment of potential anomalies through extensive validation procedures.
semanticquality_control_documented: True; pilot_phase_for_quality: True; early_version_warnings: True; explicit_anomaly_list: False
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Sensitive Content and Warnings Provided
evidencesensitive_elements: 3 defined (genetic/biospecimen, geographic/demographic identifiers, medical history/records) with controlled access designation; discouraged_uses: re-identification attempts prohibited, clinical decision-making without validation warned against
qualitySensitive content clearly identified (3 categories) with access controls. Warnings against re-identification and clinical use without validation. Appropriate cautions for health data.
semanticsensitive_content_count: 3; access_controls: True; re_identification_warning: True; clinical_use_warning: True
license_and_use_terms
license_and_use_terms:
  id: aireadi:license:1
  name: Creative Commons Attribution Non-Commercial and AI-READI Data License
  description: 'Public access data distributed under Creative Commons Attribution Non-Commercial (CC BY-NC
    4.0) license. Permits others to distribute, remix, adapt, build upon this work non-commercially, and
    license their derivative works on different terms, provided the original work is properly cited, appropriate
    credit is given, any changes made indicated, and the use is non-commercial. Controlled access data
    requires a separate data use agreement with the University of Washington as Licensor. The AI-READI
    Data License Agreement prohibits clinical treatment decisions based on the data, re-identification
    attempts, and sharing data with non-licensed parties. See http://creativecommons.org/licenses/by-nc/4.0/
    for full CC BY-NC 4.0 license terms and https://docs.aireadi.org/ for the AI-READI specific license
    terms.

    '
⚠ low R20 · consistency
issueLicense CC BY-NC 4.0 appropriately restrictive for sensitive health data with dual-tier access (public/controlled)
fieldslicense_and_use_terms, subsets
fixNo action needed - license aligns with data sensitivity
✓ 1/1 R10 10.Cross-Platform and Community Integration Citation and DOI for Cross-referencing
evidencedoi: 10.57895/fairhub.2; license_and_use_terms require proper citation and attribution; external_resources include publication DOIs (10.1136/bmjopen-2024-097449, 10.1038/s42255-024-01165-x) and Zenodo DOI (10.5281/zenodo.10642459)
qualityDataset DOI present (10.57895/fairhub.2) with citation requirement in license. Related publication DOIs provided for cross-referencing. Strong citation ecosystem.
semanticdataset_doi: 10.57895/fairhub.2; citation_requirement: True; publication_dois: 2; zenodo_doi: True; cross_reference_count: 4
✓ 1/1 R10 2.Dataset Access and Retrieval Access Policy and IP Restrictions Defined
evidencelicense_and_use_terms: CC BY-NC 4.0 with detailed AI-READI Data License Agreement; subsets define public vs controlled access; license prohibits clinical treatment decisions, re-identification, sharing with non-licensed parties
qualityComprehensive access policy with dual licensing (public CC BY-NC 4.0 + controlled access DUA). Clear restrictions and use terms documented.
semanticlicense_specificity: high; access_levels: 2; restriction_clarity: explicit
✓ 1/1 R10 3.Data Reuse and Interoperability License Terms Allow Reuse
evidencelicense_and_use_terms: CC BY-NC 4.0 permits distribution, remix, adaptation, building upon work non-commercially with proper citation; controlled access via DUA
qualityClear reuse permissions under CC BY-NC 4.0 with explicit allowances for derivative works, remixing, and building upon with attribution requirement.
semanticreuse_permitted: True; license_standard: CC BY-NC 4.0; attribution_required: True; commercial_use: False
distribution_formats
distribution_formats:
- id: aireadi:format:1
  name: DICOM for imaging
  description: 'Retinal imaging data distributed in DICOM format (converted from proprietary .fda and
    .sdt formats for standardization).

    '
- id: aireadi:format:2
  name: CSV for tabular and time-series data
  description: 'Survey data, clinical lab results, continuous glucose monitoring, environmental sensor
    data, and other tabular/time-series data provided in CSV format.

    '
- id: aireadi:format:3
  name: mHealth standard for wearable data
  description: 'Physical activity monitoring data (from Garmin VivoSmart 5) converted from .FIT format
    to mHealth standard for interoperability.

    '
- id: aireadi:format:4
  name: XML for ECG data
  description: 'Electrocardiogram data from Philips Pagewriter TC30 exported in .xml format.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Distribution Formats and File Types Specified
evidencedistribution_formats: 4 defined (DICOM for imaging, CSV for tabular/time-series, mHealth standard for wearable data, XML for ECG); preprocessing_strategies mention format conversions from proprietary to standards
qualityComprehensive format documentation with 4 distinct distribution formats mapped to data types. Includes format conversion details from proprietary sources.
semanticformat_count: 4; standard_compliance: high (DICOM, mHealth, CSV, XML); proprietary_conversion_documented: True
✓ 1/1 R10 3.Data Reuse and Interoperability Data Formats Are Standardized (encoding, format)
evidencedistribution_formats: DICOM (imaging), CSV (tabular), mHealth standard (wearables), XML (ECG); preprocessing_strategies document conversion from proprietary formats (.fda, .sdt, .FIT) to standards
qualityAll data distributed in standardized formats (DICOM, CSV, mHealth, XML). Proprietary format conversion process documented for reproducibility.
semanticstandard_formats: DICOM; CSV; mHealth; XML; proprietary_conversion: True; interoperability_level: high
✓ 1/1 R10 5.Data Composition and Structure Variable-Level Metadata and Tabular Flag
evidenceacquisition_methods: 12 detailed methods documenting variables across all domains (survey: demographics, CES-D-10, PAID, dietary, medications with RxNorm; physical: height, weight, BMI, waist-hip ratio, BP, HR; imaging: 8 devices; labs: CBC, lipids, HbA1c, glucose, kidney/liver markers; ECG; MoCA scores with subscores; monofilament 10 locations; CGM 5-min intervals; Garmin: steps, HR, sleep, O2; environmental: 11 measurements); distribution_formats indicate CSV for tabular data
qualityComprehensive variable-level documentation across 12 acquisition methods with specific measurements, instruments, units, intervals, and scores. Tabular data indicated through CSV format.
semanticvariable_documentation_depth: high; domain_count: 12; measurement_specificity: high; tabular_format_confirmed: True
maintainers
maintainers:
- id: aireadi:maintainer:1
  name: AI-READI Consortium
  description: 'Multidisciplinary consortium managing dataset maintenance including data collection sites,
    coordinating centers, and data governance committees. Contact through the University of Washington
    as lead institution and data coordination center. Documentation maintained at https://docs.aireadi.org/
    with version-specific guides for each data release.

    '
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2; FAIRhub is recognized FAIR-compliant repository; external_resources include FAIRhub, Zenodo (10.5281/zenodo.10642459); maintainers: AI-READI Consortium via University of Washington
qualityPublished on FAIRhub (FAIR-compliant repository) with Zenodo archival. Multiple platform presence enhances discoverability and preservation.
semanticprimary_platform: FAIRhub; platform_recognition: FAIR-compliant; archival_platform: Zenodo; multi_platform_presence: True
updates
updates:
  id: aireadi:updates:1
  name: Periodic data releases
  description: 'Dataset updated periodically as enrollment progresses toward target of 4,000 participants
    by November 2026. Version-specific documentation maintained for each release. Pilot data released
    May 2024. Data through July 31, 2024 released November 2024 as v1.0.0. Subsequent versions v2.0.0
    and v3.0.0 released with additional participants. Final dataset expected after completion of enrollment
    by November 2026.

    '
  frequency: Periodic releases with ongoing enrollment; final release planned for late 2026
  update_details:
  - Periodic data releases as enrollment continues toward 4,000 participant target
  - Pilot data released May 2024
  - v1.0.0 data through July 31, 2024 released November 2024
  - v2.0.0 and v3.0.0 released with additional participants
  - Final dataset expected after completion of 4,000 participant enrollment by November 2026
  - Dataset versioning implemented with version-specific documentation at https://docs.aireadi.org/
✓ 1/1 R10 5.Data Composition and Structure Number of Instances or Samples Reported
evidenceinstances: target enrollment 4,000 people; updates: pilot data May 2024, v1.0.0 through July 31 2024, v2.0.0 and v3.0.0 released; enrollment began July 18, 2023, continues until November 30, 2026
qualityTarget sample size clearly stated (4,000 participants). Versioning provides transparency about progressive enrollment with specific release dates and enrollment timeline.
semantictarget_sample_size: 4000; enrollment_status: ongoing; enrollment_timeline: July 2023 - November 2026; version_transparency: True
✓ 1/1 R10 5.Data Composition and Structure Data Quality Issues and Anomalies Documented
evidencesampling_strategies: not representative, volunteer selection bias documented; discouraged_uses: pilot data and periodic updates may not have achieved balanced distribution; preprocessing_strategies: quality control measures (standardized training, equipment calibration, duplicate measurements, practice subjects, data validation in REDCap); cleaning_strategies: pilot enrollment July-November 2023 to ensure coordinator familiarity
qualityQuality limitations explicitly documented (volunteer bias, non-representativeness, balance not achieved in early versions). Extensive QC measures documented (training, calibration, validation). Honest about limitations.
semanticlimitations_documented: True; bias_acknowledged: volunteer selection bias; quality_control_measures: comprehensive; pilot_phase_for_quality: True
✓ 1/1 R10 6.Data Provenance and Version Tracking Dataset Version Number Provided
evidenceupdates mention v1.0.0 (data through July 31, 2024), v2.0.0 and v3.0.0 releases; version-specific documentation maintained at docs.aireadi.org
qualitySemantic versioning used (v1.0.0, v2.0.0, v3.0.0) with version-specific documentation. Clear versioning scheme for progressive data releases.
semanticversioning_scheme: semantic versioning; versions_documented: v1.0.0; v2.0.0; v3.0.0; pilot; version_specific_docs: True
✓ 1/1 R10 6.Data Provenance and Version Tracking Version Access Methods Documented
evidenceupdates: version-specific documentation maintained at https://docs.aireadi.org/ for each release; FAIRhub landing page https://fairhub.io/datasets/2 provides access
qualityVersion-specific documentation URLs provided. FAIRhub platform likely supports version access but explicit version retrieval mechanism not detailed.
semanticversion_docs_url: True; repository_versioning: implied via FAIRhub; version_retrieval_explicit: False
✓ 1/1 R10 6.Data Provenance and Version Tracking Change Descriptions and Errata Provided
evidenceupdates: pilot data May 2024, v1.0.0 data through July 31 2024 released November 2024, v2.0.0 and v3.0.0 released with additional participants; discouraged_uses warns about pilot data limitations and ongoing enrollment affecting balance
qualityUpdate descriptions provided with release dates and scope (additional participants). Limitations of early versions documented. Errata not explicitly mentioned but change transparency present.
semanticupdate_descriptions: True; release_timeline: documented; version_scope_changes: additional participants; errata_section: False
✓ 1/1 R10 6.Data Provenance and Version Tracking Update Schedule or Frequency Indicated
evidenceupdates: periodic releases with ongoing enrollment; final release planned for late 2026 after completion of 4,000 participant enrollment by November 2026; frequency: periodic releases with ongoing enrollment; final dataset expected after completion
qualityUpdate frequency clearly stated (periodic releases during ongoing enrollment) with final release timeline (late 2026 after November 2026 enrollment completion).
semanticupdate_frequency: periodic (tied to enrollment progress); final_release_date: late 2026; enrollment_completion_date: November 30, 2026; schedule_clarity: high
retention_limit
retention_limit:
  id: aireadi:retention:1
  name: Data and biospecimen retention
  description: 'Digital data maintained according to NIH data sharing policies. Biospecimen retention
    subject to institutional policies and consent agreements at UAB CCTS. Finite number of biospecimen
    samples available for distribution to researchers. Procedures for reviewing and prioritizing biospecimen
    requests are under development.

    '
no field-level feedback matched
ethical_reviews
ethical_reviews:
- id: aireadi:ethics:1
  name: University of Washington IRB Approval
  description: 'Study approved by Institutional Review Board (IRB) of University of Washington (approval
    number STUDY00016228), with reliance agreements from IRBs of University of Alabama at Birmingham and
    University of California, San Diego. Written informed consent provided by all participants.

    '
⚠ low R10 · completeness
issueConflicts of interest statement not present in ethical review documentation
fieldsethical_reviews
fixAdd conflicts of interest disclosure for research team members
⚠ low R20 · consistency
issuehuman_subject_research.involves_human_subjects=True and ethical_reviews present - consistent and well-documented
fieldshuman_subject_research, ethical_reviews
fixNo action needed - ethics documentation is comprehensive
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards IRB or Ethics Review Documented
evidenceethical_reviews: University of Washington IRB approval STUDY00016228 with reliance agreements from UAB and UCSD; human_subject_research.involves_human_subjects: true; written informed consent from all participants; Community Advisory Board of 11 persons; bioethics guidance integrated
qualityComprehensive IRB documentation with specific approval number (STUDY00016228), multi-site reliance agreements, consent procedures, and community engagement. Strong ethical oversight.
semanticirb_approval: True; irb_number: STUDY00016228; multi_site_coordination: True; reliance_agreements: UAB; UCSD; consent_documented: True; community_engagement: True
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Informed Consent Obtained from Participants
evidenceethical_reviews: written informed consent provided by all participants; human_subject_research confirms IRB approval and consent; Community Advisory Board contributed to protocol development
qualityExplicit documentation of written informed consent from all participants. Community engagement in consent protocol development demonstrates ethical rigor.
semanticconsent_type: written; consent_universality: all participants; community_input_on_consent: True; consent_documentation: explicit
✗ 0/1 R10 9.Dataset Evaluation and Limitations Disclosure Ethical Review Details Including Conflicts
evidenceethical_reviews: IRB approval documented with number and reliance agreements; human_subject_research: bioethics guidance, Community Advisory Board; no explicit conflicts of interest statement
qualityEthical review thoroughly documented (IRB, bioethics, community engagement) but no conflicts of interest statement present. COI disclosure is standard for research datasets and should be included.
semanticirb_documented: True; bioethics_oversight: True; community_advisory_board: True; conflicts_of_interest: False
human_subject_research
human_subject_research:
  id: aireadi:hsr:1
  name: AI-READI Human Subjects Research
  description: 'Study involves human subjects research with IRB approval and written informed consent
    from all participants. Bioethics guidance integrated throughout study design. Community Advisory Board
    of 11 persons with diversity in race and ethnicity contributes to protocol development. Ethical and
    equitable data collection and management practices implemented across all three data collection sites.
    IRB approval number STUDY00016228 from University of Washington with reliance agreements from University
    of Alabama at Birmingham and University of California San Diego.

    '
  involves_human_subjects: true
⚠ low R10 · completeness
issueParticipant compensation not documented
fieldsparticipant_compensation, human_subject_research
fixDocument whether participants were compensated and if so, the compensation structure
⚠ low R20 · consistency
issuehuman_subject_research.involves_human_subjects=True and ethical_reviews present - consistent and well-documented
fieldshuman_subject_research, ethical_reviews
fixNo action needed - ethics documentation is comprehensive
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards IRB or Ethics Review Documented
evidenceethical_reviews: University of Washington IRB approval STUDY00016228 with reliance agreements from UAB and UCSD; human_subject_research.involves_human_subjects: true; written informed consent from all participants; Community Advisory Board of 11 persons; bioethics guidance integrated
qualityComprehensive IRB documentation with specific approval number (STUDY00016228), multi-site reliance agreements, consent procedures, and community engagement. Strong ethical oversight.
semanticirb_approval: True; irb_number: STUDY00016228; multi_site_coordination: True; reliance_agreements: UAB; UCSD; consent_documented: True; community_engagement: True
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Informed Consent Obtained from Participants
evidenceethical_reviews: written informed consent provided by all participants; human_subject_research confirms IRB approval and consent; Community Advisory Board contributed to protocol development
qualityExplicit documentation of written informed consent from all participants. Community engagement in consent protocol development demonstrates ethical rigor.
semanticconsent_type: written; consent_universality: all participants; community_input_on_consent: True; consent_documentation: explicit
✗ 0/1 R10 9.Dataset Evaluation and Limitations Disclosure Ethical Review Details Including Conflicts
evidenceethical_reviews: IRB approval documented with number and reliance agreements; human_subject_research: bioethics guidance, Community Advisory Board; no explicit conflicts of interest statement
qualityEthical review thoroughly documented (IRB, bioethics, community engagement) but no conflicts of interest statement present. COI disclosure is standard for research datasets and should be included.
semanticirb_documented: True; bioethics_oversight: True; community_advisory_board: True; conflicts_of_interest: False
sensitive_elements
sensitive_elements:
- id: aireadi:sensitive:1
  name: Genetic and biospecimen data
  description: 'Genomic DNA extracted from buffy coats, blood derivatives, and urine samples stored with
    potential for future genetic analyses. Available in controlled access dataset only. Includes genetic
    sequencing data from buffy coats, PBMCs, and PAXgene RNA.

    '
- id: aireadi:sensitive:2
  name: Geographic and demographic identifiers
  description: '5-digit zip code, detailed race, ethnicity, and sex information available in controlled
    access dataset only. Public dataset contains de-identified data.

    '
- id: aireadi:sensitive:3
  name: Medical history and records
  description: 'Past health records, medications with RxNorm codes, traffic and accident reports available
    in controlled access dataset only.

    '
✓ 1/1 R10 2.Dataset Access and Retrieval Regulatory Restrictions and Confidentiality Level Specified
evidencesensitive_elements: 3 defined (genetic/biospecimen, geographic/demographic identifiers, medical history/records) with controlled access designation; license prohibits re-identification
qualityExplicit documentation of sensitive data elements with controlled access requirements. Regulatory compliance through IRB and data use agreements.
semanticsensitivity_classification: present; regulatory_framework: IRB + DUA; data_protection_level: tiered
✓ 1/1 R10 4.Ethical Use and Privacy Safeguards Privacy Protections Beyond Deidentification
evidencelicense prohibits re-identification, sharing with non-licensed parties; Data Access Committee developing controlled access requirements; bioethics guidance throughout study; sensitive_elements documented with access restrictions
qualityMulti-layered privacy protections including contractual prohibitions, data access committee oversight, bioethics integration, and explicit sensitive data classification.
semanticdata_access_committee: True; contractual_protections: True; bioethics_oversight: True; multi_layered_approach: True
✓ 1/1 R10 9.Dataset Evaluation and Limitations Disclosure Sensitive Content and Warnings Provided
evidencesensitive_elements: 3 defined (genetic/biospecimen, geographic/demographic identifiers, medical history/records) with controlled access designation; discouraged_uses: re-identification attempts prohibited, clinical decision-making without validation warned against
qualitySensitive content clearly identified (3 categories) with access controls. Warnings against re-identification and clinical use without validation. Appropriate cautions for health data.
semanticsensitive_content_count: 3; access_controls: True; re_identification_warning: True; clinical_use_warning: True
external_resources
external_resources:
- id: aireadi:resource:1
  name: AI-READI Project Website
  description: Official project website with overview and resources
  external_resources:
  - https://aireadi.org/
- id: aireadi:resource:2
  name: AI-READI Dataset Documentation
  description: Comprehensive dataset documentation with version-specific guides
  external_resources:
  - https://docs.aireadi.org/
- id: aireadi:resource:3
  name: FAIRhub Dataset Landing Page
  description: Dataset repository and download portal for AI-READI data
  external_resources:
  - https://fairhub.io/datasets/2
- id: aireadi:resource:4
  name: Bridge2AI Program
  description: Parent NIH Common Fund program supporting AI-ready biomedical datasets
  external_resources:
  - https://bridge2ai.org/
- id: aireadi:resource:5
  name: NIH RePORTER Project Details
  description: Federal grant information and project details for grant 1OT2OD032644-01
  external_resources:
  - https://reporter.nih.gov/project-details/10471118
- id: aireadi:resource:6
  name: Data Sharing Information
  description: Policies and procedures for data access and sharing
  external_resources:
  - https://aireadi.org/goals/data-sharing
- id: aireadi:resource:7
  name: Zenodo Archive
  description: Additional dataset documentation and resources
  external_resources:
  - https://doi.org/10.5281/zenodo.10642459
- id: aireadi:resource:8
  name: Protocol Publication (BMJ Open)
  description: BMJ Open publication describing study design and protocol (Owsley et al. 2025)
  external_resources:
  - https://doi.org/10.1136/bmjopen-2024-097449
- id: aireadi:resource:9
  name: Nature Metabolism Commentary
  description: Overview of AI-READI approach and significance published in Nature Metabolism
  external_resources:
  - https://doi.org/10.1038/s42255-024-01165-x
✓ 1/1 R10 1.Dataset Discovery and Identification Landing Page and Resources (page, hierarchical resources)
evidencepage: https://fairhub.io/datasets/2; external_resources with 9 resource entries including project website, documentation, FAIRhub, Zenodo, publications
qualityLanding page provided with extensive external resources (9 distinct resources) including documentation, repository, publications, and grant information.
semanticlanding_page_present: True; resource_count: 9; url_validity: all_plausible
✓ 1/1 R10 10.Cross-Platform and Community Integration Dataset Published on a Recognized Platform
evidencepage: https://fairhub.io/datasets/2; FAIRhub is recognized FAIR-compliant repository; external_resources include FAIRhub, Zenodo (10.5281/zenodo.10642459); maintainers: AI-READI Consortium via University of Washington
qualityPublished on FAIRhub (FAIR-compliant repository) with Zenodo archival. Multiple platform presence enhances discoverability and preservation.
semanticprimary_platform: FAIRhub; platform_recognition: FAIR-compliant; archival_platform: Zenodo; multi_platform_presence: True
✓ 1/1 R10 10.Cross-Platform and Community Integration Citation and DOI for Cross-referencing
evidencedoi: 10.57895/fairhub.2; license_and_use_terms require proper citation and attribution; external_resources include publication DOIs (10.1136/bmjopen-2024-097449, 10.1038/s42255-024-01165-x) and Zenodo DOI (10.5281/zenodo.10642459)
qualityDataset DOI present (10.57895/fairhub.2) with citation requirement in license. Related publication DOIs provided for cross-referencing. Strong citation ecosystem.
semanticdataset_doi: 10.57895/fairhub.2; citation_requirement: True; publication_dois: 2; zenodo_doi: True; cross_reference_count: 4
✓ 1/1 R10 10.Cross-Platform and Community Integration Outreach Materials and Documentation Links
evidenceexternal_resources: 9 resources including project website (aireadi.org), comprehensive documentation (docs.aireadi.org with version-specific guides), data sharing information (aireadi.org/goals/data-sharing), publications (BMJ Open, Nature Metabolism), FAIRhub landing page, Zenodo archive, Bridge2AI program site, NIH RePORTER
qualityExtensive outreach and documentation (9 resources) including project website, versioned documentation portal, data sharing policies, peer-reviewed publications, and program context. Comprehensive user support.
semanticdocumentation_portal: True; project_website: True; version_specific_docs: True; publication_count: 2; data_sharing_policy_url: True; outreach_resource_count: 9
✓ 1/1 R10 10.Cross-Platform and Community Integration Related Datasets with Typed Relationships
evidenceexternal_resources: Bridge2AI Program link (parent program); keywords: Bridge2AI (program affiliation); subsets define hierarchical relationships (public vs controlled vs biorepository); funders: NIH Common Fund Bridge2AI (program context)
qualityClear relationship to Bridge2AI program (parent initiative) with program URL and multiple references. Internal hierarchical relationships via subsets. Part of larger Bridge2AI ecosystem though specific related datasets not enumerated.
semanticparent_program: Bridge2AI; program_url: True; subset_relationships: 3; ecosystem_integration: Bridge2AI consortium; specific_related_datasets: False
✓ 1/1 R10 2.Dataset Access and Retrieval Related Datasets and External Resources Linked
evidenceexternal_resources: 9 resources including project website (aireadi.org), documentation (docs.aireadi.org), FAIRhub, Zenodo (10.5281/zenodo.10642459), publications (BMJ Open, Nature Metabolism), NIH RePORTER, Bridge2AI program
qualityExtensive external resources (9 distinct) with publications, repositories, documentation, and parent program links. Strong ecosystem integration.
semanticexternal_resource_count: 9; publication_dois: 3; repository_links: 2; documentation_links: 2
✓ 1/1 R10 7.Scientific Motivation and Funding Transparency Grant IDs or Award Numbers Present
evidencefunders: OT2OD032644, P30DK035816, UL1TR003096; opportunity number OTA-21-008; external_resources: NIH RePORTER link for 1OT2OD032644-01 (10471118)
qualityMultiple grant numbers present (OT2OD032644, P30DK035816, UL1TR003096) with correct NIH format. RePORTER link validates grant. OT2 prefix indicates Other Transaction Award for OD (Office of Director). Format validation passes.
semanticgrant_number_format_valid: True; grant_numbers: OT2OD032644; P30DK035816; UL1TR003096; nih_format_compliance: True; grant_type: OT2 (Other Transaction), P30 (Center Core), UL1 (Clinical Translational Science); reporter_link: True
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) Software and Tools Documented
evidenceacquisition_methods mention REDCap (data management), MoCA Duo Application (iPad), specific device software implied (Dexcom G6, Garmin VivoSmart 5, Philips ECG, retinal imaging systems); preprocessing mentions format conversion tools (proprietary to DICOM/mHealth); external_resources link to documentation (docs.aireadi.org)
qualitySoftware documented for data collection (REDCap, MoCA Duo, device software) and processing (format converters to DICOM/mHealth). Documentation portal provided for detailed methods.
semanticdata_management_software: REDCap; device_software_count: 8+ (retinal imaging systems, wearables, ECG); format_conversion_tools: documented but tools not named; documentation_portal: True
✓ 1/1 R10 8.Technical Transparency (Data Collection and Processing) External Standards and Resources Referenced
evidencepreprocessing_strategies: OMOP CDM, DICOM, mHealth, RxNorm, ICD-10 referenced; external_resources: 9 resources including publications (BMJ Open 10.1136/bmjopen-2024-097449, Nature Metabolism 10.1038/s42255-024-01165-x), documentation (docs.aireadi.org), Zenodo (10.5281/zenodo.10642459), NIH RePORTER, Bridge2AI program
qualityMultiple standards referenced (5 standards) with publication DOIs (2 protocol papers), documentation portal, archived resources, and grant information. Strong external linkage.
semanticstandard_count: 5; publication_doi_count: 2; documentation_url: True; archived_resources: True; external_reference_count: 9

Unmatched feedback

Feedback that referenced multiple fields or no specific field.
5/5 R20 Q4 (Structural Completeness) File Enumeration and Type Variety
level>3 file types
evidence4 formats: DICOM, CSV, mHealth, XML
qualityExcellent format diversity for multimodal data
correctnessIndustry-standard formats for respective data types
consistencyFormats align with acquisition methods
1/1 R20 Q5 (Structural Completeness) Data File Size Availability
levelPass
evidence4,000 target enrollment with subpopulation stratification documented
qualityClear instance count documentation
correctnessInstance counts realistic for multi-site study
consistencySubpopulation counts consistent with stratification design
1/1 R20 Q6 (Metadata Quality & Content) Dataset Identification Metadata
levelPass
evidenceDOI 10.57895/fairhub.2, Zenodo DOI, publication DOIs
qualityMultiple persistent identifiers ensuring findability
correctnessAll DOI prefixes match known registrars
consistencyAll identifiers point to AI-READI resources
5/5 R20 Q8 (Metadata Quality & Content) Ethical and Privacy Declarations
levelComprehensive ethics documentation
evidenceIRB STUDY00016228, consent, Community Advisory Board, two-tier access
qualityExemplary ethics covering all dimensions
correctnessIRB number follows UW format, multi-site reliance appropriate
consistencyEthics aligns with data governance and access tiers
5/5 R20 Q9 (Metadata Quality & Content) Access Requirements and Governance Documentation
levelLicense + restrictions + confidentiality
evidenceCC BY-NC 4.0 + DUA, use restrictions, access mechanisms documented
qualityComprehensive governance framework
correctnessCC BY-NC 4.0 is standard license, DUA appropriate for sensitive data
consistencyLicense restrictions align with ethical commitments
5/5 R20 Q10 (Metadata Quality & Content) Interoperability and Standardization
levelStandard formats + schema compliance
evidenceOMOP CDM, DICOM, mHealth, RxNorm, ICD-10
qualityOutstanding interoperability through comprehensive standards
correctnessAll standards are industry-recognized and appropriate
consistencyStandards align with AI-ready claims
5/5 R20 Q11 (Technical Documentation) Tool and Software Transparency
levelComprehensive strategies with software
evidence12 acquisition methods with specific devices: Dexcom G6, Garmin, Philips, REDCap, MoCA Duo, 7 imaging systems
qualityExceptional device and software documentation
correctnessAll manufacturers/models are real medical equipment
consistencyTools align with data types
5/5 R20 Q12 (Technical Documentation) Collection Protocol Clarity
levelFull protocol with methods, collectors, timeframes
evidence5 collection mechanisms, 12 acquisition methods with technical specs, coordinator training, timeline July 2023-Nov 2026
qualityComprehensive protocol with operational detail
correctnessTimeline internally consistent, ICD-10 codes correct, visit duration realistic
consistencyMechanisms align with methods, sites match creator institutions
5/5 R20 Q13 (Technical Documentation) Version History Documentation
levelComprehensive versioning with release notes
evidencePilot May 2024, v1.0.0 Nov 2024, v2.0.0, v3.0.0, version-specific docs
qualityExcellent version history with clear timeline
correctnessVersion timeline logically ordered
consistencyReleases align with enrollment timeline
5/5 R20 Q14 (Technical Documentation) Associated Publications
levelMultiple references and dataset citation
evidenceBMJ Open DOI, Nature Metabolism DOI, Zenodo DOI, NIH RePORTER, dataset DOI
qualityStrong publication linkage
correctnessAll DOI prefixes correct
consistencyPublications directly relevant to dataset
5/5 R20 Q15 (Technical Documentation) Human Subject Representation
levelDetailed demographics and inclusion/exclusion
evidence4,000 participants, triple-balanced (4 races × 2 sexes × 4 severities), inclusion/exclusion criteria, transparency about non-representativeness
qualityExemplary multi-dimensional demographic detail
correctnessDemographic categories standard, sample size feasible
consistencySubpopulation targets align with stratification design
1/1 R20 Q16 (FAIRness & Accessibility) Findability (Persistent Links)
levelPass
evidence9 external resources with multiple persistent access points
qualityExcellent findability
correctnessURL structures valid for appropriate domains
consistencyAll links point to AI-READI resources
5/5 R20 Q17 (FAIRness & Accessibility) Accessibility (Access Mechanism)
levelFully defined access path
evidencePublic download via FAIRhub + CC BY-NC, controlled access via DUA with UW
qualityComprehensive dual-tier access documentation
correctnessTwo-tier model appropriate for mixed sensitivity data
consistencyAccess tiers align with data sensitivity
5/5 R20 Q19 (FAIRness & Accessibility) Data Integrity and Provenance
levelStructured version control with timestamps
evidenceRelease dates, data cutoff dates, version-specific docs, update rationale
qualityExcellent provenance with structured versioning
correctnessTimeline consistent with enrollment
consistencyProvenance chain coherent from source to release
1/1 R20 Q20 (FAIRness & Accessibility) Interlinking Across Platforms
levelPass
evidenceLinks to FAIRhub, project sites, Bridge2AI, NIH RePORTER, Zenodo, journals
qualityExcellent cross-platform integration
correctnessPlatform choices appropriate for purposes
consistencyLinkage supports FAIR principles
⚠ low R10 · completeness
issueProvenance field (was_derived_from) not present, though this is a primary dataset so may not be applicable
fieldswas_derived_from
fixConsider documenting source EHR systems and instrument provenance more explicitly if applicable

Recommendations

  1. R10 · Add conflicts of interest statement to ethical_reviews section for complete transparency
  2. R10 · Document participant compensation structure if applicable to human subject research
  3. R10 · Specify software tool names for format conversions (proprietary to DICOM/mHealth) in preprocessing_strategies
  4. R10 · Consider adding explicit citation text in a citation field to standardize how users reference the dataset
  5. R10 · Document EHR system provenance (which EHR platforms were used for screening) if technically feasible
  6. R10 · Add specific related datasets from Bridge2AI consortium with typed relationships if other Bridge2AI datasets are available
  7. R10 · Consider adding RRID for software tools and databases used (e.g., REDCap RRID) to enhance tool discoverability
  8. R10 · Add explicit anomaly list if any known data quality issues exist beyond those addressed by QC measures
  9. R20 · Add software version numbers and repository links
  10. R20 · Document participant compensation structure
  11. R20 · Add RRID identifiers for research resources
  12. R20 · Finalize and document controlled access procedures
  13. R20 · Explicitly document vulnerable population safeguards