About Innovative Medicine
Our expertise in Innovative Medicine is informed and inspired by patients, whose insights fuel our science-based advancements. Visionaries like you work on teams that save lives by developing the medicines of tomorrow.
Join us in developing treatments, finding cures, and pioneering the path from lab to life while championing patients every step of the way.
Learn more at https://www.jnj.com/innovative-medicine
Position Summary
The Principal Scientific Data Scientist will lead the design, implementation, and evolution of scientific data products and integration strategies supporting AI-enabled drug discovery and development.
This individual will be responsible for creating scalable, interoperable, and AI-ready data products that connect discovery, preclinical, clinical, safety, and real-world evidence domains, and enable the creation of validated-biomarker data assets . The role will establish the data architecture, integration strategy, metadata framework, and productization approach needed to support semantic reasoning, knowledge graphs, GraphRAG, advanced analytics, and agentic AI applications.
Working closely with scientific stakeholders, knowledge architects, AI engineers, and Amazon BioDiscovery platform teams, this individual will define the future-state scientific data ecosystem and ensure high-quality data products are delivered to support translational science and patient safety initiatives.
Build AI reasoning models to support data-driven translational safety decision making.
Mission
Build and operationalize AI-ready scientific data products that enable seamless integration, harmonization, and reuse of data across the drug discovery and development lifecycle.
Key Responsibilities
Scientific Data Product Strategy
Define and execute a scientific data product strategy supporting:
- Discovery Research
- Translational Science
- Preclinical Safety
- Clinical Development
- Pharmacovigilance
- Real-World Evidence
- Establish reusable, scalable data products that support analytics, AI, knowledge graph, and scientific reasoning use cases.
- Develop product roadmaps aligned with organizational priorities and scientific objectives.
Data Integration Architecture
- Design integration frameworks connecting heterogeneous scientific data sources.
- Define data harmonization strategies spanning:
- SEND
- SDTM
- ADaM
- MedDRA
- Imaging
- Omics
- Biomarker
- Pathology
- Real-world data
- Create architecture patterns supporting cross-domain data interoperability.
Digital Platform Leadership
- Define the implementation strategy for scientific data products deployed on AWS
- Partner with Amazon engineering and deployed platform resources to deliver scalable data pipelines and data products.
- Provide technical leadership and architectural oversight for implementation activities aligned recommendations from the Data Strategy group.
- Ensure digital solutions align with enterprise architecture, security, governance, and AI-readiness requirements.
Data Product Development
- In collaboration with Data Strategy group, lead design and implementation of:
- Curated datasets
- Semantic-ready data products
- Feature stores
- Metadata products
- Scientific data services
- AI-ready data assets
- Establish reusable patterns for data onboarding, transformation, validation, and publication.
Data Quality & Metadata
- Define metadata standards and data quality frameworks.
- Implement lineage, provenance, traceability, and FAIR data principles.
- Establish monitoring and quality controls for scientific data products.
Data Analysis:
- Build predictive AIML models to support translational safety decision making.
Stakeholder Engagement
- Partner with:
- Discovery Scientists
- Toxicologists
- Clinical Scientists
- Safety Scientists
- Data Scientists and Data Strategy business partners.
- Knowledge Architects
- AI Engineers
- Translate scientific questions into scalable data products and technical solutions.
Required Qualifications
Education
- Master’s or PhD in:
- Computer Science
- Data Engineering
- Bioinformatics
- Biomedical Informatics
- Information Systems
- Computational Biology
- Related scientific discipline
Experience
- 5+ years of experience in scientific data engineering, data architecture, data products, or life sciences informatics.
- Demonstrated experience designing and delivering enterprise-scale scientific data products.
- Experience supporting drug discovery, development, clinical research, or pharmacovigilance organizations.
- Experience developing predictive models in drug discovery, development, clinical research, or pharmacovigilance organizations.
Technical Expertise
Strong expertise in:
- Data architecture
- Data modeling
- Data product design
- Cloud-native data platforms
- Metadata management
- Data governance
- Predictive model development
Experience with:
- AWS-based data platforms
- Data lakes and lakehouses
- Distributed data processing
- APIs and data services
- Data cataloging and lineage solutions
Scientific Data Standards
Strong familiarity with:
Preferred familiarity with:
- FHIR
- OMOP
- DICOM
- Biomarker and omics data standards
Preferred Qualifications
- Experience supporting knowledge graphs, semantic architectures, or GraphRAG initiatives.
- Experience building AI-ready data products and feature stores.
- Familiarity with ontology-driven data integration approaches.
- Experience partnering with cloud providers or external platform teams.
- Experience operating in highly regulated scientific environments.
Leadership Competencies
- Strategic thinker capable of defining long-term data product roadmaps.
- Strong communicator who can bridge scientific and technical communities.
- Ability to influence cross-functional teams without direct authority.
- Strong execution focus with a bias toward scalable, reusable solutions.
- Passion for transforming biomedical R&D through data, AI, and modern engineering practices.