geochemistrypi.data_mining package¶
Subpackages¶
- geochemistrypi.data_mining.data package
- Submodules
- geochemistrypi.data_mining.data.data_readiness module
- geochemistrypi.data_mining.data.feature_engineering module
- geochemistrypi.data_mining.data.imputation module
- geochemistrypi.data_mining.data.inference module
- geochemistrypi.data_mining.data.preprocessing module
- geochemistrypi.data_mining.data.statistic module
- Module contents
- geochemistrypi.data_mining.model package
- Subpackages
- Submodules
- geochemistrypi.data_mining.model.classification module
AdaBoostClassificationClassificationWorkflowBaseClassificationWorkflowBase.auto_best_configClassificationWorkflowBase.auto_modelClassificationWorkflowBase.common_componentsClassificationWorkflowBase.common_functionClassificationWorkflowBase.customizationClassificationWorkflowBase.customize_label()ClassificationWorkflowBase.fitClassificationWorkflowBase.manual_hyper_parameters()ClassificationWorkflowBase.predictClassificationWorkflowBase.sample_balance()ClassificationWorkflowBase.settings
DecisionTreeClassificationExtraTreesClassificationGradientBoostingClassificationKNNClassificationLogisticRegressionClassificationMLPClassificationRandomForestClassificationSGDClassificationSVMClassificationXGBoostClassification
- geochemistrypi.data_mining.model.clustering module
- geochemistrypi.data_mining.model.decomposition module
- geochemistrypi.data_mining.model.detection module
- geochemistrypi.data_mining.model.regression module
BayesianRidgeRegressionClassicalLinearRegressionDecisionTreeRegressionElasticNetRegressionExtraTreesRegressionGradientBoostingRegressionKNNRegressionLassoRegressionMLPRegressionPolynomialRegressionRandomForestRegressionRegressionWorkflowBaseRegressionWorkflowBase.auto_best_configRegressionWorkflowBase.auto_modelRegressionWorkflowBase.common_componentsRegressionWorkflowBase.common_functionRegressionWorkflowBase.customizationRegressionWorkflowBase.fitRegressionWorkflowBase.manual_hyper_parameters()RegressionWorkflowBase.predictRegressionWorkflowBase.ray_tune()RegressionWorkflowBase.settings
RidgeRegressionSGDRegressionSVMRegressionXGBoostRegression
- Module contents
- geochemistrypi.data_mining.plot package
- Submodules
- geochemistrypi.data_mining.plot.geochemistry_plot module
- geochemistrypi.data_mining.plot.map_plot module
- geochemistrypi.data_mining.plot.statistic_plot module
- Module contents
- geochemistrypi.data_mining.process package
- Submodules
- geochemistrypi.data_mining.process.classify module
- geochemistrypi.data_mining.process.cluster module
- geochemistrypi.data_mining.process.decompose module
- geochemistrypi.data_mining.process.detect module
- geochemistrypi.data_mining.process.regress module
- geochemistrypi.data_mining.process.time_series module
- Module contents
- geochemistrypi.data_mining.tests package
- Subpackages
- Submodules
- geochemistrypi.data_mining.tests.test_aggregate module
- geochemistrypi.data_mining.tests.test_cli_automation module
- geochemistrypi.data_mining.tests.test_cli_capability_manifest module
- geochemistrypi.data_mining.tests.test_dataset_catalog module
- geochemistrypi.data_mining.tests.test_decomposition module
- geochemistrypi.data_mining.tests.test_detection module
- geochemistrypi.data_mining.tests.test_inference module
- geochemistrypi.data_mining.tests.test_multiclass_regressions module
- geochemistrypi.data_mining.tests.test_time_series module
- geochemistrypi.data_mining.tests.test_tracking_store module
- geochemistrypi.data_mining.tests.test_world_map module
- Module contents
- geochemistrypi.data_mining.utils package
Submodules¶
geochemistrypi.data_mining.aggregate module¶
Durable parent/child result metadata for the public all-models workflow.
- child_result(parent_directory: Path, model: str, child_directory: Path, state: str, error: str | None = None) Dict[str, Any][source]¶
geochemistrypi.data_mining.cli_pipeline module¶
- cli_pipeline(training_data_path: str, application_data_path: str | None = None, data_source: DataSource | None = None, world_map_configuration: WorldMapConfiguration | None = None, tracking_root: str | None = None, existing_experiment_id: str | None = None) None[source]¶
The command line interface software for Geochemistry Pi. The business logic of this CLI software can be found in the figures in the README.md file. It provides three MLOps core functionalities:
Continuous Training
Machine Learning Lifecycle Management
Model Inference
- Parameters:
training_data_path (str) – The path of the training data.
application_data_path (str, optional) – The path of the application data, by default None
geochemistrypi.data_mining.constants module¶
geochemistrypi.data_mining.dash_pipeline module¶
geochemistrypi.data_mining.datasets module¶
Read-only discovery metadata for built-in and Desktop CLI datasets.
- exception DatasetCatalogError[source]¶
Bases:
RuntimeErrorRaised when dataset discovery cannot produce trustworthy metadata.
geochemistrypi.data_mining.enum_ module¶
- class DataSource(value)[source]¶
Bases:
EnumAn enumeration.
- ANY_PATH = 'Any Path'¶
- BUILT_IN = 'Built-in'¶
- DESKTOP = 'Desktop'¶
geochemistrypi.data_mining.router module¶
- async delete_dataset(dataset_id: int, current_user=Depends(dependency=<function get_current_active_user>, use_cache=True, scope=None), db=Depends(dependency=<function get_db>, use_cache=True, scope=None))[source]¶
- async get_all_datasets(current_user=Depends(dependency=<function get_current_active_user>, use_cache=True, scope=None), db=Depends(dependency=<function get_db>, use_cache=True, scope=None))[source]¶
- get_all_datasets_open(db=Depends(dependency=<function get_db>, use_cache=True, scope=None))[source]¶
- async get_basic_datasets_info(current_user=Depends(dependency=<function get_current_active_user>, use_cache=True, scope=None), db=Depends(dependency=<function get_db>, use_cache=True, scope=None))[source]¶
- async get_dataset(dataset_id: int, current_user=Depends(dependency=<function get_current_active_user>, use_cache=True, scope=None), db=Depends(dependency=<function get_db>, use_cache=True, scope=None))[source]¶
geochemistrypi.data_mining.run_time_series module¶
Production CLI orchestration for reproducible Time Series analysis.
- load_time_series_data(input_path: Path, sheet: str = '0') DataFrame[source]¶
Load only the two public dataset formats without guessing legacy Excel.
- main(argv: list | None = None) None[source]¶
Backward-compatible module runner delegating to the production workflow.
- run_time_series_analysis(input_path: Path, output_root: Path, experiment_name: str, run_name: str, bin_width: float, iterations: int = 100, seed: int = 2025, sheet: str = '0', age_col: str = 'R_AGE', age_max_col: str = 'R_MAX_AGE', probability_col: str = 'SBAP', latitude_col: str = 'LATITUDE', longitude_col: str = 'LONGITUDE', age_unit: str = 'Ma', fit_curve: bool = True) Path[source]¶
- run_time_series_dataframe(df: DataFrame, source_path: Path, output_root: Path, experiment_name: str, run_name: str, bin_width: float, iterations: int = 100, seed: int = 2025, age_col: str = 'R_AGE', age_max_col: str = 'R_MAX_AGE', probability_col: str = 'SBAP', latitude_col: str = 'LATITUDE', longitude_col: str = 'LONGITUDE', age_unit: str = 'Ma', fit_curve: bool = True) Path[source]¶
Run the shared validated numerical workflow and write standard outputs.
geochemistrypi.data_mining.schemas module¶
- class BasicDatasetInfo(*, id: int, name: str, sequence: int)[source]¶
Bases:
BaseModel- id: int¶
- name: str¶
- sequence: int¶
- class ClassificationRunRequest(*, dataset_id: int, target_column: str, model_name: str, label_mapping: LabelMappingConfig | None = None, metric_average: Literal['micro', 'macro', 'weighted'] | None = None)[source]¶
Bases:
BaseModel用于接收前端触发机器学习训练的请求体
- dataset_id: int¶
- label_mapping: LabelMappingConfig | None¶
- metric_average: Literal['micro', 'macro', 'weighted'] | None¶
- model_name: str¶
- target_column: str¶
- class Dataset(*, id: int, name: str | None = None, json_data: str | None = None, sequence: int | None = None, user_id: int | None = None, model_config: dict = {'from_attributes': True})[source]¶
Bases:
BaseModel- id: int¶
- json_data: str | None¶
- name: str | None¶
- sequence: int | None¶
- user_id: int | None¶
- class Diagram(*, id: int, name: str | None = None, image: bytes | None = None, dataset_id: int | None = None, model_config: dict = {'from_attributes': True})[source]¶
Bases:
BaseModel- dataset_id: int | None¶
- id: int¶
- image: bytes | None¶
- name: str | None¶
- class LabelMappingConfig(*, type: str, bins: List[float] | None = None, labels: List[str] | None = None, num_classes: int | None = None, mapping: Dict[str, str] | None = None)[source]¶
Bases:
BaseModel用于接收前端传来的多分类映射规则
- bins: List[float] | None¶
- labels: List[str] | None¶
- mapping: Dict[str, str] | None¶
- num_classes: int | None¶
- type: str¶