Попалась подборка open source инструментов, делюсь: SQLFluff (github.com/sqlfluff/sqlfluff). Линтер и форматтер для SQL, самый звёздный на GitHub в своей категории. Ловит кривой SQL до продакшена: стиль, синтаксис, дрейф схемы. Ставится pre-commit хуком или в CI/CD рядом с dbt, понимает диалекты Spark SQL и Databricks. Скучный инструмент, который экономит нескучные часы код-ревью. Splink (github.com/moj-analytical-services/splink). Entity resolution: дедупликация и связывание записей, у которых нет общего идентификатора. Вероятностный матчинг без размеченных данных, миллион записей на обычном ноутбуке примерно за минуту. Локально работает на DuckDB, на сотнях миллионов записей масштабируется на Spark или Athena. Отдельно радует происхождение: инструмент сделали аналитики британского Министерства юстиции. Apache DataFusion (datafusion.apache.org). Query engine на Rust поверх Apache Arrow. Ключевое слово - модульность: его встраивают в свои продукты как движок исполнения запросов, вместо того чтобы тащить целую платформу. Именно на таких движках сейчас собирают лёгкие альтернативы Spark. Sail (github.com/lakehq/sail), Rust-замена Spark с совместимостью на уровне протокола, и вечные DuckDB (duckdb.org) с Polars (pola.rs), которые все знают и мало кто использует всерьёз.