<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>PySpark on Thedduro</title><link>https://thedduro.github.io/tags/pyspark/</link><description>Recent content in PySpark on Thedduro</description><generator>Hugo</generator><language>ko-kr</language><lastBuildDate>Mon, 21 Sep 2026 14:22:11 +0900</lastBuildDate><atom:link href="https://thedduro.github.io/tags/pyspark/index.xml" rel="self" type="application/rss+xml"/><item><title>Spark cache(), 어디에 붙여야 효과가 있을까?</title><link>https://thedduro.github.io/posts/spark-cache-when-to-use/</link><pubDate>Mon, 21 Sep 2026 14:22:11 +0900</pubDate><guid>https://thedduro.github.io/posts/spark-cache-when-to-use/</guid><description>&lt;p&gt;API 요청 로그에서 잘못된 데이터를 걸러냈다. 이제 유효한 요청이 몇 건인지 세고, 경로별 평균 응답 시간도 구하려고 한다. 전처리한 DataFrame 하나를 두 작업에서 사용하면 되니, 전처리도 한 번만 실행될 것처럼 보인다.&lt;/p&gt;</description></item></channel></rss>