한때 클로드가 챗지피티에 비해 구라를 안치고 코딩을 만족스레 잘해줘서 믿고 맡기다가 토큰을 너무 박하게 줘서 팔방미인형 챗지피티로 갈아타고 플러스요금제로 지금껏 쓰고는 있습니다.
챗지피티 계속 쓰며 느낀건 신버전 나오면 이전에 잘 쓰던 모델이 곧 멍청해지더라구요.
아스트라 나오기 전에 5.6sol이 체감70점의 퍼포먼스를 보여줬다면 아스트라가 나와서 80점 정도 나은 퍼포먼스 내주면서 그 전 모델ㅣ5.6sol은 70점도 아닌 체감 60-65점 수준으로 답변이나 맥락 인지 퀄리티가 떨어지고, 그 후 어떠한 알고리즘에서인지 80점 나오던 신규 아스트라는 곧 70-75점 정도로 수렴하는 느낌입니다.
이 시점에서 결과적으로 70점 퍼포먼스 보여주던 5.6은 60~65점 수준이 되고 아스트라는 72~75점 정도 느낌?으로 토큰 비용은 상승으로 기존 플러스 구독자 입장에서 별볼일 없는 가격 재조정 느낌이 있습니다.
아스트라의 초반 80점의 퍼포먼스로 유인된 더 높은 요금제 사용자는 가능한 토큰 내에서 초반의 80점 수준이 유지되는지는 잘 모르겠습니다만 아마 되니까 비용 내고 사용하시겠죠?
재밌는건 오히려 무료버전 사용할때가 사용량 리셋만 문제 있었을뿐, 제 경우 퍼포먼스는 바로 전달에 쓰던 플러스 보다 무료버전이 더 괜찮다? 싶게 느낀적도 있습니다.
사용 시기마다 시간차나 개선도 있고,
무료 사용시에는 긴 맥락의 작업의 진행을 시도하지 않은 경향도 있을테니 모호하지만, 제가 운영을 하더라도 그리 설계 할 수 밖에 없을것 같습니다. 서비스 제공업체도 흙파서 장사하는게 아닐테니요.
근데 이 제 의도와 다르게 들쯕날쭉하게 느껴지는 퍼포먼스가 불편했습니다. 세션마다도 좀 시간대 별로? 튀어나오는 모델의 지능 차이가 있는것 같구요.
품질관리라는게 무조건 하이퍼포먼스가 아니라 조금 낮더라도 일관적인 퍼포먼스가 실사용에 중요한데 그게 중구난방이니 비전공 입장에서 너무 텐션 유지하여 사용하기가 어렵더라구요
그래서 서비스 제공자의 임의 조율이 제거된 로컬 llm을 쓰는게 어떨까해서 써봤는데 오픈로컬 모델은 qwen이 그나마 잘해주고 나머지 젬마, 라마, 뮤즈, 시드, 네모트론, 그라나이트..? 등도 mid-high로 써봤는데, 모델 크기 20-50기가 4-8비트, 양자화 Q4-8 수준에서 속도는 고사하고 판단 오류가 너무 많더군요.
정녕 로컬은 돈 바르지 않고는 답이 없는걸까요.
lm스튜디오 + 헤르메스로 하는데 좀 맨땅에 헤딩하고있는 느낌이 많이 듭니다.
그렇게 고군분투하며 시간 보내다보면 프론티어 클라우드 모델들이 문제 해결을 해서 나오더라구요. 그냥 얌전히 기다리고 있었어야했나 싶지만 당시 프론티어도 부족함이 항상 있기 때문에.
신박한 멀티플레이 모델이나 파이프 라인이 있었음 좋겠는데 찾아내도 얼마사용하다가 곧 개선된
모델 등장할테고. 나는 무슨역할을 하면 좋을까 고민하게되네요..
챗지피티 계속 쓰며 느낀건 신버전 나오면 이전에 잘 쓰던 모델이 곧 멍청해지더라구요.
아스트라 나오기 전에 5.6sol이 체감70점의 퍼포먼스를 보여줬다면 아스트라가 나와서 80점 정도 나은 퍼포먼스 내주면서 그 전 모델ㅣ5.6sol은 70점도 아닌 체감 60-65점 수준으로 답변이나 맥락 인지 퀄리티가 떨어지고, 그 후 어떠한 알고리즘에서인지 80점 나오던 신규 아스트라는 곧 70-75점 정도로 수렴하는 느낌입니다.
이 시점에서 결과적으로 70점 퍼포먼스 보여주던 5.6은 60~65점 수준이 되고 아스트라는 72~75점 정도 느낌?으로 토큰 비용은 상승으로 기존 플러스 구독자 입장에서 별볼일 없는 가격 재조정 느낌이 있습니다.
아스트라의 초반 80점의 퍼포먼스로 유인된 더 높은 요금제 사용자는 가능한 토큰 내에서 초반의 80점 수준이 유지되는지는 잘 모르겠습니다만 아마 되니까 비용 내고 사용하시겠죠?
재밌는건 오히려 무료버전 사용할때가 사용량 리셋만 문제 있었을뿐, 제 경우 퍼포먼스는 바로 전달에 쓰던 플러스 보다 무료버전이 더 괜찮다? 싶게 느낀적도 있습니다.
사용 시기마다 시간차나 개선도 있고,
무료 사용시에는 긴 맥락의 작업의 진행을 시도하지 않은 경향도 있을테니 모호하지만, 제가 운영을 하더라도 그리 설계 할 수 밖에 없을것 같습니다. 서비스 제공업체도 흙파서 장사하는게 아닐테니요.
근데 이 제 의도와 다르게 들쯕날쭉하게 느껴지는 퍼포먼스가 불편했습니다. 세션마다도 좀 시간대 별로? 튀어나오는 모델의 지능 차이가 있는것 같구요.
품질관리라는게 무조건 하이퍼포먼스가 아니라 조금 낮더라도 일관적인 퍼포먼스가 실사용에 중요한데 그게 중구난방이니 비전공 입장에서 너무 텐션 유지하여 사용하기가 어렵더라구요
그래서 서비스 제공자의 임의 조율이 제거된 로컬 llm을 쓰는게 어떨까해서 써봤는데 오픈로컬 모델은 qwen이 그나마 잘해주고 나머지 젬마, 라마, 뮤즈, 시드, 네모트론, 그라나이트..? 등도 mid-high로 써봤는데, 모델 크기 20-50기가 4-8비트, 양자화 Q4-8 수준에서 속도는 고사하고 판단 오류가 너무 많더군요.
정녕 로컬은 돈 바르지 않고는 답이 없는걸까요.
lm스튜디오 + 헤르메스로 하는데 좀 맨땅에 헤딩하고있는 느낌이 많이 듭니다.
그렇게 고군분투하며 시간 보내다보면 프론티어 클라우드 모델들이 문제 해결을 해서 나오더라구요. 그냥 얌전히 기다리고 있었어야했나 싶지만 당시 프론티어도 부족함이 항상 있기 때문에.
신박한 멀티플레이 모델이나 파이프 라인이 있었음 좋겠는데 찾아내도 얼마사용하다가 곧 개선된
모델 등장할테고. 나는 무슨역할을 하면 좋을까 고민하게되네요..
물론 산업 전반이 AI기반으로 전환되어 상용서비스들이 제가격 받기 시작한다면 달라지겠지만요.
밥값이 아무리 비싸진다한들, 내가 식재료 장보고 요리하여 원하는 식사 1회 하는것 보다 비용이 저렴할수밖에 없을테니.. 적당히 포기해야하려나 싶기도하네요