눈치 빠르게 회의에 치고 들어오는 슬랙봇의 역대급 업데이트, Claude Tag
눈치 빠르게 회의에 치고 들어오는 슬랙봇의 역대급 업데이트, Claude Tag
- 슬랙의 클로드 봇이 단순 질의응답을 넘어 여러 명이 떠드는 스페이스에서 협업하고 능동적으로 참견하는 기능이 생겨.
- 가만히 시키는 일만 하는 게 아니라, 대화 흐름을 보다가 먼저 의견을 내거나 프로젝트를 영구적으로 기억해 줘.
- 팀 회의할 때 숟가락 얹고 일 배분해 주는 무서운 AI 팀원이 한 명 들어온 셈이야.
비싼 LLM 안 거치고 초고속으로 프롬프트 길 찾아주는 오픈소스 라우터
- LLM을 호출하는 데 드는 비용과 대기 시간 없이 가볍게 프롬프트를 라우팅해주는 Wayfinder 프로젝트야.
- 개발자가 직접 깃허브에 구현 방식을 오픈소스로 정리해서 올린 거라 참고하기 좋아.
- AI 파이프라인에서 불필요한 LLM 호출을 줄여 돈과 속도를 모두 아끼고 싶다면 필수야.
성능은 그대로, 전기세는 다이어트! 친환경 LLM 서빙 엔진 VoltanaLLM
- AI 운영비용의 주범인 GPU 전력 소모를 획기적으로 아끼기 위해 개발된 VoltanaLLM 프로젝트야.
- 추론 요청의 부하와 모델의 특성을 동적으로 분석해 에너지를 덜 쓰는 서빙 스케줄링을 가동해.
- 친환경 ESG 트렌드와 서버 인프라 운영비라는 두 가지 현실적 고민을 해결하는 기술적 해법이네.
벤치마크 테스트 보기도 전에 내 LLM이 몇 점 맞을지 찍어 맞추는 기술
- 테스트를 직접 다 돌려보지 않고도 특정 모델이 해당 벤치마크에서 몇 점을 기록할지 예측하는 BenchPress 프로젝트야.
- 평가 비용을 획기적으로 줄이고, 모델의 성향과 한계를 사전 매핑해볼 수 있는 신기술이야.
- 새 모델 훈련할 때 벤치마크 비용 때문에 텅장되는 연구실이나 스타트업에 한줄기 빛이 될 듯.
아무리 뛰어난 AI 비서라도 쓸 도구를 못 찾으면 무쓸모! DataRobot의 새로운 시도
- DataRobot의 에이전트 스킬들과 MCP 도구들이 이제 '에이전트 자원 발견(ARD) 규격'을 지원하게 되었어.
- 개발자나 외부 AI 서비스가 우리 에이전트가 가진 특수 기능(스킬)을 헤매지 않고 쉽게 찾아 쓸 수 있어.
- 도구 활용 범위가 대폭 확장되어 비즈니스 시스템 전반의 연동 효율이 비약적으로 올라갈 거야.
소개팅 앱에서 무슨 말 할지 고민돼? 캡처 한 장이면 답장 짜주는 Rizz 비서
- 틴더나 DM 캡처 화면을 올리면 상황에 딱 맞는 멘트를 추천해 주는 인공지능 연애 조력자 Tchatcheur 서비스야.
- 섹시, 솔직, 부드러움 등 원하는 톤앤매너만 고르면 10초 만에 자연스러운 답장을 복사할 수 있어.
- 키보드 앞에서 식은땀 흘리거나 읽씹당할까 봐 덜덜 떨 필요 없이 쿨하게 복붙해서 넘기자구.
텍스트와 이미지 몇 장 툭 던지면 3D 그래픽 모델링 뽑아주는 AI
- 웹 브라우저에서 바로 작동해 프롬프트나 참조 사진 한 장으로 3D 에셋 초안을 뽑아주는 Next3D 야.
- 게임 개발자나 이커머스 비주얼 제작자들이 아이디어를 시각화하고 프로토타입 만드는 시간을 아껴줘.
- 초반 러프 스케치 단계에서 빠르게 여러 시안을 테스트하기에는 이만한 게 없는 듯.
맥미니 없이 2.99달러로 24시간 돌아가는 나만의 자율 AI 비서 VPS
- 인기 오픈소스 에이전트 OpenClaw와 Hermes를 텔레그램, 디스코드 등과 상시 연동해주는 managed 호스팅 서비스야.
- 프로모션 기간 동안 GPT-5 라인업과 딥시크 V3.2 등 최신 프런티어 모델의 API 호출이 요금제에 기본 탑재돼 있어.
- 컨테이너 보안과 자동 업데이트, 장애 모니터링까지 월 3천 원도 안 되는 가격에 다 해결해 주니 개꿀이지.
식물 킬러들을 위한 구원투수! 사진 한 장으로 끝내는 AI 식물 도감
- 죽어가는 집안 식물이 고민이라면 사진 찍어 올리기만 하면 식물 이름과 케어 꿀팁을 주는 Plant Identify를 써봐.
- 필요한 물의 양, 일조량, 흙 종류는 물론이고 잎이 노래지는 등의 상태 이상 진단까지 한 번에 해줘.
- 귀찮은 가입이나 가입 유도 없이 직관적이고 빠르게 화초 상태를 체크할 수 있어 편해.
사람 검색 평가자 대신 똑똑한 LLM 판사로 검색 랭킹 품질 매기기
- 전통적인 검색 순위 평가 지표인 NDCG를 LLM 판사의 판단을 활용해 측정하는 신박한 방법론이야.
- 비싸고 속도가 느린 인간 평가 대신 LLM에게 검색 결과의 연관성을 판단하게 해서 빠른 피드백 루프를 만들어.
- 검색 서비스 운영자라면 비용과 시간 효율을 극대화할 수 있는 좋은 아키텍처적 팁이 될 거야.
인공지능이 과연 시스템 해킹까지 마스터할 수 있을까? 실전 CTF 벤치마크
- NeurIPS와 실제 해킹 대회 데이터로 만든 LLM-CTF 벤치마크 데이터셋 2,639개가 캐글에 공개됐어.
- AI 모델이 실제 복잡한 가상 환경을 분석하고 보안 취약점을 뚫는 능력이 얼마나 되는지 정밀 측정할 수 있어.
- 보안 위협 대응과 AI 에이전트의 공격성 테스트를 위한 좋은 기준표가 되겠네.
추론 연산량을 더 많이 때려 박을수록 프런티어 모델 평가가 흔들린다
- 추론 시점의 연산 크기(Inference Compute)가 최신 거대 언어 모델 성능 평가를 어떻게 바꾸는지 다룬 논문이야.
- 단순 지식 저장량을 넘어 연산력을 쏟았을 때 나오는 논리적 깊이를 측정하는 평가 모델이 화두가 되고 있어.
- 앞으로 모델 벤치마크는 학습 규모뿐만 아니라 추론 시 생각하는 시간도 같이 재야 공정할 듯.
엔비디아와 데이터브릭스가 손잡고 만든 신약 개발 쾌속 플랫폼
- 바이오 의학 분야 인공지능 연구를 가속화하기 위한 'Genesis Workbench' 블루프린트가 발표됐어.
- 데이터브릭스의 데이터 레이크하우스 위에 엔비디아의 GPU 가속 알고리즘을 얹어 신약 후보 물질 발굴을 돕는 구조야.
- 보안이 보장된 인하우스 환경에서 대규모 생명과학 데이터를 마음껏 주무를 수 있게 됐어.
LLM 채점관끼리 동의하는지 보는 것보다 더 정확한 평가지표는?
- LLM 심판들의 신뢰성을 측정할 때, 단순 합의율보다 '자신감 추정치'가 훨씬 더 정교한 메트릭이라는 연구 결과야.
- 모델이 얼마나 확신을 가지고 답을 채점했는지를 파악해 모호한 평가 영역을 보정해줘.
- 점점 더 복잡해지는 생성 AI 성능 평가의 기준점을 한 단계 끌어올릴 수 있을 듯.
양자컴퓨터가 해킹하기 전에 암호 바꾸라는 백악관의 경고장
- 미국 정부가 2030년까지 공공 부문의 포스트 양자 암호(PQC) 마이그레이션 기한을 박아버렸어.
- Cloudflare가 이 새로운 행정명령의 의의와 기업들이 당장 취해야 할 대비책 플레이북을 배포했어.
- 양자 컴퓨터 시대가 오면 기존 암호 체계는 종잇장이 되니 지금부터 체질 개선에 나서야 해.
무거운 LLM 안 쓰고도 프롬프트를 정확한 타겟으로 보내는 법
- LLM을 호출하는 데 드는 비용과 대기 시간 없이 가볍게 프롬프트를 라우팅해주는 Wayfinder 프로젝트야.
- 간단하고 빠른 패턴 매칭과 룰 기반으로 에이전트의 워크플로우 효율을 올려줘.
- AI 파이프라인에서 불필요한 LLM 호출을 줄여 돈과 속도를 모두 아끼고 싶다면 필수야.
키보드 잡기 전에 수학부터 책 덮고 마스터해야 하는 이유
- 데이터 사이언티스트 지망생이 코딩 첫 줄을 짜기 전에 무조건 알아야 하는 필수 수학 분야 정리야.
- 각 수학 이론이 왜 데이터 분석과 머신러닝에 쓰이는지 본질적인 이유를 조목조목 알려줘.
- 기초가 부실하면 결국 모래성을 쌓는 꼴이니 오늘부터 효율적인 수학 공부 경로를 밟아봐.
3년 묵은 면역학 난제를 며칠 만에 풀어버린 GPT-5의 위력
- 면역학자 데리아 우누트마즈 박사가 GPT-5 Pro의 도움으로 3년간 풀지 못했던 T세포의 비밀을 풀었어.
- 암 연구와 자가면역질환 치료 연구에 결정적인 돌파구를 제시할 수 있는 발견이야.
- AI가 단순 코딩을 넘어 인류의 생명 과학적 난제를 해결하는 조력자로 진화했음을 증명했어.
환자 데이터 유출 걱정 없는 멀티테넌시 의료 AI 설계법
- Amazon Bedrock AgentCore를 활용해서 인프라는 공유하되 고객사는 철저히 격리하는 풀 모델 멀티테넌시 구현법이야.
- 여러 병원과 클리닉을 지원하는 헬스케어 AI 에이전트를 예시로 들어 실제 프로덕션 패턴을 설명하고 있어.
- 보안과 비용 효율이라는 두 마리 토끼를 동시에 잡고 싶은 아키텍트라면 반드시 눈여겨봐야 해.
원하는 AI 스킬 알아서 쏙쏙! DataRobot 에이전트 검색 스펙 공식 지원
- DataRobot이 에이전트 자원 발견 스펙(ARD)을 지원하면서 에이전트 스킬과 MCP 검색이 더 쉬워졌어.
- 아무리 똑똑한 에이전트도 필요한 도구(Tool)를 직접 찾지 못하면 손발이 묶인 것과 같잖아.
- 개발자나 클라이언트 시스템이 엔터프라이즈 전반에 깔린 AI 기능들을 훨씬 효율적으로 찾고 연동할 수 있어.
소개팅 앱 읽씹 방지! 스크린샷만 올리면 대신 답장 써주는 AI 리즈 어플
- Tinder나 Hinge 대화창 스크린샷을 찍어 올리면 10초 만에 힙한 답장 멘트를 생성해주는 챗봇 앱이야.
- 원하는 무드(Hot, Honest, Smooth)를 고르면 AI 냄새 안 나고 자연스러운 말투로 골라 써줘.
- 선톡 보내기 두렵거나 할 말 없어서 키보드만 노려보던 연애 고자들에게 한 줄기 빛이 될 듯.
글자만 쓰면 3D 모델이 뚝딱! 게임 에셋 기획자용 웹 AI 발전 수준
- 텍스트 프롬프트나 참고용 이미지를 넣으면 브라우저에서 바로 3D 에셋 초기 콘셉트를 뽑아주는 Next3D야.
- 게임 디자인, 이커머스 목업, 프로토타입 만들 때 아이디어 비교와 초안 작성이 훨씬 빨라질 듯.
- 3D 맥스나 블렌더 잡기 전에 가볍게 시안 쳐보는 용도로 쓰기 딱 좋겠어.
월 3달러로 24시간 켜져 있는 AI 에이전트 전용 클라우드 'PrimeClaws VPS'
- 가장 인기 있는 오픈소스 에이전트인 OpenClaw나 Hermes를 배포해주는 AI 에이전트 호스팅 서비스야.
- 맥미니나 복잡한 리눅스 서버 직접 세팅할 필요 없이 60초 만에 텔레그램이나 디스코드에 연결해줘.
- 지금 가입하면 GPT-5.4나 Deepseek 최신 모델 API 사용료가 무료로 포함되어 있다니 개이득이지.
초보 식집사 필수템! 사진 한 장으로 식물 이름부터 처방전까지 알려주는 AI
- Plant Identify는 식물, 꽃, 잎 사진을 찍어 올리면 바로 이름과 관리 가이드를 뽑아주는 웹 도구야.
- 물주기, 채광 정보는 물론이고 잎이 왜 누렇게 변하는지 같은 병해충 진단까지 해줘.
- 화분 사놓고 매번 죽이던 똥손 식집사라면 지금 당장 북마크 해두고 써보길 바래.
검색 결과 만족도 평가, 비싼 사람 대신 LLM Judged NDCG로 자동 측정하기
- 검색 랭킹 품질을 평가할 때 널리 쓰이는 NDCG 지표를 LLM 판사로 자동 측정하는 방법론이 공유됐어.
- 수작업으로 하던 레이블링 작업을 자동화하니까 비용은 줄고 평가 주기는 대폭 빨라져.
- 검색 엔진이나 추천 시스템을 고도화하는 엔지니어들에겐 단비 같은 꿀팁인 듯해.
AI가 진짜 해킹을 할 수 있을까? NeurIPS 기반 LLM-CTF 벤치마크 공개
- AI가 보안 취약점을 뚫는 CTF(Capture The Flag) 해킹 대회를 얼마나 잘 수행하는지 측정하는 데이터셋이야.
- NeurIPS 대회와 자체 실험에서 뽑아낸 2,639개의 실제 데이터 포인트가 캐글에 업로드됐어.
- AI 에이전트의 오펜시브 보안(공격형 보안) 한계와 가능성을 제대로 검증해볼 기회네.
2만 1천 명 칼바람 정리해고... 오라클이 빚내서 AI에 몰빵하는 사연
- 오라클이 무려 21,000명의 대규모 레이오프(정리해고)를 단행했다는 충격적인 소식이야.
- 근데 이렇게 아낀 비용과 회사 채권 발행으로 낸 빚을 전부 AI 데이터 센터 건설에 쏟아붓고 있어.
- AI 시대 인프라 패권을 쥐기 위해 뼈를 깎고 빚까지 끌어다 쓰는 기업들의 살벌한 서바이벌 현장이야.
일치율 검사는 옛말, LLM 판사의 평가는 '신뢰도 추정치'가 훨씬 정확해
- LLM을 평가하는 판사 LLM들의 성능을 잴 때, 판사들 간의 합의율(Agreement)은 한계가 있대.
- 아카이브에 올라온 새 논문은 판사 LLM의 '신뢰도 추정치(Confidence)'를 쓰는 게 더 나은 메트릭이라고 주장해.
- LLM 평가 프로세스를 자동화하고 최적화하려는 AI 연구원들이 꼭 챙겨봐야 할 데이터야.
양자 컴퓨터가 암호 깨기 전에 서둘러라! 미 포스트 양자 행정명령 분석
- 미국에서 포스트 양자 암호 체계로의 전환 마감일을 2030년으로 박아버린 행정명령(EO)이 나왔어.
- 클라우드플레어가 이 법안의 의의와 아쉬운 점, 그리고 정부와 기업이 취해야 할 대응책을 정리했네.
- 양자 컴퓨터 시대의 암호 무력화 위협이 생각보다 가까이 다가왔다는 강력한 경고음이야.
LLM이 아예 앱을 환각해버린다고? 골 때리는 웹 프레임워크 Hallu
- Show HN에 올라온 Hallu는 LLM이 말 그대로 앱 전체를 환각(Hallucinate)해서 보여주는 프레임워크야.
- 정교한 프론트엔드 작업 없이 말 한마디로 작동하는 목업이나 임시 화면을 빠르게 찍어내기에 좋겠어.
- 프로토타이핑을 극한으로 빠르게 돌려보고 싶은 기획자나 해커톤 참가자들에게 아주 흥미로운 도구야.
코드 한 줄 쓰기 전에 수학부터 펴라! 데이터 과학자 필수 수학 로드맵
- 데이터 과학자가 되고 싶다면 코딩보다 기본적인 수학 개념을 먼저 마스터하는 게 순서야.
- 선형대수, 통계, 미적분 등 필수 수학 분야가 왜 중요하고 어떻게 쓰이는지 조목조목 짚어줘.
- 오늘부터 당장 시작할 수 있는 효율적인 수학 공부 경로를 친절하게 안내해주니 북마크 필수야.
환자 데이터 섞이면 끝장! Bedrock으로 안전하게 멀티테넌시 구현하는 법
- Amazon Bedrock AgentCore를 써서 인프라는 공유하면서 테넌트는 확실하게 격리하는 풀(Pool) 모델 패턴이야.
- 여러 병원과 클리닉을 지원하는 헬스케어 AI 에이전트 예시로 실제 구현 방법을 보여줘.
- 성능과 보안 둘 다 잡아야 하는 하이퍼스케일 서비스 빌더들에게 꽤나 쏠쏠한 팁이 될 듯해.
2만 명 넘게 내쫓고 AI 데이터 센터 짓는 오라클의 눈물겨운 빚투
- 오라클이 대규모 해고를 단행해 인건비를 아끼는 동시에 빚까지 내가며 AI 인프라에 올인하고 있어.
- 빅테크들의 AI 치킨게임에서 밀리지 않으려고 몸집을 줄이고 인프라에 영끌 투자를 감행하는 셈이지.
- 기업의 체질 개선이 노동자들에게는 피바람으로 다가온 씁쓸한 현실을 보여주네.
추론할 때 돈을 얼마나 쏟아붓느냐가 미래 LLM 평가의 핵심이다
- AI 모델이 아무리 좋아도 추론 시점(Inference-time)에 계산 자원을 넉넉히 주는 게 성능을 결정한다는 분석이야.
- 프론티어 모델의 능력을 테스트할 때 단순히 가중치 크기만 볼 게 아니라 실시간 투입 연산량을 따져야 해.
- 앞으로 더 똑똑한 답을 얻기 위해 실시간으로 서버 비용을 더 태우는 구조가 대세가 될 거야.
신약 개발 속도 높이려 엔비디아와 데이터브릭스가 손을 잡았다
- 생명과학 기업들이 막대한 유전체 데이터와 임상 데이터를 다룰 수 있는 전용 플랫폼 '제네시스 워크벤치'를 공개했어.
- 엔비디아의 강력한 GPU 가속과 데이터브릭스의 레이크하우스 아키텍처가 융합된 결과물이야.
- 실험실에서 몇 년 걸리던 신약 후보 물질 발굴을 며칠 만에 끝내버릴 기세네.
AI 평가할 때 다른 AI랑 합의했는지만 보면 호구 되는 이유
- 보통 LLM 성능을 다른 LLM 심판에게 맡길 때 서로 의견이 일치하는지(Agreement)를 많이 보잖아.
- 근데 연구 결과, 합의율보다는 AI가 스스로 내린 판단의 '확신 신뢰도'를 측정하는 게 훨씬 정확하대.
- LLM 평가 지표의 패러다임이 또 한 번 업그레이드될 신호탄인 셈이야.
양자 컴퓨터가 암호 다 깨부수기 전에 국가 기관들 비상 걸렸다
- 미국에서 포스트 양자 암호 마이그레이션 기한을 2030년으로 박아 넣은 행정명령이 떨어졌어.
- 지금 쓰는 암호 체계가 양자 컴퓨터 앞에서 무용지물이 되기 전에 빨리 짐 싸서 이동하라는 경고야.
- 정부뿐만 아니라 보안을 다루는 민간 기업들도 발 빠르게 마이그레이션 가이드를 짜야 할 때야.
AI 환각을 역이용해서 웹 앱을 뚝딱 만들어내는 골 때리는 프레임워크
- 환각(Hallucination)을 단점이 아니라 기능으로 승화시킨 신박한 웹 프레임워크 'Hallu'가 눈길을 끄네.
- 대충 아이디어만 주면 LLM이 상상해서 즉석에서 작동하는 앱을 구현해 줘.
- 진지한 프로덕션용은 아니겠지만 프로토타입 낙서장으로는 아주 재밌을 듯해.
내 프롬프트 훔쳐볼까 걱정 없는 암호화 LLM 마켓플레이스 등장
- LLM에 질문할 때 민감한 프라이버시가 유출될까 봐 찝찝했던 적 많았지?
- Charon은 종단간(End-to-End) 암호화를 적용해서 서버조차 내용을 볼 수 없는 블라인드 추론 마켓이야.
- 보안이 극도로 중요한 기업이나 기관들에게 꽤나 매력적인 대안이 될 것 같아.
또 다른 무거운 LLM 쓰지 않고 가볍게 프롬프트 길 찾아주는 라우터
- 들어온 프롬프트를 처리할 때 어떤 모델로 보낼지 결정하려고 또 다른 LLM을 쓰면 비용이 너무 비싸지.
- Wayfinder는 더 빠르고 가벼운 방식으로 프롬프트 라우팅을 해결해 주는 기특한 오픈소스 도구야.
- AI 서비스 운영 효율을 쥐어짜고 싶은 개발자라면 깃허브 오픈소스 바로 털어봐.
혼자 북 치고 장구 치는 여러 AI 에이전트 작업 공간, Compilr.dev 출시
- 라이브러리부터 CLI, 데스크톱 앱까지 한 번에 다 갖춘 진정한 멀티 에이전트 생태계가 나왔어.
- 에이전트끼리 서로 질문하고 업무를 넘겨주는 유기적인 협업이 가능한 게 특징이야.
- 특히 컨텍스트 요약이나 필요한 스킬만 로딩하는 방식으로 지갑 털리는 토큰 낭비를 꽉 잡았대.
코딩 첫 줄 떼기 전에 수학부터 안 해두면 무조건 후회한다
- 데이터 사이언티스트 꿈나무들이 코딩 공부만 하다가 막판에 다들 수학에서 무너지더라고.
- 선형대수, 통계, 확률 같은 필수 수학 이론이 왜 필요한지 뼈 때리게 설명해 줘.
- 기본기 탄탄하게 다지고 싶은 입문자라면 추천하는 로드맵이야.
면역학자들이 3년 동안 머리 싸맨 난제, GPT-5가 단숨에 해결했다
- 유명 면역학자 데리아 우누트마즈가 3년간 풀지 못했던 T세포의 비밀을 GPT-5 Pro 도움으로 풀었대.
- 단순한 글쓰기 비서가 아니라 진짜 과학 연구 파트너로 진화한 걸 증명한 셈이지.
- 앞으로 암이나 자가면역질환 신약 개발 속도가 엄청나게 빨라질 것 같아.
단백질 연구도 이제 말만 하면 AI가 다 찾아준다
- 자연어로 대충 질문해도 찰떡같이 쿼리를 짜서 단백질 데이터베이스를 털어주는 코파일럿 빌드 가이드야.
- 벡터 유사도 검색이랑 AI 요약 기술을 섞어서 연구 효율을 극대화했더라고.
- 생명과학 연구원들의 야근을 획기적으로 줄여줄 비장의 무기가 될 듯해.
서로 다른 환자 정보가 섞인다면? Bedrock의 보안 비밀
- 여러 병원이 Amazon Bedrock AgentCore의 공유 인프라를 같이 쓰는데도 데이터가 안 섞이게 하는 멀티 테넌트 기술이야.
- 헬스케어 AI 에이전트 사례로 환자 데이터 유출을 막는 보안 격리 패턴을 구체적으로 보여주네.
- 인프라 비용은 대폭 아끼면서도 환자 정보 같은 초민감 데이터의 독립성은 철저하게 보장하는 게 핵심인 듯!